کشف الگوهای درآمد با پایتون؛ چگونه تحلیل دادههای سرشماری آمریکا میتواند به تصمیمگیری شغلی و اقتصادی کمک کند؟
در دنیای امروز، تصمیمگیریهای اقتصادی و شغلی دیگر تنها بر اساس حدس و تجربه انجام نمیشود. علم داده (Data Science) و تحلیل داده (Data Analytics) به ابزارهای کلیدی برای درک الگوهای درآمد، رفتار بازار کار و پیشبینی روندهای اقتصادی تبدیل شدهاند. یکی از مهمترین منابع داده برای چنین تحلیلهایی، دادههای سرشماری جمعیتی است که اطلاعات ارزشمندی درباره سن، تحصیلات، شغل، ساعات کاری و سطح درآمد ارائه میدهد.
در دوم خرداد ۱۴۰۵، مقالهای آموزشی توسط «مهنور جاوید» منتشر شد که نشان میداد چگونه میتوان با استفاده از زبان برنامهنویسی Python و کتابخانههای تحلیلی قدرتمند مانند Pandas، Matplotlib و Seaborn، الگوهای درآمدی را در دیتاست معروف Adult Census استخراج و تحلیل کرد. این تحلیل نمونهای کاربردی از فرآیند «تحلیل اکتشافی دادهها» یا Exploratory Data Analysis (EDA) محسوب میشود؛ مرحلهای حیاتی در پروژههای هوش مصنوعی و یادگیری ماشین.
چالش اصلی تحلیلگران داده: تبدیل داده خام به بینش قابل استفاده
بسیاری از فعالان حوزه علم داده با یک مشکل مشترک روبهرو هستند: حجم عظیمی از دادهها در دسترس است اما استخراج بینش (Insight) از آنها کار سادهای نیست. دادههای خام اغلب شامل مقادیر گمشده، ساختارهای نامنظم و ویژگیهای متنوع هستند که بدون پاکسازی و پیشپردازش قابل تحلیل نیستند.
در پروژه تحلیل دیتاست Adult Census نیز همین مسئله وجود داشت. این مجموعه داده که از پایگاه UCI Machine Learning Repository منتشر شده، شامل اطلاعات جمعیتی و شغلی افراد در ایالات متحده در دهه ۱۹۹۰ میلادی است. دادهها شامل ویژگیهایی مانند:
سن (Age)
نوع اشتغال (Workclass)
سطح تحصیلات (Education)
وضعیت تأهل (Marital Status)
شغل (Occupation)
جنسیت (Sex)
ساعات کاری در هفته (Hours per Week)
کشور محل تولد (Native Country)
و متغیر هدف یعنی سطح درآمد (Income)
است که معمولاً به دو دسته تقسیم میشود:
درآمد کمتر یا مساوی ۵۰ هزار دلار
درآمد بیشتر از ۵۰ هزار دلار
راهکار عملی: استفاده از اکوسیستم تحلیلی Python
یکی از مزیتهای مهم علم داده در سالهای اخیر، شکلگیری اکوسیستم قدرتمند ابزارهای متنباز در پایتون است. در این پروژه از سه کتابخانه کلیدی استفاده شد:
Pandas
کتابخانهای برای مدیریت و پردازش دادههای جدولی که امکان کار با فایلهای CSV، پاکسازی داده و انجام عملیات آماری را فراهم میکند.
Matplotlib
ابزار اصلی ترسیم نمودارها در پایتون که برای تولید انواع نمودارهای آماری و علمی استفاده میشود.
Seaborn
کتابخانهای مبتنی بر Matplotlib که برای مصورسازی پیشرفته دادهها (Data Visualization) و تولید نمودارهای تحلیلی زیباتر طراحی شده است.
برای نصب این ابزارها از دستور زیر استفاده شد:
pip install pandas matplotlib seaborn
مرحله اول: بارگذاری و بررسی اولیه دادهها
در اولین گام، دیتاست سرشماری در قالب یک DataFrame با استفاده از Pandas بارگذاری شد. بررسی اولیه دادهها شامل مشاهده پنج سطر اول (df.head)، بررسی ابعاد دیتاست (df.shape) و مشاهده نوع دادهها (df.info) بود.
این مرحله در پروژههای علم داده بسیار حیاتی است زیرا تحلیلگر باید قبل از هرگونه مدلسازی یا تحلیل آماری، ساختار دادهها را درک کند.
مرحله دوم: پاکسازی دادهها (Data Cleaning)
یکی از مشکلات رایج در دیتاستهای واقعی وجود دادههای گمشده است. در این پروژه مقادیر علامت سؤال (?) به عنوان دادههای نامشخص شناسایی شدند.
برای رفع این مشکل:
این مقادیر با NA جایگزین شدند
سپس ردیفهای دارای داده ناقص حذف شدند
پس از پاکسازی، تعداد رکوردها از ۳۲۵۶۱ به ۳۰۱۶۲ کاهش یافت.
این مرحله اهمیت بالایی در پروژههای یادگیری ماشین دارد زیرا دادههای ناقص میتوانند باعث ایجاد Bias در مدلهای تحلیلی شوند.
تحلیل توزیع درآمد
اولین تحلیل انجام شده بررسی توزیع کلی درآمد در دیتاست بود. با استفاده از نمودار Count Plot مشخص شد که اکثریت افراد در دسته درآمد کمتر از ۵۰ هزار دلار قرار دارند.
این موضوع نشاندهنده توزیع نامتوازن درآمد در جامعه مورد بررسی است؛ الگویی که در بسیاری از اقتصادهای دنیا مشاهده میشود.
تأثیر تحصیلات بر درآمد
یکی از مهمترین یافتههای تحلیل دادهها، ارتباط قوی بین سطح تحصیلات و میزان درآمد بود.
تحلیل گروهبندی (GroupBy) در Pandas نشان داد:
افراد دارای مدرک کارشناسی، کارشناسی ارشد و دکتری سهم بیشتری در گروه درآمد بالا دارند.
افراد با تحصیلات دبیرستان یا کمتر عمدتاً در دسته درآمد پایین قرار گرفتهاند.
مدارک حرفهای و تخصصی بیشترین نسبت درآمد بالاتر از ۵۰ هزار دلار را نشان میدهند.
این الگو به وضوح نقش «سرمایه انسانی» و تخصص را در افزایش درآمد نشان میدهد.
ارتباط ساعات کاری با درآمد
تحلیل نمودار Boxplot نشان داد افرادی که بیش از ۵۰ هزار دلار درآمد دارند، به طور میانگین ساعات کاری بیشتری در هفته دارند.
با این حال یک نکته مهم نیز مشاهده شد:
برخی افراد با وجود کار بیش از ۷۰ ساعت در هفته همچنان در دسته درآمد پایین قرار داشتند.
این یافته نشان میدهد که «تعداد ساعات کار» به تنهایی عامل تعیینکننده درآمد نیست و عوامل دیگری مانند مهارت، شغل و تجربه نیز نقش مهمی دارند.
شکاف درآمدی جنسیتی
تحلیل دادهها نشان داد تعداد مردانی که بیش از ۵۰ هزار دلار درآمد دارند به طور قابل توجهی بیشتر از زنان است.
اگرچه این تحلیل به تنهایی نمیتواند وجود تبعیض را اثبات کند، اما نشان میدهد در دهه ۱۹۹۰ تفاوت قابل توجهی در توزیع درآمد میان مردان و زنان وجود داشته است.
تأثیر نوع شغل بر درآمد
تحلیل شغلها نشان داد بیشترین افراد با درآمد بالا در دستههای زیر قرار دارند:
مدیران اجرایی (Executive Managerial)
متخصصان حرفهای (Professional Specialty)
مشاغل فنی و تخصصی
این نتیجه تأکید میکند که نوع شغل یکی از مهمترین متغیرهای پیشبینی درآمد در تحلیلهای دادهای است.
تأثیر سن و تجربه بر سطح درآمد
نمودار تحلیل سن نشان داد که افراد با درآمد بالاتر معمولاً سن بیشتری دارند.
به عبارت دیگر، تجربه کاری و پیشرفت شغلی در طول زمان نقش مهمی در افزایش درآمد ایفا میکند.
چگونه فعالان حوزه علم داده میتوانند از این تحلیل استفاده کنند؟
تحلیل این دیتاست تنها یک تمرین آموزشی نیست؛ بلکه میتواند به چند کاربرد عملی منجر شود:
برای دانشجویان علم داده
یک پروژه استاندارد برای یادگیری EDA و مصورسازی داده است.
برای تحلیلگران بازار کار
میتواند به درک عوامل مؤثر بر درآمد کمک کند.
برای توسعهدهندگان مدلهای یادگیری ماشین
این دیتاست یکی از مجموعه دادههای مرجع برای مدلهای طبقهبندی (Classification) محسوب میشود.
جمعبندی
تحلیل دادههای سرشماری آمریکا نشان داد که درآمد افراد تحت تأثیر مجموعهای از عوامل قرار دارد و هیچ عامل واحدی به تنهایی تعیینکننده نیست. تحصیلات، نوع شغل، تجربه کاری، سن و حتی ساختار بازار کار همگی در شکلگیری الگوهای درآمدی نقش دارند.
استفاده از ابزارهای علم داده مانند Python، Pandas، Matplotlib و Seaborn به تحلیلگران این امکان را میدهد که دادههای خام را به بینشهای ارزشمند تبدیل کنند؛ بینشهایی که میتوانند در سیاستگذاری اقتصادی، برنامهریزی شغلی و توسعه مدلهای هوش مصنوعی مورد استفاده قرار گیرند.
با توجه به رشد سریع بازار داده و هوش مصنوعی، تسلط بر مهارتهایی مانند تحلیل اکتشافی دادهها و مصورسازی اطلاعات، به یکی از ضروریترین تواناییها برای متخصصان فناوری تبدیل شده است.
نویسنده : Mahnoor Javed