کشف الگوهای درآمد با پایتون؛ چگونه تحلیل داده‌های سرشماری آمریکا می‌تواند به تصمیم‌گیری شغلی و اقتصادی کمک کند؟

کشف الگوهای درآمد با پایتون؛ چگونه تحلیل داده‌های سرشماری آمریکا می‌تواند به تصمیم‌گیری شغلی و اقتصادی کمک کند؟
۵/۵ - (۱ امتیاز)

در دنیای امروز، تصمیم‌گیری‌های اقتصادی و شغلی دیگر تنها بر اساس حدس و تجربه انجام نمی‌شود. علم داده (Data Science) و تحلیل داده (Data Analytics) به ابزارهای کلیدی برای درک الگوهای درآمد، رفتار بازار کار و پیش‌بینی روندهای اقتصادی تبدیل شده‌اند. یکی از مهم‌ترین منابع داده برای چنین تحلیل‌هایی، داده‌های سرشماری جمعیتی است که اطلاعات ارزشمندی درباره سن، تحصیلات، شغل، ساعات کاری و سطح درآمد ارائه می‌دهد.

در دوم خرداد ۱۴۰۵، مقاله‌ای آموزشی توسط «مهنور جاوید» منتشر شد که نشان می‌داد چگونه می‌توان با استفاده از زبان برنامه‌نویسی Python و کتابخانه‌های تحلیلی قدرتمند مانند Pandas، Matplotlib و Seaborn، الگوهای درآمدی را در دیتاست معروف Adult Census استخراج و تحلیل کرد. این تحلیل نمونه‌ای کاربردی از فرآیند «تحلیل اکتشافی داده‌ها» یا Exploratory Data Analysis (EDA) محسوب می‌شود؛ مرحله‌ای حیاتی در پروژه‌های هوش مصنوعی و یادگیری ماشین.


چالش اصلی تحلیلگران داده: تبدیل داده خام به بینش قابل استفاده

بسیاری از فعالان حوزه علم داده با یک مشکل مشترک روبه‌رو هستند: حجم عظیمی از داده‌ها در دسترس است اما استخراج بینش (Insight) از آن‌ها کار ساده‌ای نیست. داده‌های خام اغلب شامل مقادیر گمشده، ساختارهای نامنظم و ویژگی‌های متنوع هستند که بدون پاکسازی و پیش‌پردازش قابل تحلیل نیستند.

در پروژه تحلیل دیتاست Adult Census نیز همین مسئله وجود داشت. این مجموعه داده که از پایگاه UCI Machine Learning Repository منتشر شده، شامل اطلاعات جمعیتی و شغلی افراد در ایالات متحده در دهه ۱۹۹۰ میلادی است. داده‌ها شامل ویژگی‌هایی مانند:

سن (Age)

نوع اشتغال (Workclass)

سطح تحصیلات (Education)

وضعیت تأهل (Marital Status)

شغل (Occupation)

جنسیت (Sex)

ساعات کاری در هفته (Hours per Week)

کشور محل تولد (Native Country)

و متغیر هدف یعنی سطح درآمد (Income)

است که معمولاً به دو دسته تقسیم می‌شود:

درآمد کمتر یا مساوی ۵۰ هزار دلار

درآمد بیشتر از ۵۰ هزار دلار


راهکار عملی: استفاده از اکوسیستم تحلیلی Python

یکی از مزیت‌های مهم علم داده در سال‌های اخیر، شکل‌گیری اکوسیستم قدرتمند ابزارهای متن‌باز در پایتون است. در این پروژه از سه کتابخانه کلیدی استفاده شد:

Pandas

کتابخانه‌ای برای مدیریت و پردازش داده‌های جدولی که امکان کار با فایل‌های CSV، پاکسازی داده و انجام عملیات آماری را فراهم می‌کند.

Matplotlib

ابزار اصلی ترسیم نمودارها در پایتون که برای تولید انواع نمودارهای آماری و علمی استفاده می‌شود.

Seaborn

کتابخانه‌ای مبتنی بر Matplotlib که برای مصورسازی پیشرفته داده‌ها (Data Visualization) و تولید نمودارهای تحلیلی زیباتر طراحی شده است.

برای نصب این ابزارها از دستور زیر استفاده شد:

pip install pandas matplotlib seaborn


مرحله اول: بارگذاری و بررسی اولیه داده‌ها

در اولین گام، دیتاست سرشماری در قالب یک DataFrame با استفاده از Pandas بارگذاری شد. بررسی اولیه داده‌ها شامل مشاهده پنج سطر اول (df.head)، بررسی ابعاد دیتاست (df.shape) و مشاهده نوع داده‌ها (df.info) بود.

این مرحله در پروژه‌های علم داده بسیار حیاتی است زیرا تحلیلگر باید قبل از هرگونه مدل‌سازی یا تحلیل آماری، ساختار داده‌ها را درک کند.


مرحله دوم: پاکسازی داده‌ها (Data Cleaning)

یکی از مشکلات رایج در دیتاست‌های واقعی وجود داده‌های گمشده است. در این پروژه مقادیر علامت سؤال (?) به عنوان داده‌های نامشخص شناسایی شدند.

برای رفع این مشکل:

این مقادیر با NA جایگزین شدند

سپس ردیف‌های دارای داده ناقص حذف شدند

پس از پاکسازی، تعداد رکوردها از ۳۲۵۶۱ به ۳۰۱۶۲ کاهش یافت.

این مرحله اهمیت بالایی در پروژه‌های یادگیری ماشین دارد زیرا داده‌های ناقص می‌توانند باعث ایجاد Bias در مدل‌های تحلیلی شوند.


تحلیل توزیع درآمد

اولین تحلیل انجام شده بررسی توزیع کلی درآمد در دیتاست بود. با استفاده از نمودار Count Plot مشخص شد که اکثریت افراد در دسته درآمد کمتر از ۵۰ هزار دلار قرار دارند.

این موضوع نشان‌دهنده توزیع نامتوازن درآمد در جامعه مورد بررسی است؛ الگویی که در بسیاری از اقتصادهای دنیا مشاهده می‌شود.


تأثیر تحصیلات بر درآمد

یکی از مهم‌ترین یافته‌های تحلیل داده‌ها، ارتباط قوی بین سطح تحصیلات و میزان درآمد بود.

تحلیل گروه‌بندی (GroupBy) در Pandas نشان داد:

افراد دارای مدرک کارشناسی، کارشناسی ارشد و دکتری سهم بیشتری در گروه درآمد بالا دارند.

افراد با تحصیلات دبیرستان یا کمتر عمدتاً در دسته درآمد پایین قرار گرفته‌اند.

مدارک حرفه‌ای و تخصصی بیشترین نسبت درآمد بالاتر از ۵۰ هزار دلار را نشان می‌دهند.

این الگو به وضوح نقش «سرمایه انسانی» و تخصص را در افزایش درآمد نشان می‌دهد.


ارتباط ساعات کاری با درآمد

تحلیل نمودار Boxplot نشان داد افرادی که بیش از ۵۰ هزار دلار درآمد دارند، به طور میانگین ساعات کاری بیشتری در هفته دارند.

با این حال یک نکته مهم نیز مشاهده شد:

برخی افراد با وجود کار بیش از ۷۰ ساعت در هفته همچنان در دسته درآمد پایین قرار داشتند.

این یافته نشان می‌دهد که «تعداد ساعات کار» به تنهایی عامل تعیین‌کننده درآمد نیست و عوامل دیگری مانند مهارت، شغل و تجربه نیز نقش مهمی دارند.


شکاف درآمدی جنسیتی

تحلیل داده‌ها نشان داد تعداد مردانی که بیش از ۵۰ هزار دلار درآمد دارند به طور قابل توجهی بیشتر از زنان است.

اگرچه این تحلیل به تنهایی نمی‌تواند وجود تبعیض را اثبات کند، اما نشان می‌دهد در دهه ۱۹۹۰ تفاوت قابل توجهی در توزیع درآمد میان مردان و زنان وجود داشته است.


تأثیر نوع شغل بر درآمد

تحلیل شغل‌ها نشان داد بیشترین افراد با درآمد بالا در دسته‌های زیر قرار دارند:

مدیران اجرایی (Executive Managerial)

متخصصان حرفه‌ای (Professional Specialty)

مشاغل فنی و تخصصی

این نتیجه تأکید می‌کند که نوع شغل یکی از مهم‌ترین متغیرهای پیش‌بینی درآمد در تحلیل‌های داده‌ای است.


تأثیر سن و تجربه بر سطح درآمد

نمودار تحلیل سن نشان داد که افراد با درآمد بالاتر معمولاً سن بیشتری دارند.

به عبارت دیگر، تجربه کاری و پیشرفت شغلی در طول زمان نقش مهمی در افزایش درآمد ایفا می‌کند.


چگونه فعالان حوزه علم داده می‌توانند از این تحلیل استفاده کنند؟

تحلیل این دیتاست تنها یک تمرین آموزشی نیست؛ بلکه می‌تواند به چند کاربرد عملی منجر شود:

برای دانشجویان علم داده

یک پروژه استاندارد برای یادگیری EDA و مصورسازی داده است.

برای تحلیلگران بازار کار

می‌تواند به درک عوامل مؤثر بر درآمد کمک کند.

برای توسعه‌دهندگان مدل‌های یادگیری ماشین

این دیتاست یکی از مجموعه داده‌های مرجع برای مدل‌های طبقه‌بندی (Classification) محسوب می‌شود.


جمع‌بندی

تحلیل داده‌های سرشماری آمریکا نشان داد که درآمد افراد تحت تأثیر مجموعه‌ای از عوامل قرار دارد و هیچ عامل واحدی به تنهایی تعیین‌کننده نیست. تحصیلات، نوع شغل، تجربه کاری، سن و حتی ساختار بازار کار همگی در شکل‌گیری الگوهای درآمدی نقش دارند.

استفاده از ابزارهای علم داده مانند Python، Pandas، Matplotlib و Seaborn به تحلیلگران این امکان را می‌دهد که داده‌های خام را به بینش‌های ارزشمند تبدیل کنند؛ بینش‌هایی که می‌توانند در سیاست‌گذاری اقتصادی، برنامه‌ریزی شغلی و توسعه مدل‌های هوش مصنوعی مورد استفاده قرار گیرند.

با توجه به رشد سریع بازار داده و هوش مصنوعی، تسلط بر مهارت‌هایی مانند تحلیل اکتشافی داده‌ها و مصورسازی اطلاعات، به یکی از ضروری‌ترین توانایی‌ها برای متخصصان فناوری تبدیل شده است.

نویسنده : Mahnoor Javed

5/5 - (1 امتیاز)

دیدگاهتان را بنویسید