پایتون

روز ۴۲ آموزش پایتون: تمرین آنالیز داده ساده با Pandas

آنالیز داده یکی از مهارت‌های حیاتی در برنامه‌ نویسی پایتون و پروژه‌های داده‌محور است. وقتی با فایل‌های CSV یا Excel کار می‌کنیم، معمولاً هدف ما فقط خواندن داده‌ها نیست بلکه می‌خواهیم آن‌ها را تحلیل و پردازش کنیم تا اطلاعات مفیدی استخراج شود. در این تمرین، هدف ما استفاده از کتابخانه قدرتمند pandas برای آنالیز داده ساده است. با یادگیری روش‌های فیلتر، گروه‌بندی، جمع‌بندی و استخراج اطلاعات از ستون‌ها، می‌توانیم داده‌ها را به شکلی کاربردی تبدیل کنیم و تصمیمات بهتری برای پروژه‌های واقعی بگیریم. این تمرین به شما کمک می‌کند مهارت‌های تحلیل داده را در سطح مقدماتی و کاربردی تجربه کنید و آماده پروژه‌های پیچیده‌تر شوید.

آماده‌سازی داده‌ها و خواندن فایل

اولین قدم در هر پروژه آنالیز داده، خواندن داده‌ها و بررسی اولیه آن‌هاست. فرض کنید فایل CSV شامل اطلاعات کاربران شامل نام، سن، جنسیت و میزان خرید است. با pandas، می‌توانیم فایل را به راحتی بخوانیم و نگاهی سریع به ساختار و کیفیت داده‌ها بیندازیم. این بررسی اولیه به ما کمک می‌کند مشکلات احتمالی مانند داده‌های خالی، داده‌های نامعتبر یا ستون‌های اضافی را شناسایی کنیم.

نمونه کد خواندن فایل CSV و بررسی اولیه:

import pandas as pd

df = pd.read_csv("users_data.csv")
print(df.head())
print(df.info())
print(df.describe())

در این مثال، head() پنج ردیف اول را نشان می‌دهد، info() اطلاعات کلی از ستون‌ها و نوع داده‌ها می‌دهد و describe() آماری کلی مانند میانگین، حداقل، حداکثر و انحراف معیار داده‌های عددی را نمایش می‌دهد. این مرحله پایه‌ای برای تحلیل حرفه‌ای داده‌هاست و به ما دید اولیه نسبت به داده‌ها می‌دهد.

فیلتر و استخراج اطلاعات

بعد از بررسی اولیه، معمولاً می‌خواهیم داده‌ها را فیلتر کنیم تا اطلاعات مورد نیازمان را جدا کنیم. به عنوان مثال، ممکن است بخواهیم تنها کاربران بالای ۳۰ سال یا کسانی که خرید بالایی داشته‌اند را بررسی کنیم. pandas این امکان را با روش‌های ساده و خوانا فراهم می‌کند و باعث می‌شود حتی داده‌های بزرگ نیز به راحتی پردازش شوند.

نمونه کد فیلتر کردن کاربران:

# کاربران بالای ۳۰ سال
adults = df[df["Age"] > 30]
print(adults)

# کاربران با خرید بالای ۵۰۰
high_spenders = df[df["Purchase"] > 500]
print(high_spenders)

این نوع فیلترها برای تحلیل رفتار کاربران، تولید گزارش و تصمیم‌گیری‌های مدیریتی بسیار مهم هستند. به کمک pandas می‌توان شرایط پیچیده‌تری نیز تعریف کرد و داده‌ها را ترکیبی فیلتر نمود.

گروه‌بندی و جمع‌بندی داده‌ها

یکی از ابزارهای قدرتمند pandas، گروه‌بندی داده‌ها با groupby است. این امکان به ما اجازه می‌دهد تا داده‌ها را بر اساس ستون خاصی دسته‌بندی کنیم و عملیات آماری روی هر گروه انجام دهیم. برای مثال، می‌توانیم کاربران را بر اساس جنسیت گروه‌بندی کنیم و میانگین خرید هر گروه را محاسبه کنیم.

نمونه کد گروه‌بندی:

# میانگین خرید بر اساس جنسیت
avg_purchase = df.groupby("Gender")["Purchase"].mean()
print(avg_purchase)

این روش به ما کمک می‌کند روندها و الگوهای پنهان در داده‌ها را شناسایی کنیم و گزارش‌های دقیقی ارائه دهیم. گروه‌بندی در تحلیل داده‌های واقعی مانند فروشگاه‌ها، سیستم‌های آموزشی یا پایگاه‌های داده مشتریان کاربرد فراوان دارد.

اضافه کردن ستون‌ها و ایجاد شاخص‌های جدید

برای تحلیل دقیق‌تر، گاهی نیاز داریم ستون‌های جدید بر اساس داده‌های موجود ایجاد کنیم. به عنوان مثال، می‌توانیم ستونی برای مشخص کردن کاربران پرمصرف اضافه کنیم یا بر اساس سن، گروه‌بندی سنی انجام دهیم. این قابلیت pandas، قدرت بسیار زیادی به ما می‌دهد تا داده‌ها را برای تحلیل آماده کنیم.

نمونه کد اضافه کردن ستون جدید:

# ایجاد ستون پرمصرف
df["High_Spender"] = df["Purchase"] > 500

# ایجاد ستون گروه سنی
df["Age_Group"] = df["Age"].apply(lambda x: "Young" if x < 30 else "Adult")
print(df.head())

این تکنیک‌ها در پروژه‌های واقعی به ما کمک می‌کند داده‌ها را تحلیل‌پذیرتر و خواناتر کنیم و آماده تولید گزارش یا مدل‌سازی بعدی شوند.

ذخیره داده‌های پردازش شده

پس از آنالیز و پردازش داده‌ها، معمولاً نیاز داریم داده‌ها را ذخیره کنیم تا در پروژه‌های بعدی استفاده شوند. pandas امکان ذخیره داده‌ها به فرمت CSV یا Excel را فراهم می‌کند و این داده‌های آماده قابل استفاده در سیستم‌های دیگر هستند.

نمونه کد ذخیره داده:

df.to_csv("processed_users.csv", index=False)
df.to_excel("processed_users.xlsx", index=False)

با این روش، داده‌های پردازش شده در دسترس سایر تیم‌ها و سیستم‌ها قرار می‌گیرد و روند تحلیل داده کامل می‌شود.

جمع‌بندی تمرین روز ۴۲

در روز ۴۲، با یک تمرین عملی آنالیز داده آشنا شدیم و یاد گرفتیم چگونه با pandas داده‌ها را بخوانیم، بررسی کنیم، فیلتر و گروه‌بندی کنیم، ستون‌های جدید ایجاد کنیم و در نهایت ذخیره نماییم. این مهارت پایه‌ای برای تحلیل داده‌ها در پروژه‌های واقعی است و با تمرین مستمر، می‌توانیم روی فایل‌های بزرگ و پیچیده نیز تسلط پیدا کنیم. توصیه می‌شود روی فایل‌های متنوع، با داده‌های واقعی یا شبیه‌سازی شده کار کنید تا مهارت عملی شما افزایش یابد و آماده پروژه‌های واقعی باشید.

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

نوزده + 15 =

دکمه بازگشت به بالا