
روز ۴۲ آموزش پایتون: تمرین آنالیز داده ساده با Pandas
آنالیز داده یکی از مهارتهای حیاتی در برنامه نویسی پایتون و پروژههای دادهمحور است. وقتی با فایلهای CSV یا Excel کار میکنیم، معمولاً هدف ما فقط خواندن دادهها نیست بلکه میخواهیم آنها را تحلیل و پردازش کنیم تا اطلاعات مفیدی استخراج شود. در این تمرین، هدف ما استفاده از کتابخانه قدرتمند pandas برای آنالیز داده ساده است. با یادگیری روشهای فیلتر، گروهبندی، جمعبندی و استخراج اطلاعات از ستونها، میتوانیم دادهها را به شکلی کاربردی تبدیل کنیم و تصمیمات بهتری برای پروژههای واقعی بگیریم. این تمرین به شما کمک میکند مهارتهای تحلیل داده را در سطح مقدماتی و کاربردی تجربه کنید و آماده پروژههای پیچیدهتر شوید.
آمادهسازی دادهها و خواندن فایل
اولین قدم در هر پروژه آنالیز داده، خواندن دادهها و بررسی اولیه آنهاست. فرض کنید فایل CSV شامل اطلاعات کاربران شامل نام، سن، جنسیت و میزان خرید است. با pandas، میتوانیم فایل را به راحتی بخوانیم و نگاهی سریع به ساختار و کیفیت دادهها بیندازیم. این بررسی اولیه به ما کمک میکند مشکلات احتمالی مانند دادههای خالی، دادههای نامعتبر یا ستونهای اضافی را شناسایی کنیم.
نمونه کد خواندن فایل CSV و بررسی اولیه:
import pandas as pd
df = pd.read_csv("users_data.csv")
print(df.head())
print(df.info())
print(df.describe())در این مثال، head() پنج ردیف اول را نشان میدهد، info() اطلاعات کلی از ستونها و نوع دادهها میدهد و describe() آماری کلی مانند میانگین، حداقل، حداکثر و انحراف معیار دادههای عددی را نمایش میدهد. این مرحله پایهای برای تحلیل حرفهای دادههاست و به ما دید اولیه نسبت به دادهها میدهد.
فیلتر و استخراج اطلاعات
بعد از بررسی اولیه، معمولاً میخواهیم دادهها را فیلتر کنیم تا اطلاعات مورد نیازمان را جدا کنیم. به عنوان مثال، ممکن است بخواهیم تنها کاربران بالای ۳۰ سال یا کسانی که خرید بالایی داشتهاند را بررسی کنیم. pandas این امکان را با روشهای ساده و خوانا فراهم میکند و باعث میشود حتی دادههای بزرگ نیز به راحتی پردازش شوند.
نمونه کد فیلتر کردن کاربران:
# کاربران بالای ۳۰ سال adults = df[df["Age"] > 30] print(adults) # کاربران با خرید بالای ۵۰۰ high_spenders = df[df["Purchase"] > 500] print(high_spenders)
این نوع فیلترها برای تحلیل رفتار کاربران، تولید گزارش و تصمیمگیریهای مدیریتی بسیار مهم هستند. به کمک pandas میتوان شرایط پیچیدهتری نیز تعریف کرد و دادهها را ترکیبی فیلتر نمود.
گروهبندی و جمعبندی دادهها
یکی از ابزارهای قدرتمند pandas، گروهبندی دادهها با groupby است. این امکان به ما اجازه میدهد تا دادهها را بر اساس ستون خاصی دستهبندی کنیم و عملیات آماری روی هر گروه انجام دهیم. برای مثال، میتوانیم کاربران را بر اساس جنسیت گروهبندی کنیم و میانگین خرید هر گروه را محاسبه کنیم.
نمونه کد گروهبندی:
# میانگین خرید بر اساس جنسیت
avg_purchase = df.groupby("Gender")["Purchase"].mean()
print(avg_purchase)این روش به ما کمک میکند روندها و الگوهای پنهان در دادهها را شناسایی کنیم و گزارشهای دقیقی ارائه دهیم. گروهبندی در تحلیل دادههای واقعی مانند فروشگاهها، سیستمهای آموزشی یا پایگاههای داده مشتریان کاربرد فراوان دارد.
اضافه کردن ستونها و ایجاد شاخصهای جدید
برای تحلیل دقیقتر، گاهی نیاز داریم ستونهای جدید بر اساس دادههای موجود ایجاد کنیم. به عنوان مثال، میتوانیم ستونی برای مشخص کردن کاربران پرمصرف اضافه کنیم یا بر اساس سن، گروهبندی سنی انجام دهیم. این قابلیت pandas، قدرت بسیار زیادی به ما میدهد تا دادهها را برای تحلیل آماده کنیم.
نمونه کد اضافه کردن ستون جدید:
# ایجاد ستون پرمصرف df["High_Spender"] = df["Purchase"] > 500 # ایجاد ستون گروه سنی df["Age_Group"] = df["Age"].apply(lambda x: "Young" if x < 30 else "Adult") print(df.head())
این تکنیکها در پروژههای واقعی به ما کمک میکند دادهها را تحلیلپذیرتر و خواناتر کنیم و آماده تولید گزارش یا مدلسازی بعدی شوند.
ذخیره دادههای پردازش شده
پس از آنالیز و پردازش دادهها، معمولاً نیاز داریم دادهها را ذخیره کنیم تا در پروژههای بعدی استفاده شوند. pandas امکان ذخیره دادهها به فرمت CSV یا Excel را فراهم میکند و این دادههای آماده قابل استفاده در سیستمهای دیگر هستند.
نمونه کد ذخیره داده:
df.to_csv("processed_users.csv", index=False)
df.to_excel("processed_users.xlsx", index=False)با این روش، دادههای پردازش شده در دسترس سایر تیمها و سیستمها قرار میگیرد و روند تحلیل داده کامل میشود.
جمعبندی تمرین روز ۴۲
در روز ۴۲، با یک تمرین عملی آنالیز داده آشنا شدیم و یاد گرفتیم چگونه با pandas دادهها را بخوانیم، بررسی کنیم، فیلتر و گروهبندی کنیم، ستونهای جدید ایجاد کنیم و در نهایت ذخیره نماییم. این مهارت پایهای برای تحلیل دادهها در پروژههای واقعی است و با تمرین مستمر، میتوانیم روی فایلهای بزرگ و پیچیده نیز تسلط پیدا کنیم. توصیه میشود روی فایلهای متنوع، با دادههای واقعی یا شبیهسازی شده کار کنید تا مهارت عملی شما افزایش یابد و آماده پروژههای واقعی باشید.
