مبحث ۳: طبقهبندی
Classification
۱. این مبحث دقیقاً درباره چیست؟
طبقهبندی (Classification) یکی از مهمترین و پرکاربردترین وظایف در یادگیری ماشین است. هدف آن تخصیص یک نمونه جدید به یکی از کلاسها یا دستههای از پیش تعیینشده است.
فرض کنید یک بانک میخواهد تعیین کند آیا یک تراکنش «تقلبی» است یا «عادی». یا یک سیستم ایمیل میخواهد تعیین کند یک ایمیل «اسپم» است یا «غیراسپم». در هر دو مورد، دستهها از قبل مشخص هستند و مدل باید یاد بگیرد نمونههای جدید را به دسته درست اختصاص دهد.
طبقهبندی یک وظیفه یادگیری نظارتشده (Supervised Learning) است زیرا مدل از روی دادههای برچسبدار آموزش میبیند. تقریباً در تمام حوزههای کاربردی هوش مصنوعی — از پزشکی تا بانکداری، از امنیت تا بازاریابی — طبقهبندی نقش محوری دارد.
۲. تعریف ساده
تعریف ساده: طبقهبندی یعنی اینکه مدل یاد بگیرد یک داده جدید را در کدام دسته از پیش مشخصشده قرار دهد.
۳. تعریف تخصصی
تعریف تخصصی: طبقهبندی یک وظیفه یادگیری نظارتشده است که در آن الگوریتم با یادگیری از مجموعه دادههای برچسبدار (X, Y)، یک تابع نگاشت f: X → Y را تقریب میزند، بهطوری که Y مجموعهای متناهی از کلاسهای گسسته باشد. هدف کمینهسازی خطای تعمیم (Generalization Error) است تا مدل بتواند نمونههای جدید را به کلاس صحیح اختصاص دهد.
۴. مفاهیم کلیدی
۴.۱. انواع طبقهبندی 🔴
| نوع | توضیح | مثال |
|---|---|---|
| دودویی (Binary) | فقط دو کلاس | اسپم/غیراسپم، بیمار/سالم |
| چندکلاسه (Multi-class) | بیش از دو کلاس، هر نمونه یک کلاس | تشخیص ارقام ۰-۹ |
| چندبرچسبه (Multi-label) | هر نمونه میتواند چند برچسب داشته باشد | یک مقاله: ورزشی + اقتصادی |
۴.۲. الگوریتمهای اصلی طبقهبندی 🔴
K-نزدیکترین همسایه (K-Nearest Neighbors - KNN)
- ایده: نمونه جدید را بر اساس K نمونه نزدیکترین در داده آموزشی طبقهبندی کن.
- مزیت: ساده، بدون نیاز به آموزش (Lazy Learner)
- محدودیت: کند برای داده بزرگ، حساس به ابعاد بالا و مقیاس ویژگیها
- فراپارامتر مهم: مقدار K (تعداد همسایه)
درخت تصمیم (Decision Tree)
- ایده: ایجاد یک ساختار درختی از قوانین if-then بر اساس ویژگیها.
- مزیت: تفسیرپذیر، قابل فهم، مناسب برای دادههای ترکیبی
- محدودیت: مستعد بیشبرازش
- معیارهای تقسیم مهم:
- بهره اطلاعاتی (Information Gain)
- شاخص جینی (Gini Index)
- آنتروپی (Entropy)
ماشین بردار پشتیبان (Support Vector Machine - SVM)
- ایده: یافتن ابرصفحه بهینه (Optimal Hyperplane) که دو کلاس را با بیشترین حاشیه (Maximum Margin) جدا کند.
- مزیت: مؤثر در فضای با ابعاد بالا، مقاوم در برابر بیشبرازش
- محدودیت: کند برای دادههای خیلی بزرگ، تفسیرپذیری پایین
- مفاهیم کلیدی: بردارهای پشتیبان (Support Vectors)، حاشیه (Margin)، تابع هسته (Kernel Function)
بیز ساده (Naive Bayes)
- ایده: استفاده از قضیه بیز با فرض استقلال شرطی ویژگیها.
- مزیت: سریع، مؤثر با داده کم، خوب برای متن
- محدودیت: فرض استقلال ویژگیها در واقعیت معمولاً برقرار نیست
- کاربرد ویژه: فیلتر اسپم، تحلیل احساسات، طبقهبندی متن
رگرسیون لجستیک (Logistic Regression)
- ایده: مدلسازی احتمال تعلق نمونه به هر کلاس با استفاده از تابع سیگموئید.
- نکته مهم: با وجود نامش، یک الگوریتم طبقهبندی است نه رگرسیون!
- مزیت: ساده، تفسیرپذیر، احتمال خروجی
- محدودیت: فقط مرز تصمیم خطی
جنگل تصادفی (Random Forest)
- ایده: ترکیب چندین درخت تصمیم و رأیگیری اکثریت برای تصمیم نهایی.
- مزیت: دقت بالا، مقاوم در برابر بیشبرازش، مدیریت دادههای ناقص
- محدودیت: تفسیرپذیری کمتر از درخت تصمیم واحد
- نوع: روش جمعی (Ensemble Method)
شبکههای عصبی (Neural Networks)
- ایده: شبیهسازی ساختار مغز با لایههایی از نورونها.
- مزیت: توانایی یادگیری الگوهای بسیار پیچیده
- محدودیت: نیاز به داده زیاد، تفسیرپذیری پایین، هزینه محاسباتی بالا
- ارجاع: جزئیات در مبحث ۷ (انواع شبکههای عصبی) بررسی میشود.
۴.۳. مرز تصمیم (Decision Boundary) 🟠
- تعریف: خط یا سطحی در فضای ویژگیها که کلاسها را از هم جدا میکند.
- خطی (Linear): SVM خطی، رگرسیون لجستیک
- غیرخطی (Non-linear): SVM با Kernel، درخت تصمیم، شبکه عصبی
۴.۴. داده نامتوازن (Imbalanced Data) 🟠
- تعریف: وقتی یک کلاس نمونههای خیلی بیشتری نسبت به کلاس دیگر دارد.
- مثال: تشخیص تقلب: ۹۹٪ عادی، ۱٪ تقلبی
- مشکل: مدل ممکن است فقط کلاس اکثریت را پیشبینی کند و دقت ظاهری بالایی نشان دهد.
- راهکارها: Oversampling (SMOTE)، Undersampling، تغییر وزن کلاسها، استفاده از معیارهای ارزیابی مناسب (F1, AUC)
۵. چگونه کار میکند؟
فرآیند کلی طبقهبندی:
۱. داده برچسبدار (X, Y)
↓
۲. تقسیم به آموزشی/آزمایشی
↓
۳. انتخاب الگوریتم طبقهبندی
↓
۴. آموزش مدل (یادگیری مرز تصمیم)
↓
۵. پیشبینی روی داده آزمایشی
↓
۶. ارزیابی عملکرد (دقت، F1, AUC...)
↓
۷. تنظیم فراپارامترها و بهبود
توضیح تخصصیتر:
الگوریتم طبقهبندی یک تابع تصمیم (Decision Function) یاد میگیرد که فضای ویژگیها را به نواحی تصمیم (Decision Regions) تقسیم میکند. هر ناحیه به یک کلاس اختصاص دارد. مرز بین نواحی همان مرز تصمیم (Decision Boundary) است.
۶. مثال واقعی
تشخیص تقلب بانکی
مسئله: یک بانک روزانه میلیونها تراکنش دارد و باید تراکنشهای تقلبی را شناسایی کند.
روش: - ویژگیها: مبلغ تراکنش، مکان، زمان، تاریخچه مشتری، نوع تراکنش - برچسبها: تقلبی / عادی (از تراکنشهای قبلی بررسیشده) - الگوریتم: Random Forest یا شبکه عصبی - خروجی: برای هر تراکنش جدید، احتمال تقلبی بودن
نتیجه: کاهش ۸۰٪ تقلبهای شناسایینشده و صرفهجویی میلیونها دلار.
۷. مثال خیلی ساده
تشخیص اینکه یک ایمیل اسپم است یا غیراسپم:
- ویژگیها: تعداد کلمات «رایگان»، وجود لینک مشکوک، فرستنده ناشناس
- کلاسها: اسپم ✉️ | غیراسپم 📧
- مدل از هزاران ایمیل قبلی (برچسبدار) یاد گرفته
- حالا برای ایمیل جدید تصمیم میگیرد
۸. تفاوت مفاهیم مشابه
طبقهبندی vs رگرسیون vs خوشهبندی 🔴
| ویژگی | طبقهبندی | رگرسیون | خوشهبندی |
|---|---|---|---|
| نوع یادگیری | نظارتشده | نظارتشده | بدون نظارت |
| خروجی | کلاس (گسسته) | عدد (پیوسته) | گروه (کشفشده) |
| برچسب | لازم | لازم | لازم نیست |
| هدف | تخصیص به کلاس مشخص | پیشبینی مقدار | کشف گروهها |
| مثال | اسپم/غیراسپم | قیمت خانه | تقسیم مشتریان |
مقایسه الگوریتمهای طبقهبندی 🔴
| الگوریتم | تفسیرپذیری | سرعت | دقت | داده بزرگ | داده نامتوازن |
|---|---|---|---|---|---|
| KNN | متوسط | کند | متوسط | ضعیف | ضعیف |
| Decision Tree | بالا | سریع | متوسط | متوسط | متوسط |
| SVM | پایین | متوسط | بالا | ضعیف | خوب |
| Naive Bayes | بالا | بسیار سریع | متوسط | خوب | متوسط |
| Logistic Reg. | بالا | سریع | متوسط | خوب | متوسط |
| Random Forest | متوسط | متوسط | بالا | خوب | خوب |
| Neural Net | پایین | کند | بالا | بالا | متوسط |
۹. مزایا و محدودیتها
مزایا ✅
- کاربرد گسترده: قابل استفاده در تقریباً تمام حوزهها
- ارزیابی ساده: با معیارهای مشخص مانند Accuracy، F1 و AUC
- الگوریتمهای متنوع: از ساده (KNN) تا پیچیده (Deep Learning)
- قابلیت اتوماسیون: مناسب برای تصمیمگیری خودکار
محدودیتها ⛔
- نیاز به داده برچسبدار: برچسبگذاری هزینهبر و زمانبر
- حساس به کیفیت داده: داده نویزی → مدل ضعیف
- داده نامتوازن: چالش جدی در کاربردهای واقعی
- مرز تصمیم: برخی الگوریتمها فقط مرز خطی ایجاد میکنند
۱۰. کاربردهای مهم
| حوزه | کاربرد | توضیح |
|---|---|---|
| سلامت | تشخیص بیماری | سرطانی/سالم، دیابتی/غیردیابتی |
| بانکداری | تشخیص تقلب | تراکنش تقلبی/عادی |
| امنیت | تشخیص بدافزار | فایل مخرب/سالم |
| بازاریابی | تحلیل احساسات | نظر مثبت/منفی/خنثی |
| منابع انسانی | غربالگری رزومه | مناسب/نامناسب |
| صنعت | کنترل کیفیت | محصول سالم/معیوب |
| حملونقل | تشخیص علائم راهنمایی | انواع تابلوها |
| تجارت الکترونیک | پیشبینی ریزش مشتری | میماند/ترک میکند |
۱۱. دیدگاه مشاورهای
چه زمانی از طبقهبندی استفاده کنیم؟
- وقتی خروجی مسئله یک دسته/کلاس مشخص است
- وقتی داده برچسبدار کافی داریم
- وقتی تصمیم باید خودکار گرفته شود
انتخاب الگوریتم مناسب:
- داده کم + تفسیرپذیری مهم → Decision Tree / Logistic Regression
- متن و NLP → Naive Bayes / رگرسیون لجستیک
- ابعاد بالا → SVM
- دقت بالا مهمترین عامل → Random Forest / شبکه عصبی
- داده خیلی بزرگ + الگوی پیچیده → شبکه عصبی عمیق
مهمترین ریسک:
- نادیدهگرفتن عدم توازن کلاسها: دقت ظاهری ۹۹٪ ولی تقلبها شناسایی نمیشوند
- استفاده از معیار ارزیابی نامناسب: Accuracy برای داده نامتوازن گمراهکننده است
۱۲. قاعده تصمیمگیری
خروجی مسئله چیست؟
├── یک کلاس از چند کلاس مشخص → طبقهبندی
│ ├── دو کلاس → Binary Classification
│ ├── بیش از دو کلاس → Multi-class
│ └── چند برچسب همزمان → Multi-label
├── یک عدد پیوسته → رگرسیون (مبحث ۵)
└── کشف گروهها → خوشهبندی (مبحث ۴)
۱۳. 🔴 نکات طلایی آزمون
- طبقهبندی = نظارتشده + خروجی کلاس. با رگرسیون (خروجی عدد) و خوشهبندی (بدون نظارت) اشتباه نگیرید.
- رگرسیون لجستیک: با وجود نامش، یک الگوریتم طبقهبندی است!
- Naive Bayes: فرض کلیدی = استقلال شرطی ویژگیها (که معمولاً در واقعیت برقرار نیست ولی الگوریتم با این حال خوب کار میکند).
- SVM: هدف = بیشینهسازی حاشیه (Maximum Margin). بردارهای پشتیبان = نمونههای نزدیک به مرز.
- Random Forest = Ensemble: ترکیب چند درخت تصمیم. دقت بیشتر، بیشبرازش کمتر.
- Decision Tree: معیارهای تقسیم = Information Gain, Gini Index, Entropy.
- KNN: Lazy Learner — آموزش ندارد، همه کار در زمان پیشبینی.
- داده نامتوازن: Accuracy گمراهکننده → از F1, Recall, AUC استفاده کنید.
- Binary vs Multi-class vs Multi-label: دو کلاس | چند کلاس | چند برچسب همزمان.
- مرز تصمیم خطی vs غیرخطی: رگرسیون لجستیک = خطی | درخت تصمیم/شبکه عصبی = غیرخطی.
۱۴. ⚠️ دامهای رایج آزمون
دام ۱: «رگرسیون لجستیک یک الگوریتم رگرسیون است.»
❌ با وجود نام «رگرسیون»، یک الگوریتم طبقهبندی است. خروجی آن احتمال تعلق به هر کلاس است.دام ۲: «دقت (Accuracy) بالا همیشه نشانه مدل خوب است.»
❌ در داده نامتوازن (مثل ۹۹٪ عادی، ۱٪ تقلبی)، مدلی که همه را «عادی» پیشبینی کند دقت ۹۹٪ دارد ولی هیچ تقلبی را شناسایی نکرده!دام ۳: «KNN از الگوریتمهای آموزشدیده (Eager Learner) است.»
❌ KNN یک Lazy Learner است: در مرحله آموزش هیچ مدلی نمیسازد و همه محاسبات را در زمان پیشبینی انجام میدهد.دام ۴: «Multi-class و Multi-label یکی هستند.»
❌ Multi-class: هر نمونه فقط یک کلاس (مثلاً: گربه یا سگ یا پرنده). Multi-label: هر نمونه چند برچسب همزمان (مثلاً: یک فیلم هم اکشن و هم کمدی).
۱۵. 🧠 خلاصه یکدقیقهای
اگر فقط یک دقیقه وقت داشتم...
- طبقهبندی = نظارتشده + خروجی یک کلاس از دستههای مشخص
- Binary (۲ کلاس) | Multi-class (چند کلاس) | Multi-label (چند برچسب)
- رگرسیون لجستیک اسماً رگرسیون ولی عملاً طبقهبندی است
- KNN = ساده، Lazy Learner | Decision Tree = تفسیرپذیر | SVM = حاشیه بیشینه
- Random Forest = ترکیب درختها (Ensemble) | Naive Bayes = سریع، خوب برای متن
- داده نامتوازن = چالش جدی → Accuracy کافی نیست → از F1, AUC استفاده کنید
- مرز تصمیم: خطی (LR, SVM خطی) vs غیرخطی (DT, NN)
- الگوریتم مناسب به مسئله، حجم داده و نیاز به تفسیرپذیری بستگی دارد
۱۶. نقشه ذهنی
طبقهبندی (Classification)
│
├── انواع
│ ├── Binary (دودویی)
│ ├── Multi-class (چندکلاسه)
│ └── Multi-label (چندبرچسبه)
│
├── الگوریتمها
│ ├── KNN ← Lazy Learner
│ ├── Decision Tree ← تفسیرپذیر
│ ├── SVM ← Maximum Margin
│ ├── Naive Bayes ← فرض استقلال
│ ├── Logistic Regression ← طبقهبندی (نه رگرسیون!)
│ ├── Random Forest ← Ensemble
│ └── Neural Networks ← الگوهای پیچیده
│
├── مفاهیم مهم
│ ├── مرز تصمیم (Decision Boundary)
│ ├── داده نامتوازن (Imbalanced Data)
│ └── Feature Engineering
│
└── تفاوت با...
├── رگرسیون ← خروجی عدد (نه کلاس)
└── خوشهبندی ← بدون نظارت
۱۷. ارتباط با سایر مباحث
| مبحث مرتبط | نوع ارتباط |
|---|---|
| انواع یادگیری (مبحث ۲) | طبقهبندی وظیفه اصلی یادگیری نظارتشده است |
| خوشهبندی (مبحث ۴) | مشابه اما بدون نظارت — اشتباهگرفتن رایج |
| رگرسیون (مبحث ۵) | مشابه اما خروجی عدد پیوسته — نه کلاس |
| ارزیابی مدلها (مبحث ۶) | معیارهای ارزیابی طبقهبندی: Accuracy, F1, AUC |
| شبکههای عصبی (مبحث ۷) | یکی از الگوریتمهای قدرتمند طبقهبندی |
| بینایی ماشین (فصل ۴) | تشخیص اشیاء نوعی طبقهبندی تصاویر است |
| NLP (فصل ۳) | تحلیل احساسات نوعی طبقهبندی متن است |
📚 مراجع و منابع علمی معتبر
منابع مرتبط با همین موضوع- XGBoost
- IEEE
- Scikit-Learn