مبحث ۲: انواع یادگیری در هوش مصنوعی
Types of Learning in Artificial Intelligence
۱. این مبحث دقیقاً درباره چیست؟
در مبحث قبل دیدیم که یادگیری ماشین یعنی استخراج الگو از داده. اما سؤال اساسی این است: ماشین به چه شکلی یاد میگیرد؟ آیا همه روشها به دادههای برچسبدار نیاز دارند؟ آیا همیشه باید جواب صحیح را بدانیم؟
انواع یادگیری در ML دستهبندی اصلی است که نحوه تعامل الگوریتم با دادهها را مشخص میکند. این دستهبندی یکی از پایهایترین مفاهیم هوش مصنوعی و از پرتکرارترین موضوعات آزمونی است.
شناخت انواع یادگیری به شما کمک میکند: - برای هر مسئله، رویکرد مناسب را انتخاب کنید - تفاوت بین روشها را تشخیص دهید - درک کنید چرا برخی کاربردها به داده برچسبدار نیاز دارند و برخی نه
۲. تعریف ساده
تعریف ساده: انواع یادگیری به روشهای مختلفی گفته میشود که یک الگوریتم از داده یاد میگیرد. تفاوت اصلی آنها در این است که آیا جواب صحیح (برچسب) در اختیار مدل هست یا نه.
۳. تعریف تخصصی
تعریف تخصصی: پارادایمهای یادگیری در ML بر اساس نوع سیگنال بازخورد (Feedback Signal) و میزان نظارت انسانی در فرآیند آموزش تقسیمبندی میشوند. سه پارادایم اصلی عبارتند از: یادگیری نظارتشده (با جفت ورودی-خروجی مشخص)، یادگیری بدون نظارت (بدون برچسب، با هدف کشف ساختار پنهان) و یادگیری تقویتی (با سیگنال پاداش/جریمه در محیط تعاملی).
۴. مفاهیم کلیدی
۴.۱. یادگیری نظارتشده (Supervised Learning) 🔴
- تعریف: الگوریتم از مجموعهای از دادههای برچسبدار (جفت ورودی-خروجی) یاد میگیرد.
- توضیح ساده: مثل آموزش با معلم. معلم جواب صحیح هر سؤال را نشان میدهد تا دانشآموز الگو را یاد بگیرد.
- ورودی: مجموعهای از نمونهها با ویژگیها (X) و برچسبها (Y)
- خروجی: مدلی که بتواند برای داده جدید، برچسب را پیشبینی کند
- وظایف اصلی:
- طبقهبندی (Classification): خروجی یک دسته/کلاس است (مثل اسپم/غیراسپم)
- رگرسیون (Regression): خروجی یک عدد پیوسته است (مثل قیمت خانه)
- الگوریتمهای مهم: درخت تصمیم، SVM، رگرسیون لجستیک، شبکه عصبی، KNN، جنگل تصادفی
- مثال: تشخیص ایمیل اسپم، پیشبینی قیمت سهام، تشخیص بیماری
۴.۲. یادگیری بدون نظارت (Unsupervised Learning) 🔴
- تعریف: الگوریتم از دادههای بدون برچسب یاد میگیرد و خودش الگوها و ساختارهای پنهان را کشف میکند.
- توضیح ساده: مثل بچهای که بدون معلم، خودش اسباببازیها را بر اساس شکل و رنگ گروهبندی میکند.
- ورودی: مجموعهای از نمونهها فقط با ویژگیها (X)، بدون برچسب
- خروجی: ساختار یا الگوی پنهان در داده
- وظایف اصلی:
- خوشهبندی (Clustering): تقسیم دادهها به گروههای مشابه (مثل تقسیم مشتریان)
- کاهش ابعاد (Dimensionality Reduction): کم کردن تعداد ویژگیها با حفظ اطلاعات مهم
- کشف قواعد ارتباطی (Association Rule Mining): یافتن ارتباط بین اقلام (مثل سبد خرید)
- تشخیص ناهنجاری (Anomaly Detection): شناسایی نقاط غیرعادی
- الگوریتمهای مهم: K-Means، DBSCAN، PCA، t-SNE، Apriori
- مثال: تقسیمبندی مشتریان، تحلیل سبد خرید، فشردهسازی داده
۴.۳. یادگیری نیمهنظارتی (Semi-supervised Learning) 🟠
- تعریف: ترکیبی از دادههای برچسبدار (معمولاً کم) و دادههای بدون برچسب (معمولاً زیاد).
- توضیح ساده: مثل اینکه معلم فقط چند سؤال نمونه جواب دهد و بقیه را دانشآموز خودش از الگو حدس بزند.
- چرا مهم است: برچسبزدن داده زمانبر و پرهزینه است. در بسیاری از موارد واقعی، فقط بخش کوچکی از دادهها برچسب دارند.
- مثال: تشخیص تصاویر پزشکی که فقط تعداد کمی توسط پزشک برچسبگذاری شدهاند.
۴.۴. یادگیری تقویتی (Reinforcement Learning - RL) 🔴
- تعریف: عامل (Agent) از طریق تعامل با محیط و دریافت پاداش یا جریمه یاد میگیرد.
- توضیح ساده: مثل آموزش یک سگ: وقتی کار درست انجام میدهد تشویق میشود (پاداش) و وقتی اشتباه میکند تنبیه میشود (جریمه).
- اجزای اصلی:
- عامل (Agent): تصمیمگیرنده
- محیط (Environment): فضایی که عامل در آن عمل میکند
- حالت (State): وضعیت فعلی محیط
- عمل (Action): انتخاب عامل
- پاداش (Reward): بازخورد محیط به عامل
- سیاست (Policy): استراتژی عامل برای انتخاب عمل
- ویژگی متمایز: برچسب ندارد، بلکه سیگنال پاداش با تأخیر دریافت میشود.
- مثال: بازی شطرنج (AlphaGo)، رانندگی خودکار، مدیریت سبد سرمایهگذاری، رباتها
۴.۵. یادگیری خودنظارتی (Self-supervised Learning) 🟠
- تعریف: مدل خودش از دادههای بدون برچسب، برچسب مصنوعی تولید کرده و از آنها یاد میگیرد.
- توضیح ساده: مثل اینکه یک کتاب را بخوانید ولی هر چند جمله یک کلمه را پنهان کنید و سعی کنید آن را حدس بزنید.
- اهمیت: اساس عملکرد مدلهای زبانی بزرگ مانند GPT و BERT است.
- مثال:
- در NLP: پنهان کردن یک کلمه از جمله و پیشبینی آن (Masked Language Modeling)
- در بینایی: پنهان کردن بخشی از تصویر و بازسازی آن
نکته تکمیلی: یادگیری خودنظارتی از نظر فنی نوعی یادگیری نظارتشده است، اما برچسبها به صورت خودکار از خود داده تولید میشوند — نه توسط انسان.
۵. چگونه کار میکند؟
مقایسه فرآیند هر نوع یادگیری:
| مرحله | نظارتشده | بدون نظارت | تقویتی |
|---|---|---|---|
| ورودی | داده + برچسب | فقط داده | محیط تعاملی |
| هدف | پیشبینی برچسب | کشف ساختار | بیشینهسازی پاداش |
| بازخورد | مقایسه با جواب صحیح | بدون بازخورد مستقیم | پاداش/جریمه |
| یادگیری | کمینهسازی خطا | کشف الگو | آزمون و خطا |
| مثال خروجی | برچسب پیشبینیشده | گروهها/خوشهها | استراتژی بهینه |
۶. مثال واقعی
سیستم توصیهگر فیلم (Netflix)
یادگیری نظارتشده: پیشبینی امتیازی که کاربر به یک فیلم میدهد (رگرسیون) بر اساس امتیازات قبلی.
یادگیری بدون نظارت: تقسیم کاربران به گروههایی با سلیقه مشابه (خوشهبندی) بدون اینکه از قبل گروهها تعریف شده باشند.
یادگیری تقویتی: بهینهسازی ترتیب نمایش فیلمها بر اساس اینکه کاربر کلیک کرد یا رد شد (پاداش/جریمه).
۷. مثال خیلی ساده
| نوع یادگیری | تشبیه روزمره |
|---|---|
| نظارتشده | یادگیری با فلشکارت: سؤال و جواب را میبینید و حفظ میکنید |
| بدون نظارت | مرتب کردن کمد لباس: خودتان لباسها را بر اساس شباهت گروهبندی میکنید |
| تقویتی | یادگیری دوچرخهسواری: زمین میخورید (جریمه)، تعادل نگه میدارید (پاداش) |
| نیمهنظارتی | کتابی با فقط چند صفحه ترجمهشده: بقیه را خودتان حدس میزنید |
| خودنظارتی | بازی جورچین: خودتان تکهها را کنار هم میگذارید و از الگو یاد میگیرید |
۸. تفاوت مفاهیم مشابه
جدول مقایسه جامع 🔴
| ویژگی | نظارتشده | بدون نظارت | نیمهنظارتی | تقویتی |
|---|---|---|---|---|
| داده برچسبدار | بله - کامل | خیر | بخشی | خیر (پاداش) |
| هدف | پیشبینی | کشف الگو | پیشبینی | بیشینهسازی پاداش |
| بازخورد | مستقیم | ندارد | محدود | با تأخیر |
| وظایف | Classification, Regression | Clustering, Dim. Reduction | ترکیبی | تصمیمگیری متوالی |
| نیاز به داده | برچسبدار زیاد | بدون برچسب زیاد | کم برچسبدار + زیاد بدون برچسب | محیط تعاملی |
| پیچیدگی | متوسط | متوسط | متوسط | بالا |
| ارزیابی | آسان (مقایسه با برچسب) | دشوار | متوسط | دشوار |
طبقهبندی vs خوشهبندی 🔴
| ویژگی | طبقهبندی (Classification) | خوشهبندی (Clustering) |
|---|---|---|
| نوع یادگیری | نظارتشده | بدون نظارت |
| برچسب | از قبل مشخص | ندارد — کشف میشود |
| هدف | تخصیص به کلاس از پیش تعریفشده | کشف گروههای طبیعی |
| مثال | اسپم/غیراسپم | تقسیم مشتریان به گروهها |
۹. مزایا و محدودیتها
یادگیری نظارتشده
مزایا: - دقت بالا (چون جواب صحیح معلوم است) - ارزیابی آسان - کاربردهای گسترده و شناختهشده
محدودیتها: - نیاز به داده برچسبدار که تهیه آن هزینهبر و زمانبر است - حساس به کیفیت برچسبها
یادگیری بدون نظارت
مزایا: - نیاز به برچسب ندارد - مناسب برای کشف الگوهای ناشناخته - هزینه آمادهسازی داده کمتر
محدودیتها: - ارزیابی نتایج دشوارتر است - نتایج ممکن است نیاز به تفسیر انسانی داشته باشد
یادگیری تقویتی
مزایا: - مناسب تصمیمگیری متوالی و محیطهای پویا - یادگیری از آزمون و خطا
محدودیتها: - نیاز به محیط شبیهسازی یا تعامل واقعی - آموزش کند و پرهزینه - ممکن است در محیط واقعی خطرناک باشد (مثل رانندگی)
۱۰. کاربردهای مهم
| نوع یادگیری | کاربرد | حوزه |
|---|---|---|
| نظارتشده | تشخیص تقلب | بانکداری |
| نظارتشده | تشخیص بیماری از تصاویر | سلامت |
| نظارتشده | فیلتر اسپم | امنیت |
| بدون نظارت | تقسیمبندی مشتریان | بازاریابی |
| بدون نظارت | تشخیص ناهنجاری در شبکه | امنیت |
| بدون نظارت | تحلیل سبد خرید | تجارت الکترونیک |
| تقویتی | رانندگی خودکار | حملونقل |
| تقویتی | مدیریت سبد سرمایه | مالی |
| تقویتی | بازیهای هوشمند | سرگرمی |
| نیمهنظارتی | تشخیص تصاویر پزشکی | سلامت |
| خودنظارتی | مدلهای زبانی (GPT, BERT) | NLP |
۱۱. دیدگاه مشاورهای
انتخاب نوع یادگیری مناسب:
سؤال ۱: آیا داده برچسبدار کافی دارید؟ - بله → یادگیری نظارتشده - کم → یادگیری نیمهنظارتی - خیر → یادگیری بدون نظارت
سؤال ۲: آیا محیط تعاملی دارید؟ - بله و نیاز به تصمیمگیری متوالی دارید → یادگیری تقویتی
سؤال ۳: آیا هدف پیشبینی یک مقدار مشخص است؟ - بله، مقدار گسسته (کلاس) → طبقهبندی - بله، مقدار پیوسته (عدد) → رگرسیون - خیر، کشف ساختار → خوشهبندی یا کاهش ابعاد
مهمترین ریسک:
- انتخاب نوع یادگیری اشتباه: مثلاً استفاده از یادگیری نظارتشده وقتی داده برچسبدار ندارید
- هزینه برچسبگذاری: در پروژههای بزرگ، برچسبگذاری میتواند گلوگاه اصلی باشد
۱۲. قاعده تصمیمگیری
داده برچسبدار کافی دارید؟
├── بله
│ ├── خروجی گسسته (کلاس)؟ → طبقهبندی (Classification)
│ └── خروجی پیوسته (عدد)؟ → رگرسیون (Regression)
├── مقدار کمی برچسب + داده بدون برچسب زیاد → نیمهنظارتی
├── خیر - فقط داده بدون برچسب
│ ├── هدف: کشف گروهها → خوشهبندی (Clustering)
│ ├── هدف: کاهش پیچیدگی → کاهش ابعاد (Dim. Reduction)
│ └── هدف: یافتن ارتباطات → Association Rules
└── محیط تعاملی + تصمیمگیری متوالی → تقویتی (RL)
۱۳. 🔴 نکات طلایی آزمون
- سه نوع اصلی یادگیری: نظارتشده (برچسبدار)، بدون نظارت (بدون برچسب)، تقویتی (پاداش/جریمه)
- تفاوت کلیدی: نوع بازخورد و وجود/عدم وجود برچسب
- Classification vs Regression: هر دو نظارتشده هستند. تفاوت: خروجی گسسته (کلاس) vs پیوسته (عدد)
- Classification vs Clustering: طبقهبندی نظارتشده با برچسب؛ خوشهبندی بدون نظارت بدون برچسب
- یادگیری تقویتی ≠ یادگیری نظارتشده: در RL برچسب نداریم، فقط سیگنال پاداش با تأخیر
- اجزای RL: عامل، محیط، حالت، عمل، پاداش، سیاست
- نیمهنظارتی: وقتی کم برچسب + زیاد بدون برچسب داریم
- خودنظارتی: اساس LLMها؛ مدل خودش برچسب تولید میکند (مثل Masked LM)
- ارزیابی: نظارتشده آسانترین، بدون نظارت دشوارترین ارزیابی را دارد
- هزینه برچسبگذاری: دلیل اصلی اهمیت روشهای نیمهنظارتی و خودنظارتی
۱۴. ⚠️ دامهای رایج آزمون
دام ۱: «خوشهبندی و طبقهبندی هر دو داده را به گروه تقسیم میکنند، پس یکی هستند.»
❌ طبقهبندی نظارتشده است و کلاسها از قبل مشخصاند. خوشهبندی بدون نظارت است و گروهها کشف میشوند.دام ۲: «یادگیری تقویتی نوعی یادگیری نظارتشده است چون بازخورد دریافت میکند.»
❌ در RL بازخورد به صورت پاداش عددی با تأخیر است، نه برچسب مستقیم. عامل باید خودش کشف کند کدام اعمال پاداش بیشتری دارند.دام ۳: «یادگیری بدون نظارت دقت کمتری دارد، پس بدتر است.»
❌ هر نوع یادگیری برای مسئله خاص خودش مناسب است. وقتی برچسب نداریم، یادگیری بدون نظارت تنها گزینه است.دام ۴: «یادگیری خودنظارتی همان یادگیری بدون نظارت است.»
❌ در یادگیری خودنظارتی، مدل از خود داده برچسب مصنوعی تولید میکند و سپس مانند یادگیری نظارتشده عمل میکند. اما در بدون نظارت اصلاً برچسبی وجود ندارد.دام ۵: «رگرسیون نوعی یادگیری بدون نظارت است.»
❌ رگرسیون نظارتشده است. فقط خروجی آن عددی پیوسته است (نه کلاس).
۱۵. 🧠 خلاصه یکدقیقهای
اگر فقط یک دقیقه وقت داشتم...
- نظارتشده: داده + برچسب → پیشبینی (طبقهبندی یا رگرسیون)
- بدون نظارت: فقط داده → کشف الگو (خوشهبندی، کاهش ابعاد)
- نیمهنظارتی: کم برچسب + زیاد بدون برچسب → ترکیبی
- تقویتی: عامل + محیط + پاداش → استراتژی بهینه
- خودنظارتی: مدل خودش برچسب میسازد → اساس LLMها
- تفاوت اصلی = نوع بازخورد و وجود برچسب
- Classification = نظارتشده + خروجی کلاس | Clustering = بدون نظارت + کشف گروه
- Regression = نظارتشده + خروجی عدد
- RL: عامل، محیط، حالت، عمل، پاداش، سیاست
- انتخاب نوع یادگیری وابسته به نوع داده و هدف مسئله است
۱۶. نقشه ذهنی
انواع یادگیری (Types of Learning)
│
├── نظارتشده (Supervised)
│ ├── طبقهبندی (Classification) → خروجی: کلاس
│ └── رگرسیون (Regression) → خروجی: عدد پیوسته
│
├── بدون نظارت (Unsupervised)
│ ├── خوشهبندی (Clustering)
│ ├── کاهش ابعاد (Dimensionality Reduction)
│ ├── Association Rules
│ └── تشخیص ناهنجاری (Anomaly Detection)
│
├── نیمهنظارتی (Semi-supervised)
│ └── ترکیب کمبرچسب + بدونبرچسب
│
├── تقویتی (Reinforcement)
│ ├── عامل (Agent)
│ ├── محیط (Environment)
│ ├── پاداش (Reward)
│ └── سیاست (Policy)
│
└── خودنظارتی (Self-supervised)
├── Masked Language Modeling
└── اساس GPT / BERT
۱۷. ارتباط با سایر مباحث
| مبحث مرتبط | نوع ارتباط |
|---|---|
| مبانی ML (مبحث ۱) | انواع یادگیری تقسیمبندی اصلی ML هستند |
| طبقهبندی (مبحث ۳) | وظیفه اصلی یادگیری نظارتشده (خروجی کلاس) |
| خوشهبندی (مبحث ۴) | وظیفه اصلی یادگیری بدون نظارت |
| رگرسیون (مبحث ۵) | وظیفه دیگر یادگیری نظارتشده (خروجی عدد) |
| شبکههای عصبی (مبحث ۷) | میتوانند در هر نوع یادگیری استفاده شوند |
| LLM و NLP (فصل ۳) | مدلهای زبانی بزرگ عمدتاً از یادگیری خودنظارتی استفاده میکنند |
| AI Agents (فصل ۳) | عاملهای هوشمند از یادگیری تقویتی بهره میبرند |
📚 مراجع و منابع علمی معتبر
منابع مرتبط با همین موضوع- Berkeley
- DeepMind
- arXiv