مبحث ۷: انواع شبکههای عصبی
Types of Neural Networks
۱. این مبحث دقیقاً درباره چیست؟
شبکههای عصبی مصنوعی (Artificial Neural Networks - ANN) الگوریتمهایی هستند که الهامگرفته از ساختار مغز انسان، اطلاعات را از طریق لایههایی از نورونهای مصنوعی پردازش میکنند. این شبکهها پایه یادگیری عمیق (Deep Learning) هستند.
انواع مختلفی از شبکههای عصبی وجود دارد که هرکدام برای نوع خاصی از داده و مسئله طراحی شدهاند. شناخت این انواع و کاربردشان یکی از مهمترین موضوعات آزمونی است.
۲. تعریف ساده
تعریف ساده: شبکه عصبی مصنوعی مجموعهای از واحدهای محاسباتی (نورونها) است که در لایههای متوالی به هم متصلاند و با تنظیم وزنهای ارتباطی، الگوها را از داده یاد میگیرند.
۳. تعریف تخصصی
تعریف تخصصی: شبکههای عصبی مصنوعی مدلهای محاسباتی پارامتری هستند که از لایههای ورودی، پنهان و خروجی تشکیل شدهاند. هر نورون یک ترکیب خطی وزندار از ورودیها را محاسبه کرده و سپس از یک تابع فعالسازی غیرخطی عبور میدهد. آموزش از طریق الگوریتم پسانتشار خطا (Backpropagation) و بهینهسازی تابع هزینه انجام میشود.
۴. مفاهیم کلیدی
۴.۱. اجزای یک شبکه عصبی 🔴
| جزء | توضیح |
|---|---|
| نورون | واحد محاسباتی پایه |
| لایه ورودی (Input Layer) | دریافت داده خام |
| لایههای پنهان (Hidden Layers) | استخراج ویژگی و پردازش |
| لایه خروجی (Output Layer) | تولید نتیجه نهایی |
| وزنها (Weights) | پارامترهای یادگیریشده |
| بایاس (Bias) | ثابت اضافهشده به هر نورون |
| تابع فعالسازی (Activation Function) | اعمال غیرخطی بودن |
۴.۲. توابع فعالسازی مهم 🔴
| تابع | فرمول مفهومی | محدوده خروجی | کاربرد |
|---|---|---|---|
| Sigmoid | ۱/(۱+e⁻ˣ) | (۰, ۱) | طبقهبندی دودویی (لایه خروجی) |
| ReLU | max(۰, x) | [۰, ∞) | رایجترین در لایههای پنهان |
| Tanh | (eˣ-e⁻ˣ)/(eˣ+e⁻ˣ) | (-۱, ۱) | لایههای پنهان (RNN) |
| Softmax | eˣⁱ/Σeˣ | (۰, ۱) — مجموع = ۱ | طبقهبندی چندکلاسه (لایه خروجی) |
نکته آزمونی: Sigmoid برای خروجی دودویی، Softmax برای خروجی چندکلاسه، ReLU برای لایههای پنهان.
۴.۳. پسانتشار خطا (Backpropagation) 🟠
- تعریف: الگوریتمی برای محاسبه گرادیان تابع هزینه نسبت به وزنها و بهروزرسانی آنها.
- توضیح ساده: خطای خروجی محاسبه شده و به عقب (از لایه آخر به لایه اول) منتقل میشود تا وزنها اصلاح شوند.
- ترکیب با: گرادیان کاهشی (Gradient Descent) برای بهینهسازی.
۵. انواع شبکههای عصبی
۵.۱. پرسپترون و MLP 🔴
پرسپترون (Perceptron)
- سادهترین شبکه عصبی: فقط یک نورون با ورودیها، وزنها و یک تابع فعالسازی.
- محدودیت: فقط مسائل خطی جداییپذیر را حل میکند.
- اهمیت تاریخی: پایهگذار شبکههای عصبی.
شبکه عصبی چندلایه (Multi-Layer Perceptron - MLP)
- ساختار: لایه ورودی + یک یا چند لایه پنهان + لایه خروجی
- توانایی: حل مسائل غیرخطی (برخلاف پرسپترون ساده)
- آموزش: Backpropagation + Gradient Descent
- کاربرد: طبقهبندی و رگرسیون عمومی
۵.۲. شبکه عصبی کانولوشنی (Convolutional Neural Network - CNN) 🔴
- طراحیشده برای: دادههای شبکهای/مکانی (تصویر، ویدیو)
- ایده اصلی: استفاده از فیلترهای کانولوشن که الگوهای محلی (لبه، بافت، شکل) را شناسایی میکنند.
- لایههای کلیدی:
- Convolutional Layer: استخراج ویژگی با فیلتر
- Pooling Layer: کاهش ابعاد (Max Pooling, Average Pooling)
- Fully Connected Layer: طبقهبندی نهایی
- ویژگی مهم: اشتراک وزن (Weight Sharing) → تعداد پارامترها کمتر
- مزیت: یادگیری خودکار ویژگیها بدون Feature Engineering دستی
- کاربرد: تشخیص تصویر، بینایی ماشین، تشخیص اشیاء
- نمونههای معروف: AlexNet, VGG, ResNet, GoogLeNet
۵.۳. شبکه عصبی بازگشتی (Recurrent Neural Network - RNN) 🔴
- طراحیشده برای: دادههای ترتیبی/زمانی (متن، سری زمانی، صوت)
- ایده اصلی: دارای حافظه — خروجی هر مرحله به ورودی مرحله بعد هم داده میشود.
- مشکل اصلی: ناپدید شدن/انفجار گرادیان (Vanishing/Exploding Gradient) در دنبالههای طولانی.
- کاربرد: NLP، ترجمه ماشینی، پیشبینی سری زمانی
۵.۴. LSTM و GRU 🔴
LSTM (Long Short-Term Memory)
- هدف: حل مشکل ناپدید شدن گرادیان در RNN
- ایده: دروازههایی (Gates) برای کنترل جریان اطلاعات:
- Forget Gate: چه اطلاعاتی فراموش شود
- Input Gate: چه اطلاعات جدیدی ذخیره شود
- Output Gate: چه اطلاعاتی خروجی دهد
- مزیت: یادگیری وابستگیهای بلندمدت (Long-term Dependencies)
GRU (Gated Recurrent Unit)
- نسخه سادهتر LSTM: دو دروازه (Reset, Update) بجای سه
- مزیت: سریعتر از LSTM با عملکرد مشابه
- کاربرد مشابه LSTM
۵.۵. ترنسفورمر (Transformer) 🔴
- معرفی: مقاله «Attention Is All You Need» (۲۰۱۷)
- ایده اصلی: مکانیزم توجه (Attention) — مدل میتواند به هر بخش از ورودی همزمان توجه کند (نه مرحلهبهمرحله مثل RNN).
- Self-Attention: هر کلمه/توکن به تمام کلمات دیگر توجه میکند.
- مزیت بر RNN:
- پردازش موازی (بسیار سریعتر)
- یادگیری وابستگیهای بلندمدت بدون مشکل گرادیان
- ساختار: Encoder-Decoder (یا فقط یکی)
- اساس: تمام مدلهای زبانی بزرگ (GPT, BERT, LLaMA, Gemini)
- کاربرد: NLP، بینایی (ViT)، صوت، چندمدالی
۵.۶. شبکه مولد تخاصمی (GAN - Generative Adversarial Network) 🟠
- ایده: دو شبکه رقیب:
- Generator (مولد): تولید داده جعلی
- Discriminator (تشخیصدهنده): تشخیص داده واقعی از جعلی
- فرآیند: این دو شبکه با رقابت، یکدیگر را بهبود میدهند.
- کاربرد: تولید تصویر، Deepfake، افزایش داده، انتقال سبک
- مزیت: تولید دادههای واقعگرایانه
- محدودیت: آموزش ناپایدار، Mode Collapse
۵.۷. خودرمزنگار (Autoencoder - AE) 🟠
- ایده: فشردهسازی ورودی به یک بازنمایی کمبعد (Latent Space) و سپس بازسازی آن.
- ساختار: Encoder → Bottleneck → Decoder
- کاربرد: کاهش ابعاد، حذف نویز (Denoising)، تشخیص ناهنجاری، تولید داده (VAE)
- نوع: یادگیری بدون نظارت
۶. مثال واقعی
تشخیص خودکار تصاویر پزشکی
مسئله: تشخیص رتینوپاتی دیابتی از تصاویر شبکیه چشم.
روش: استفاده از CNN (مثل ResNet) آموزشدیده روی هزاران تصویر برچسبدار.
نتیجه: سیستم Google DeepMind عملکردی همسطح چشمپزشکان متخصص در تشخیص بیماری داشت.
۷. مثال خیلی ساده
| شبکه | مثال روزمره |
|---|---|
| MLP | مثل خواندن یک جدول و تصمیمگیری |
| CNN | مثل چشم: ابتدا لبهها، سپس اشکال، سپس اشیاء را میبیند |
| RNN | مثل خواندن یک جمله: هر کلمه با توجه به کلمات قبلی معنا میدهد |
| Transformer | مثل خواندن کل جمله یکجا و فهم ارتباط هر کلمه با تمام کلمات |
| GAN | مثل جعلساز و کارآگاه: یکی جعل میکند، دیگری تشخیص میدهد |
۸. تفاوت مفاهیم مشابه
جدول مقایسه جامع 🔴
| شبکه | نوع داده | ایده اصلی | کاربرد اصلی | محدودیت اصلی |
|---|---|---|---|---|
| MLP | جدولی/ساختاریافته | لایههای تماممتصل | طبقهبندی/رگرسیون عمومی | ضعیف در تصویر/متن |
| CNN | تصویر/شبکهای | فیلتر کانولوشن | بینایی ماشین | نیاز به داده زیاد |
| RNN | ترتیبی/زمانی | حافظه بازگشتی | NLP, سری زمانی | ناپدیدشدن گرادیان |
| LSTM | ترتیبی/زمانی | دروازهها | NLP, سری زمانی | کند |
| Transformer | ترتیبی (و غیره) | Self-Attention | NLP, LLM, بینایی | هزینه محاسباتی بالا |
| GAN | تصویر/داده | مولد + تشخیصدهنده | تولید داده | آموزش ناپایدار |
| Autoencoder | هر نوع | فشردهسازی + بازسازی | کاهش ابعاد, تشخیص ناهنجاری | بازسازی تقریبی |
CNN vs RNN vs Transformer 🔴
| ویژگی | CNN | RNN/LSTM | Transformer |
|---|---|---|---|
| نوع داده | مکانی (تصویر) | ترتیبی (متن/زمان) | هر دو |
| پردازش | محلی (فیلتر) | مرحلهای | موازی (Attention) |
| وابستگی بلندمدت | ضعیف | متوسط (LSTM بهتر) | عالی |
| سرعت آموزش | سریع | کند | سریع (موازی) |
| اساس LLMها | خیر | خیر | بله ✅ |
۹. مزایا و محدودیتهای شبکههای عصبی (کلی)
مزایا ✅
- یادگیری الگوهای پیچیده: توانایی مدلسازی روابط بسیار غیرخطی
- یادگیری خودکار ویژگی: بخصوص در DL نیاز به Feature Engineering دستی کمتر
- کاربرد گسترده: تصویر، متن، صوت، ویدیو، داده جدولی
محدودیتها ⛔
- جعبه سیاه: تفسیرپذیری پایین
- نیاز به داده زیاد: بخصوص یادگیری عمیق
- هزینه محاسباتی بالا: نیاز به GPU/TPU
- بیشبرازش: بخصوص با داده کم
- ناپدید شدن گرادیان: مشکل RNN (حلشده با LSTM و Transformer)
۱۰. کاربردهای مهم
| شبکه | حوزه | کاربرد |
|---|---|---|
| CNN | سلامت | تشخیص بیماری از تصویر پزشکی |
| CNN | امنیت | تشخیص چهره |
| RNN/LSTM | مالی | پیشبینی قیمت سهام |
| Transformer | NLP | ترجمه ماشینی، چتبات |
| Transformer | AI مولد | GPT, BERT, Gemini |
| GAN | تولید محتوا | تولید تصویر، Deepfake |
| Autoencoder | امنیت | تشخیص ناهنجاری |
۱۱. 🔴 نکات طلایی آزمون
- CNN → تصویر | RNN/LSTM → ترتیبی | Transformer → همهکاره (اساس LLM)
- Transformer = Attention Is All You Need. مکانیزم Self-Attention. پردازش موازی.
- LSTM مشکل ناپدیدشدن گرادیان RNN را حل کرد با دروازهها (Forget, Input, Output).
- GAN = Generator + Discriminator. رقابت = بهبود.
- CNN: فیلتر کانولوشن → Pooling → Fully Connected. اشتراک وزن.
- ReLU: رایجترین تابع فعالسازی در لایههای پنهان.
- Sigmoid → خروجی دودویی | Softmax → خروجی چندکلاسه.
- Backpropagation: الگوریتم آموزش شبکههای عصبی (انتشار خطا از آخر به اول).
- یادگیری عمیق = شبکه عصبی با چندین لایه پنهان.
- Autoencoder: Encoder → Bottleneck → Decoder. کاهش ابعاد بدون نظارت.
۱۲. ⚠️ دامهای رایج آزمون
دام ۱: «CNN برای متن و RNN برای تصویر طراحی شده.»
❌ برعکس! CNN اصالتاً برای تصویر و RNN برای متن/ترتیبی طراحی شده (اگرچه CNN هم برای متن استفاده میشود).دام ۲: «Transformer نوعی RNN است.»
❌ Transformer جایگزین RNN است. از Attention بجای بازگشت استفاده میکند و پردازش موازی دارد.دام ۳: «GAN نوعی طبقهبندیکننده است.»
❌ GAN یک مدل مولد (Generative) است. هدفش تولید داده جدید است، نه طبقهبندی.دام ۴: «همه شبکههای عصبی عمیق هستند.»
❌ پرسپترون و MLP با یک لایه پنهان «عمیق» نیستند. Deep Learning = چندین لایه پنهان.دام ۵: «LSTM و GRU کاملاً متفاوت هستند.»
❌ GRU نسخه سادهتر LSTM است (۲ دروازه بجای ۳). عملکرد مشابه، محاسبات کمتر.
۱۳. 🧠 خلاصه یکدقیقهای
اگر فقط یک دقیقه وقت داشتم...
- شبکه عصبی = لایه ورودی + لایه(های) پنهان + لایه خروجی
- MLP: عمومی، داده جدولی
- CNN: تصویر → فیلتر + Pooling + FC | اشتراک وزن
- RNN: ترتیبی → حافظه | مشکل: ناپدید شدن گرادیان
- LSTM: حل مشکل RNN با دروازهها (Forget, Input, Output)
- Transformer: Attention = همهچیز! موازی، سریع، اساس LLMها
- GAN: Generator vs Discriminator → تولید داده
- Autoencoder: Encoder → Bottleneck → Decoder → کاهش ابعاد
- ReLU = لایه پنهان | Sigmoid = خروجی دودویی | Softmax = خروجی چندکلاسه
- Backpropagation = الگوریتم آموزش
۱۴. نقشه ذهنی
شبکههای عصبی (Neural Networks)
│
├── اجزا
│ ├── نورون، وزن، بایاس
│ ├── لایه: ورودی/پنهان/خروجی
│ ├── تابع فعالسازی: ReLU, Sigmoid, Softmax
│ └── آموزش: Backpropagation + Gradient Descent
│
├── انواع
│ ├── MLP ← داده جدولی
│ ├── CNN ← تصویر (فیلتر + Pooling)
│ ├── RNN ← ترتیبی (حافظه)
│ │ ├── LSTM ← دروازهها (حل Vanishing Gradient)
│ │ └── GRU ← سادهتر از LSTM
│ ├── Transformer ← Attention (اساس LLM)
│ ├── GAN ← تولید داده (Generator vs Discriminator)
│ └── Autoencoder ← فشردهسازی (Encoder-Decoder)
│
└── یادگیری عمیق
└── Deep Learning = شبکه عصبی + چندین لایه پنهان
۱۵. ارتباط با سایر مباحث
| مبحث مرتبط | نوع ارتباط |
|---|---|
| مبانی ML (مبحث ۱) | شبکههای عصبی زیرمجموعه ML |
| طبقهبندی/رگرسیون (مبحث ۳/۵) | NN برای هر دو قابل استفاده |
| بینایی ماشین (فصل ۴) | CNN ابزار اصلی |
| NLP و LLM (فصل ۳) | Transformer اساس LLMها |
| AI مولد (فصل ۳) | GAN و Transformer برای تولید محتوا |
۱۶. سؤالات احتمالی آزمون
کدام شبکه عصبی برای پردازش تصویر طراحی شده و از فیلترهای کانولوشن استفاده میکند؟
مشکل اصلی RNN در دنبالههای طولانی چیست و کدام معماری آن را حل کرد؟
مزیت اصلی Transformer نسبت به RNN چیست؟
GAN از چه اجزایی تشکیل شده است؟
کدام تابع فعالسازی برای لایه خروجی طبقهبندی چندکلاسه مناسب است؟
کدام معماری اساس مدلهای زبانی بزرگ مانند GPT و BERT است؟
یک شرکت میخواهد از روی دادههای سری زمانی فروش ماهانه، فروش ماه آینده را پیشبینی کند. کدام شبکه مناسبتر است؟
۱۷. سطحبندی مطالب
🔴 سطح ۱ — ضروری:
- اجزای شبکه عصبی (نورون، لایه، وزن، تابع فعالسازی)
- CNN → تصویر | RNN/LSTM → ترتیبی | Transformer → LLM
- توابع فعالسازی: ReLU, Sigmoid, Softmax
- مشکل Vanishing Gradient و راهحل LSTM
- Transformer و مکانیزم Attention
🟠 سطح ۲ — مهم:
- GAN (Generator + Discriminator)
- Autoencoder
- Backpropagation
- GRU vs LSTM
- معماریهای معروف CNN (ResNet, VGG)
🟢 سطح ۳ — تکمیلی:
- جزئیات ریاضی Attention
- معماریهای خاص (U-Net, YOLO)
- تنظیم فراپارامترها
📚 مراجع و منابع علمی معتبر
منابع مرتبط با همین موضوع- Stanford
- Nature
- PyTorch