مبحث ۱: پردازش تصویر و بینایی ماشین
Computer Vision, Digital Image Processing & Deep Vision Architectures
۱. این مبحث دقیقاً درباره چیست؟
بیش از ۸۰ درصد اطلاعاتی که مغز انسان از محیط پیرامون دریافت میکند از کانال بینایی است. در دنیای فناوری اطلاعات نیز، دوربینهای نظارتی، دستگاههای عکسبرداری پزشکی (MRI و CT)، دوربینهای خطوط تولید کارخانجات، سامانههای پلاکخوان هوشمند و خودروهای خودران، حجم عظیمی از دادههای بصری را تولید میکنند.
با این حال، یک رایانه تصویر را نمیبیند؛ آنچه کامپیوتر دریافت میکند، صرفاً یک ماتریس چندبعدی از اعداد (شدت روشنایی پیکسلها از ۰ تا ۲۵۵ در کانالهای رنگی RGB) است. چالش بنیادین این است: چگونه میتوان از این ماتریسهای عددی خام و بیمعنا، مفاهیم انتزاعی سطح بالا (نظیر چهره یک شخص خاص، عیب لعاب یک کاشی، پلاک یک خودرو یا تومور ریوی) را استخراج، ردیابی و تفسیر کرد؟
این مبحث به عنوان هسته اصلی حوزه AI05، طیف کاملی از پیشپردازشهای کلاسیک تصویر (فیلترها، تبدیل هیستوگرام، لبهیابی و ریختشناسی)، وظایف بنیادین بینایی (طبقهبندی، مکانیابی اشیاء، بخشبندی پیکسلی و بازشناسی چهره)، معماری شبکههای عصبی کانولوشنی (CNN)، پیشرفتهای انقلابی ResNet و YOLO، و ترنسفورمرهای بینایی (ViT) را مورد واکاوی دقیق قرار میدهد.
۲. تعریف ساده
تعریف ساده: فرض کنید یک کودک به یک تصویر پر از اسباببازی نگاه میکند: ۱. اگر فقط بپرسید «آیا در این عکس توپ هست؟» و او بگوید «بله»، کار طبقهبندی (Classification) انجام داده است. ۲. اگر بپرسید «توپ کجای عکس است؟» و او با انگشت دور آن یک کادر بکشد، کار تشخیص شیء (Object Detection) انجام داده است. ۳. اگر یک مداد شمعی به او بدهید و بگویید «دقیقاً تمام پیکسلهای خود توپ را رنگ کن بدون اینکه از لبه بیرون بزند»، کار بخشبندی (Segmentation) انجام داده است. بینایی ماشین یعنی آموزش این مهارتهای سهگانه دیداری به رایانه.
۳. تعریف تخصصی
تعریف تخصصی (مهندسی سامانههای بینایی رقومی): بینایی ماشین (Computer Vision) شاخهای از هوش مصنوعی و پردازش سیگنال است که با فرمولبندی توابع نگاشت ریاضی بر روی فضاهای تصویر دوبعدی ($I(x, y)$) یا ابرهای سهبعدی نقاط، به بازسازی خودکار صحنه، استخراج ویژگیهای ناوردا (Invariant Features)، قطعهبندی معنایی و استنتاج تصمیمات ادراکی سطح بالا میپردازد. این علم با بهرهگیری از عملگرهای کانولوشن گسسته، توابع اتلاف مکانیابی و الگوهای خودتوجهی (Self-Attention)، شکاف معنایی (Semantic Gap) میان پیکسلهای عددی و مفاهیم جهان واقعی را پر میکند.
۴. مفاهیم کلیدی
۴.۱. چهارگانه وظایف بنیادین بینایی ماشین (Core Vision Tasks) 🔴
سلسلهمراتب وظایف بینایی ماشین
┌─────────────────────────────────────────────────────────────────┐
│ ۱. طبقهبندی تصویر (Image Classification) │ ◄── برچسب کلی برای کل عکس («گربه»)
├─────────────────────────────────────────────────────────────────┤
│ ۲. تشخیص شیء (Object Detection) │ ◄── مکانیابی با کادر مستطیلی (Bounding Box)
├─────────────────────────────────────────────────────────────────┤
│ ۳. بخشبندی معنایی (Semantic Segmentation) │ ◄── تفکیک پیکسلی کلاسها (خیابان vs ماشین)
├─────────────────────────────────────────────────────────────────┤
│ ۴. بخشبندی نمونهها (Instance Segmentation) │ ◄── تفکیک پیکسلی هر ماشین مجزا از دیگری
└─────────────────────────────────────────────────────────────────┘
| وظیفه | پرسش بنیادین | خروجی مدل | نمونه معماری شاخص |
|---|---|---|---|
| طبقهبندی تصویر (Classification) | «این تصویر متعلق به کدام دسته است؟» | یک برچسب کلاس و درصد اطمینان | ResNet, VGG, ViT |
| تشخیص و مکانیابی (Detection) | «چه اشیایی در کجای تصویر قرار دارند؟» | کادر مستطیلی ($[x, y, w, h]$) + برچسب | YOLOv8/v11, Faster R-CNN, SSD |
| بخشبندی معنایی (Semantic Seg) | «هر پیکسل تصویر متعلق به کدام رده است؟» | ماسک رنگی پیکسلی بدون تفکیک اشیاء همکلاس | U-Net, DeepLabV3+, FCN |
| بخشبندی نمونهها (Instance Seg) | «هر نمونه منحصربهفرد از اشیاء دقیقاً کجاست؟» | ماسک رنگی پیکسلی با شناسه مجزا برای هر سوژه | Mask R-CNN, YOLO-Seg |
| تخمین حالت بدن (Pose Estimation) | «مفاصل و استخوانبندی شخص در چه زاویهای است؟» | مختصات نقاط کلیدی بدن (Keypoints) | OpenPose, MediaPipe |
| بازشناسی چهره (Face Recognition) | «این چهره متعلق به کدام فرد ثبتشده است؟» | بردار ویژگی ۱۲۸ یا ۵۱۲ بعدی چهره | FaceNet, ArcFace |
۴.۲. پیشپردازش کلاسیک و فیلترهای مکانی (Classical Image Processing) 🔴
قبل از آموزش مدلهای عمیق یا در سامانههای کممصرف، پیشپردازش تصویر با فیلترهای مکانی (Spatial Kernels) ضروری است:
[ماتریس فیلتر / کرنل ۳×۳] [بلوک ۳×۳ از تصویر]
┌─────┬─────┬─────┐ ┌─────┬─────┬─────┐
│ w11 │ w12 │ w13 │ │ p11 │ p12 │ p13 │
├─────┼─────┼─────┤ ضرب نقطه به نقطه ├─────┼─────┼─────┤
│ w21 │ w22 │ w23 │ ────────────────► │ p21 │ p22 │ p23 │ ──► محاسبه مقدار پیکسل جدید مرکز
├─────┼─────┼─────┤ ├─────┼─────┼─────┤
│ w31 │ w32 │ w33 │ │ p31 │ p32 │ p33 │
└─────┴─────┴─────┘ └─────┴─────┴─────┘
۱. فیلترهای رفع نویز و هموارسازی (Smoothing):
- فیلتر میانگین (Mean Filter): جایگزینی هر پیکسل با میانگین همسایهها؛ تصویر را مات میکند و لبهها را از بین میبرد.
- فیلتر گوسی (Gaussian Filter): اختصاص وزنهای بیشتر به پیکسلهای مرکزی با تابع توزیع نرمال گاوسی؛ ماتشدگی ملایم و حفظ بهتر لبهها.
- فیلتر میانه (Median Filter) 🔴 — بسیار تستخیز:
- مرتبسازی پیکسلهای پنجره و انتخاب عدد میانه.
- ویژگی کلیدی: بهترین فیلتر برای حذف کامل نویز نمک و فلفل (Salt & Pepper Noise) بدون تار کردن شدید لبههای تصویر.
۲. فیلترهای آشکارساز لبه (Edge Detection):
- لبهها محل تغییرات ناگهانی در شدت روشنایی پیکسلها هستند (نقاط بیشینه مشتق اول یا عبور از صفر مشتق دوم).
- عملگر سوبل (Sobel): استفاده از دو کرنل $3 \times 3$ برای محاسبه گرادیان افقی ($G_x$) و عمودی ($G_y$).
- الگوریتم بهینه کانی (Canny Edge Detector) 🔴 — فرآیند ۵ مرحلهای استاندارد آزمون:
- هموارسازی تصویر با فیلتر گوسی جهت حذف نویز.
- محاسبه اندازه و جهت گرادیان تصویر با سوبل.
- مهار غیربیشینهها (Non-Maximum Suppression): نازک کردن لبهها با نگه داشتن تنها پیکسلهای دارای بالاترین مقدار موضعی در امتداد گرادیان.
- آستانهگذاری دوگانه (Double Thresholding): تفکیک لبهها به قوی، ضعیف و غیرلبه با دو حد آستانه بالا ($T_{high}$) و پایین ($T_{low}$).
- ردیابی لبه با هیسترزیس (Edge Tracking by Hysteresis): حفظ لبههای ضعیف تنها در صورتی که به لبههای قوی متصل باشند.
۳. هیستوگرام و عملیات ریختشناسی (Morphology):
- تعدیل هیستوگرام (Histogram Equalization): پهن کردن تابع توزیع شدت روشنایی پیکسلها جهت افزایش چشمگیر کنتراست تصویر.
- اتساع (Dilation): افزودن پیکسل به مرز اشیاء سفید $\rightarrow$ بزرگ شدن اشیاء و پر شدن سوراخهای کوچک.
- فرسایش (Erosion): تراشیدن لایهای از مرز اشیاء $\rightarrow$ کوچک شدن اشیاء و قطع اتصالات باریک ناخواسته.
- عملگر باز کردن (Opening): فرسایش و سپس اتساع $\rightarrow$ حذف نویزهای ریز معلق در پسزمینه.
- عملگر بستن (Closing): اتساع و سپس فرسایش $\rightarrow$ پر کردن شکافها و حفرههای درون اشیاء.
۴.۳. شبکههای عصبی کانولوشنی (CNN) و کالبدشکافی لایهها 🔴
شبکههای کانولوشنی استاندارد طلایی یادگیری عمیق در بینایی ماشین هستند:
[تصویر ورودی: ۲۲۴×۲۲۴×۳]
│
▼
[لایه کانولوشن + ReLU] ──► استخراج ویژگیهای پایه (خطوط، لبهها، رنگها)
│
▼
[لایه پولینگ (Max Pool)] ──► کاهش ابعاد و فشردهسازی تصویر به ۱۱۲×۱۱۲
│
▼
[لایه کانولوشن عمیقتر] ──► استخراج ویژگیهای پیچیده (چشم، چرخ خودرو، گوشه)
│
▼
[لایههای تماممتصل (FC)] ──► ترکیب ویژگیها برای طبقهبندی
│
▼
[لایه خروجی Softmax] ──► پیشبینی احتمال کلاسها (گربه: ۸۹٪، سگ: ۱۱٪)
خواص سهگانه بنیادین لایه کانولوشن 🔴:
- ارتباطات محلی (Local Connectivity): هر نورون فقط به یک پنجره کوچک (Receptive Field) از تصویر ورودی وصل است نه تمام پیکسلها.
- اشتراک وزنها (Weight Sharing): یک فیلتر یکسان در سراسر تصویر جابجا میشود که باعث کاهش چشمگیر تعداد پارامترهای آموزشپذیر در مقایسه با شبکههای تماممتصل (MLP) میگردد.
- هموردایی با جابجایی (Translation Equivariance): اگر سوژه در تصویر جابجا شود، نقشه ویژگی متناظر با آن نیز دقیقاً به همان میزان در خروجی جابجا میشود.
نقش لایه پولینگ (Pooling Layer):
- کاهش ابعاد مکانی تصویر و کاهش بار محاسباتی.
- ایجاد ناوردایی با جابجایی (Translation Invariance)؛ به این معنا که سیستم بدون توجه به تغییرات میلیمتری مکان سوژه، کلیت آن را تشخیص میدهد.
- انواع: بیشینهگیری (Max Pooling - حفظ برجستهترین ویژگیها) و میانگینگیری (Average Pooling).
۴.۴. تکامل معماریهای پیشرو بینایی ماشین 🔴
| معماری | سال | نوآوری کلیدی | اهمیت آزمونی |
|---|---|---|---|
| LeNet-5 | ۱۹۹۸ | اولین CNN تجاری موفق یان لکان | استفاده برای خواندن ارقام چکهای بانکی |
| AlexNet | ۲۰۱۲ | استفاده از GPU، تابع ReLU و Dropout | پیروزی با اختلاف در ImageNet و آغاز دوره نوین Deep Learning |
| VGGNet | ۲۰۱۴ | استفاده منحصربهفرد از فیلترهای کوچک $3 \times 3$ پیاپی | سادگی معماری اما حجم پارامترهای بسیار سنگین (۱۳۸ میلیون پارامتر) |
| ResNet | ۲۰۱۵ | اتصالات جهشی (Skip / Residual Connections) | حل قطعی مشکل محو شدن گرادیان (Vanishing Gradient) و امکان آموزش شبکههای ۱۵۲ لایهای |
| YOLO (v1 تا v11) | ۲۰۱۶ تاکنون | مدل تشخیص شیء تکمرحلهای (One-Stage) | استنتاج بلادرنگ و فوقسریع (بیش از ۶۰ فریم در ثانیه) |
| Vision Transformer (ViT) | ۲۰۲۰ | شکستن تصویر به پچهای پیکسلی و پردازش با ترنسفورمر | مقیاسپذیری بینظیر روی کلاندادهها و عبور از محدودیتهای کانولوشن |
۴.۵. معماریهای تشخیص شیء: تکمرحلهای (YOLO) در برابر دومرحلهای (Faster R-CNN) 🔴
[معماری دومرحلهای - Two-Stage (Faster R-CNN)]
تصویر ──► استخراج ویژگی ──► شبکه پیشنهاد ناحیه (RPN) ──► کاندیداهای شیء ──► طبقهبندی و اصلاح کادر
(ویژگی: دقت بسیار بالا اما سرعت کند، نامناسب برای سامانههای بلادرنگ)
[معماری تکمرحلهای - One-Stage (YOLO / SSD)]
تصویر ───────────────────► شبکه عصبی واحد (تکگذر Forward) ───────────────────► کادرهای نهایی و کلاسها
(ویژگی: فوقالعاده سریع، مناسب دوربینهای ترافیکی و رباتیک بلادرنگ)
معیارهای ارزیابی تشخیص شیء 🔴:
- تقاطع بر اجتماع (IoU - Intersection over Union): $$\text{IoU} = \frac{\text{Area of Overlap}}{\text{Area of Union}}$$ میزان انطباق کادر پیشبینیشده با کادر واقعی (Ground Truth). اگر $\text{IoU} \ge 0.5$ باشد، تشخیص صحیح (True Positive) تلقی میشود.
- مهار غیربیشینه (Non-Maximum Suppression - NMS) 🔴: مدلهای تشخیص شیء معمولاً دور یک شیء دهها کادر همپوشان میکشند. الگوریتم NMS کادری را که بالاترین امتیاز اطمینان را دارد نگه داشته و تمام کادرهای همپوشان دارای IoU بالا با آن را حذف میکند.
- معیار mAP (Mean Average Precision): میانگین دقت مدل در تمام کلاسها و در آستانههای مختلف IoU (معیار استاندارد بنچمارک مسابقات بینالمللی).
۵. چگونه کار میکند؟
خط لوله تشخیص بلادرنگ شیء در معماری YOLO (You Only Look Once):
[تصویر ورودی دوربین مداربسته: ۶۴۰×۶۴۰]
│
▼
[تقسیم تصویر به یک شبکه گرید S×S]
(مثلاً شبکه ۲۰×۲۰ خانه)
│
▼
[استخراج ویژگی با بدنه Backbone]
(شبکه کانولوشنی بهینه)
│
▼
┌─────────────────────────────────────────────────────────┐
│ برای هر سلول گرید به صورت همزمان پیشبینی میشود: │
│ ۱. مختصات جعبههای مرزی: [x, y, w, h] │
│ ۲. امتیاز اطمینان از وجود شیء (Objectness Score) │
│ ۳. احتمال تعلق به هر یک از کلاسها (Class Probabilities) │
└────────────────────────────┬────────────────────────────┘
│
▼
[تولید صدها کادر اولیه با احتمالهای مختلف]
│
▼
[اعمال فیلتر آستانه اطمینان (Confidence Threshold)]
│
▼
[اجرای الگوریتم مهار غیربیشینه (NMS)]
(حذف کادرهای زائد تکراری به دور یک سوژه)
│
▼
[خروجی نهایی: ترسیم کادرهای تمیز دور خودروها و افراد با برچسب و درصد]
۶. مثال واقعی
سامانه پلاکخوان هوشمند و تشخیص تخلفات رانندگی (ANPR / ALPR)
- مسئله: پلیس راهور نیازمند پایش خودکار خودروهای عبوری در بزرگراهها در تمام ساعات شبانهروز و در سرعتهای بالای ۱۲۰ کیلومتر بر ساعت است. شرایط جوی نامساعد (باران، مه، تابش شدید آفتاب و کثیفی پلاکها) پلاکخوانهای سنتی را با خطای بالای ۳۰ درصد مواجه میکرد.
- معماری پیادهسازیشده بینایی ماشین:
- گام ۱ (پیشپردازش نور و کنتراست): اعمال الگوریتم تعدیل هیستوگرام سازگار با محدودیت کنتراست (CLAHE) برای شفافسازی پلاک در تصاویر تاریک شب.
- گام ۲ (تشخیص خودرو و مکان پلاک): مدل تکمرحلهای YOLOv8-tiny با سرعت ۱۲۰ فریم در ثانیه کادر دقیق پلاک را در کل صحنه شناسایی میکند.
- گام ۳ (تصحیح زاویه دید - Perspective Transform): اصلاح پرسپکتیو با تبدیل هوموگرافی برای صاف کردن پلاکهای کج.
- گام ۴ (بازشناسی حروف و ارقام - OCR): استفاده از یک شبکه ترکیبی کانولوشنی-بازگشتی (CRNN) همراه با تابع اتلاف CTC برای خوانش حروف فارسی بدون نیاز به برش زدن تکتک حروف.
- نتیجه: دقت خوانش پلاک به بیش از ۹۸.۵ درصد در تمام شرایط نوری، زمان پردازش کمتر از ۱۵ میلیثانیه به ازای هر خودرو، و ثبت خودکار تخلفات سرعت غیرمجاز.
۷. مثال خیلی ساده
کارکرد لایههای کانولوشن دقیقاً مثل کارآگاهی است که با ذرهبین به یک اثر انگشت نگاه میکند: - در ابتدا ذرهبین را خیلی نزدیک میگیرد و فقط خطوط خمیده کوچک را میبیند (لایههای اول: تشخیص لبهها). - سپس کمی عقبتر میرود و حلقههای کامل اثر انگشت را تشخیص میدهد (لایههای میانی: بافتها و اشکال). - در نهایت تمام تصویر را در یک نگاه بررسی کرده و میگوید این اثر انگشت متعلق به فرد مظنون است (لایههای آخر: طبقهبندی نهایی).
۸. تفاوت مفاهیم مشابه
۸.۱. ماتریس مقایسه تخصصی وظایف چهارگانه بینایی ماشین 🔴
| معیار ارزیابی | Image Classification | Object Detection | Semantic Segmentation | Instance Segmentation |
|---|---|---|---|---|
| سطح تحلیل | کل تصویر به عنوان یک کلیت | اشیاء درون تصویر با مختصات کادر | تکتک پیکسلهای تصویر | تکتک پیکسلهای تفکیکشده اشیاء |
| خروجی ریاضی | بردار احتمالات کلاسها ($1 \times C$) | ماتریس کادرها ($N \times [x, y, w, h, c]$) | ماتریس دوبعدی برچسبها ($H \times W$) | ماتریس سهبعدی ماسکها ($N \times H \times W$) |
| تفکیک افراد همجنس؟ | خیر | بله (دو کادر جداگانه) | خیر (همه افراد یک رنگ میشوند) | بله (هر شخص یک ماسک مستقل دارد) |
| پیچیدگی و هزینه | سبک و بسیار سریع | متوسط تا سریع (بسته به مدل) | سنگین | بسیار سنگین |
| کاربرد نمونه | تفکیک عکس سگ از گربه | تشخیص خودرو و عابر در رانندگی | شناسایی مسیر آسفالت خیابان | جراحی روباتیک و شمارش سلولها |
۸.۲. مقایسه شبکههای CNN در برابر ترنسفورمرهای بینایی (ViT) 🔴
| شاخص مقایسه | شبکههای کانولوشنی (CNNs مانند ResNet) | ترنسفورمرهای بینایی (ViT) |
|---|---|---|
| سوگیری استقرایی (Inductive Bias) | بسیار بالا (فرض محلی بودن پیکسلها و هموردایی با جابجایی در معماری تثبیت شده) | بسیار پایین (مدل هیچ فرضی درباره ساختار دوبعدی تصویر ندارد و همه چیز را باید بیاموزد) |
| حجم داده آموزشی لازم | عملکرد عالی با دادگان متوسط (چند هزار تصویر) | نیازمند دادگان فوقالعاده عظیم (میلیونها تصویر مانند JFT-300M) |
| دقت نهایی در کلانداده | اشباع زودهنگام در دقت | پیروز میدان با مقیاسپذیری تصاعدی |
| مصرف حافظه در رزولوشن بالا | رشد خطی با ابعاد تصویر | رشد مربعی ($O(N^2)$) با تعداد پچهای تصویر |
۹. مزایا و محدودیتها
مزایا ✅
- اتوماسیون بازرسی کیفی با دقت میکرومتری: کشف ناپیوستگیها و عیوب ساختاری در خطوط تولید فلزات و داروسازی بسیار فراتر از چشم انسان.
- نظارت امنیتی ۲۴ ساعته بدون خستگی: مانیتورینگ خودکار محیطهای حساس، فرودگاهها و مرزها.
- انقلاب در سلامت و جراحی: راهنمایی پزشکان در تفسیر اسکنهای رادیولوژی و جراحیهای ظریف با بینایی روباتیک.
- توانمندسازی فناوریهای خودران: پایه و اساس ناوبری خودروها، پهپادهای نقشهبرداری و زیردریاییهای کاوشگر.
محدودیتها و چالشها ⛔
- حساسیت شدید به تغییرات نوری و محیطی (Domain Shift): مدلی که در روز آفتابی با دقت ۹۹٪ کار میکند، ممکن است در شب بارانی دچار سقوط کامل عملکرد شود.
- چالش انسداد و همپوشانی فیزیکی (Occlusion): اگر نیمی از چهره یا سوژه پشت مانعی پنهان شود، شبکههای ساده قادر به تشخیص آن نیستند.
- هزینه سرسامآور برچسبگذاری دادهها (Annotation Cost): علامتگذاری پیکسلی ماسکها برای وظایف Segmentation نیازمند صدها ساعت کار انسانی است.
- حملات متخاصم فریبنده (Adversarial Attacks): با تغییر چند پیکسل نامحسوس که برای چشم انسان قابل دیدن نیست، میتوان مدل را وادار کرد تابلوی «ایست» را تابلوی «سرعت ۱۰۰» تشخیص دهد!
۱۰. کاربردهای مهم در صنایع
| صنعت | کاربرد بینایی ماشین | معماری / مدل | ارزش افزوده تجاری |
|---|---|---|---|
| بهداشت و درمان | غربالگری خودکار رتینوپاتی دیابتی از اسکن چشم | ResNet-50 + U-Net | نجات بینایی هزاران بیمار با تشخیص زودهنگام در مناطق محروم |
| تولید و کارخانجات | ممیزی عیوب لحیمکاری مدارهای الکترونیکی (PCB) | YOLOv8 + دوربین ماکرو | صفر کردن ضایعات بردهای الکترونیکی و توقف مرجوعی کالا |
| کشاورزی دقیق | سمپاشی هدفمند فقط بر روی علفهای هرز | Edge-AI / MobileNet-SSD | کاهش ۸۰ درصدی مصرف سموم شیمیایی و حفظ محیط زیست |
| امنیت و کنترل دسترسی | ورود بدون کارت به اماکن حساس با بازشناسی چهره | MTCNN + ArcFace | حذف کارتهای فیزیکی و مسدودسازی ورود با چهرههای جعلی (Anti-Spoofing) |
| حملونقل و لجستیک | شمارش بار کانتینرها و تفکیک خودکار بستههای پستی | Mask R-CNN | افزایش ۴ برابری سرعت ترخیص و مرتبسازی بستهها در هاب پستی |
۱۱. دیدگاه مشاورهای
تحلیل مصالحه مهندسی میان نرخ فریم (FPS) و دقت (Accuracy):
مشاور رسمی هوش مصنوعی باید بر اساس نیازمندی تجاری کارفرما تعادل زیر را برقرار کند: - سناریوهای بلادرنگ (Edge & Real-time): در خودروی خودران یا خط نورد سریع، تاخیر بالای ۳۰ میلیثانیه فاجعهآفرین است؛ بنابراین انتخاب قطعی، مدلهای سبک تکمرحلهای نظیر YOLO یا SSD روی بردهای لبهای (مانند NVIDIA Jetson) است، حتی اگر دقت ۲٪ کمتر باشد. - سناریوهای غیربلادرنگ و بحرانی (Offline & Mission-Critical): در تحلیل پاتولوژی یا اسکن ترکهای بتن سد، زمان پاسخ چندثانیهای اهمیتی ندارد؛ در اینجا مدلهای فوقدقیق دومرحلهای (Faster R-CNN یا Mask R-CNN) یا ViTهای سنگین انتخاب میشوند.
سناریوی مشاورهای ویژه آزمون نظام صنفی:
صورت مسئله: شهرداری یک کلانشهر قصد دارد دوربینهای چراغهای راهنمایی را به سامانه هوشمند شمارش خودرو و هدایت زمانبندی چراغ سبز مجهز کند. پیمانکار اولیه پروژهای گرانقیمت با استفاده از مدل Mask R-CNN پیشنهاد داده است؛ اما سرورهای موجود در تقاطعها تنها قادر به پردازش ۲ فریم در ثانیه با این مدل هستند که باعث تاخیر شدید در تغییر فاز چراغها شده است.
تحلیل و راهکار مشاور رسمی هوش مصنوعی: ۱. ابطال معماری پیشنهادی: برای وظیفه شمارش خودرو و برآورد بار ترافیکی، نیازی به بخشبندی نمونهها (Instance Segmentation) با مدل سنگین Mask R-CNN نیست؛ زیرا استخراج مرز پیکسلی تایر و بدنه اتومبیل هیچ ارزش افزودهای برای چراغ راهنمایی ندارد! ۲. اصلاح معماری به Object Detection سبک: جایگزینی مدل با معماری تکمرحلهای سبک نظیر YOLOv8-Nano یا MobileNetV3-SSD که سرعت پردازش را روی همان سرورهای تقاطع به بالای ۳۵ فریم در ثانیه میرساند. ۳. استقرار الگوریتم ردیابی حرکت (Object Tracking): الحاق الگوریتم ردیابی سبک ByteTrack یا DeepSORT برای جلوگیری از شمارش تکراری خودروهای متوقف در پشت چراغ قرمز. ۴. صرفهجویی اقتصادی عظیم: کاهش ۸۰ درصدی بار پردازشی سرورها و عدم نیاز به خرید سختافزارهای گرانقیمت کلاستری در تقاطعها.
۱۲. قاعده تصمیمگیری
وظیفه بصری مورد انتظار سیستم چیست؟
│
├── آیا صرفاً نیازمند یک برچسب کلی برای تمام کادر عکس هستید؟
│ └── بله ──► از معماریهای طبقهبندی تصویر (Image Classification مانند ResNet) استفاده کنید.
│
├── آیا نیازمند یافتن مکان اشیاء و ترسیم کادر دور آنها هستید؟
│ ├── آیا سرعت بالا و استنتاج بلادرنگ روی فید زنده ویدیو ملاک است؟
│ │ └── بله ──► از مدلهای تکمرحلهای (One-Stage) نظیر YOLO استفاده کنید.
│ └── آیا حداکثر دقت ممکن در تصاویر پزشکی و ماموریتهای حساس ملاک است؟
│ └── بله ──► از مدلهای دومرحلهای (Two-Stage) نظیر Faster R-CNN استفاده کنید.
│
└── آیا نیازمند استخراج دقیق مرز پیکسلی اشیاء، بافتها یا اعضای بدن هستید؟
├── تفکیک نمونههای همکلاس اهمیتی ندارد (مثل تفکیک جاده از علف) ──► Semantic Segmentation (U-Net)
└── هر نمونه شیء باید ماسک مستقل داشته باشد (مثل شمارش سلولها) ──► Instance Segmentation (Mask R-CNN)
۱۳. 🔴 نکات طلایی آزمون
- تمایز وظایف چهارگانه: Classification = چیست | Detection = کجاست با کادر | Semantic Seg = مرز پیکسلی کلاس | Instance Seg = تفکیک پیکسلی هر نمونه مجزا.
- فیلتر میانه (Median Filter): استاندارد طلایی و تستخیزترین فیلتر برای حذف نویز نمک و فلفل (Salt & Pepper) با حفظ لبههای تصویر.
- مراحل پنجگانه الگوریتم لبهیابی کانی (Canny): فیلتر گوسی $\rightarrow$ گرادیان سوبل $\rightarrow$ مهار غیربیشینهها (NMS) $\rightarrow$ آستانهگذاری دوگانه $\rightarrow$ ردیابی با هیسترزیس.
- نوآوری بنیادین ResNet: معرفی اتصالات جهشی (Skip / Residual Connections) که با دور زدن لایهها ($F(x) + x$) مشکل محو شدن گرادیان (Vanishing Gradient) را حل کرد و اجازه داد شبکههایی با بیش از ۱۰۰ لایه آموزش ببینند.
- خواص سهگانه لایه کانولوشن: اتصال محلی (Local Connectivity)، اشتراک وزنها (Weight Sharing) و هموردایی با جابجایی (Translation Equivariance).
- لایه پولینگ (Pooling): کاهش ابعاد ماتریس، کاهش بار محاسباتی و ایجاد ناوردایی با جابجایی (Translation Invariance).
- معماری YOLO: مخفف You Only Look Once؛ شبکه تکمرحلهای (One-Stage) فوقسریع که کل تصویر را در یک گذر پردازش کرده و مناسب سیستمهای بلادرنگ است.
- الگوریتم مهار غیربیشینه (NMS): حذف کادرهای زائد همپوشان دور یک سوژه بر مبنای امتیاز اطمینان و آستانه IoU.
- فرمول IoU (تقاطع بر اجتماع): نسبت مساحت اشتراک دو کادر به مساحت اجتماع آنها؛ معیار کلیدی صحت مکانی در ارزیابی کادرها.
- معیار mAP (Mean Average Precision): شاخص تجمیعی استاندارد ارزیابی عملکرد مدلهای تشخیص شیء.
- ترنسفورمرهای بینایی (ViT): قطعهبندی تصویر به پچهای پیکسلی $16 \times 16$ و پردازش آنها با مکانیسم خودتوجهی (Self-Attention)؛ نیازمند دادههای آموزشی بسیار عظیم نسبت به CNN.
- تعدیل هیستوگرام (Histogram Equalization): روشی برای بهبود کنتراست تصویر با یکنواختسازی توزیع روشنایی پیکسلها.
- عملیات باز کردن (Opening) و بستن (Closing): Opening = فرسایش سپس اتساع (حذف نویز ریز)؛ Closing = اتساع سپس فرسایش (پر کردن حفرهها).
- یادگیری انتقالی (Transfer Learning): آغاز آموزش با وزنهای از پیشآموزشدیده مدلها روی دادگان ImageNet و فاینتیونینگ روی دادههای اختصاصی.
- تفاوت Faster R-CNN با YOLO: مدل Faster R-CNN دومرحلهای با ماژول RPN است که دقت بالاتر اما سرعت کمتری دارد؛ YOLO تکمرحلهای و مناسب فید ویدیویی زنده است.
۱۴. ⚠️ دامهای رایج آزمون
دام ۱: «وظیفه Semantic Segmentation میتواند دو اتومبیل کنار هم در ترافیک را به عنوان دو شیء مجزا با شماره ۱ و ۲ تفکیک کند.»
❌ پاسخ کاملاً غلط! در بخشبندی معنایی (Semantic)، تمام پیکسلهای متعلق به کلاس "اتومبیل" با یک رنگ واحد برچسب میخورند و خودروها از هم تفکیک نمیشوند؛ تفکیک نمونههای مجزا وظیفه Instance Segmentation است.دام ۲: «برای حذف نویز نمک و فلفل در پیشپردازش تصویر، فیلتر میانگین (Mean) بهترین گزینه است.»
❌ پاسخ کاملاً غلط! فیلتر میانگین دانههای نویز را در سطح تصویر پخش کرده و تصویر را کدر میکند؛ تنها فیلتر تخصصی و بهینه برای نویز نمک و فلفل، فیلتر میانه (Median Filter) است.دام ۳: «مدلهای YOLO به دلیل اینکه تکمرحلهای هستند، در مقایسه با Faster R-CNN در تشخیص اشیاء بسیار ریز دقت بالاتری دارند.»
❌ پاسخ کاملاً معکوس! مدلهای تکمرحلهای به علت سرعت بالا در تشخیص اشیاء بسیار ریز و متراکم ضعف دارند و برای اشیاء ریز مدلهای دومرحلهای (Faster R-CNN) دقت برتری ارائه میدهند.دام ۴: «افزایش عمق شبکههای عصبی بدون اتصالات جهشی (مانند VGG) تا ۱۰۰ لایه، همواره دقت را افزایش میدهد.»
❌ پاسخ غلط! بدون اتصالات پسماند (Residual Connections)، شبکههای عمیق به دلیل پدیده محو شدن گرادیان (Vanishing Gradient) دچار سقوط یادگیری میشوند؛ به همین دلیل ResNet ابداع شد.
۱۵. 🧠 خلاصه یکدقیقهای
- بینایی ماشین یعنی درک و تصمیمگیری خودکار بر پایه دادههای بصری.
- وظایف اصلی: Classification (چیست)، Detection (کجاست با کادر Bounding Box)، Semantic Segmentation (مرز پیکسلی کلاس)، Instance Segmentation (تفکیک پیکسلی هر سوژه مجزا).
- پیشپردازشهای کلیدی: فیلتر میانه (ضد نویز نمک و فلفل)، الگوریتم ۵ مرحلهای کانی (بهترین لبهیاب)، تعدیل هیستوگرام (افزایش کنتراست)، مهار غیربیشینه NMS (حذف کادرهای زائد).
- شبکههای کانولوشنی (CNN): لایه کانولوشن (استخراج ویژگی با اتصال محلی و اشتراک وزن) + لایه پولینگ (کاهش ابعاد و ناوردایی مکانی).
- شاهکارهای معماری: ResNet با اتصالات جهشی (Skip Connections) برای حل محو گرادیان؛ YOLO برای تشخیص شیء بلادرنگ؛ ViT با پردازش پچهای تصویری با مکانیسم Attention.
- معیارها: IoU برای سنجش همپوشانی کادرها و mAP برای ارزیابی جامع دقت مدل.
۱۶. نقشه ذهنی
پردازش تصویر و بینایی ماشین (Computer Vision)
│
├── ۱. وظایف بنیادین دیداری
│ ├── Image Classification (برچسب رده کلی تصویر)
│ ├── Object Detection (کادرهای مستطیلی مرزی Bounding Box)
│ ├── Semantic Segmentation (ماسک پیکسلی ردهها با U-Net)
│ └── Instance Segmentation (ماسک پیکسلی تکتک نمونهها با Mask R-CNN)
│
├── ۲. فیلترها و پیشپردازش کلاسیک
│ ├── فیلتر میانه (Median Filter) ──► حذف نویز نمک و فلفل
│ ├── لبهیابی کانی (Canny) ───────► فرآیند ۵ مرحلهای استاندارد با NMS
│ ├── هیستوگرام و تعدیل آن ───────► ارتقای کنتراست
│ └── عملیات ریختشناسی ──────────► اتساع، فرسایش، Opening و Closing
│
├── ۳. معماریهای یادگیری عمیق
│ ├── لایههای CNN: کانولوشن (اتصال محلی و اشتراک وزن) و پولینگ (کاهش ابعاد)
│ ├── ResNet: اتصالات جهشی (Skip Connections) برای رفع محو گرادیان
│ ├── خانواده YOLO: تشخیص شیء تکمرحلهای (One-Stage) فوقسریع
│ ├── خانواده R-CNN: دومرحلهای (Two-Stage) با RPN برای دقت بالا
│ └── Vision Transformer (ViT): پچهای پیکسلی و توجه سراسری
│
└── ۴. معیارهای ارزیابی و استقرار
├── معیار همپوشانی IoU و الگوریتم حذف کادر NMS
├── شاخص تجمیعی دقت mAP
└── موازنه سرعت (FPS) و دقت در سامانههای بلادرنگ
۱۷. ارتباط با سایر مباحث
| مبحث مرتبط | ماهیت ارتباط |
|---|---|
| هوش مصنوعی چندوجهی (فصل ۳ - مبحث ۸) | ترنسفورمرهای بینایی (ViT) و انکودرهای تصویری در این مبحث، ورودی بینایی مدلهای چندوجهی را تامین میکنند. |
| هوش مصنوعی مولد (فصل ۳ - مبحث ۳) | شبکههای کانولوشنی و دیکودرهای تصویری زیربنای مدلهای مولد تصویر (GANs و Diffusion) هستند. |
| مدیریت پروژه و MLOps (فصل ۵) | استقرار بهینه مدلهای بینایی ماشین روی پردازندههای گرافیکی لبهای (Edge Deployment) در فصل ۵ بررسی میشود. |
| اخلاق، امنیت و حاکمیت AI (فصل ۶) | چالشهای اخلاقی و حریم خصوصی در سیستمهای تشخیص چهره در حوزه مباحث فصل ۶ ارزیابی میگردند. |
📚 مراجع و منابع علمی معتبر
منابع مرتبط با همین موضوع- arXiv
- OpenCV
- IEEE