مبحث ۳: هوش مصنوعی مولد
Generative AI (GenAI), Diffusion Models & GANs
۱. این مبحث دقیقاً درباره چیست؟
برای دههها، هوش مصنوعی سنتی نقشی صرفاً تحلیلی و «تمایزی» (Discriminative) داشت؛ به این معنا که تصاویر را دستهبندی میکرد، ایمیلهای اسپم را تشخیص میداد، تقلبهای بانکی را کشف میکرد یا قیمت مسکن را تخمین میزد. در تمام این کاربردها، ماشین دادههای موجود را دریافت و برچسب یا پیشبینی روی آنها صادر میکرد؛ اما ناتوان از «خلق کردن» بود.
هوش مصنوعی مولد (Generative AI) نشاندهنده یک جهش بنیادین است؛ سیستمی که به جای قضاوت روی دادههای ورودی، قادر به تولید محتوای کاملاً اصیل، جدید و واقعگرایانه (متن، تصویر با کیفیت عکاسی، قطعات موسیقی، ویدیوی باکیفیت، کدهای نرمافزاری و حتی فرمولهای مولکولی جدید برای کشف دارو) است.
برای مشاوران و معماران هوش مصنوعی، شناخت مکانیزمهای ریاضی زیربنایی این مدلها (نظیر مدلهای انتشار، GANها و فضاهای نهان)، الزامات زیرساختی GPU و چالشهای حقوقی کپیرایت و جعل عمیق (Deepfake)، جهت تدوین استراتژی تحول دیجیتال در سازمانها ضروری است.
۲. تعریف ساده
تعریف ساده: هوش مصنوعی سنتی مثل یک داور یا ناظر است که به نقاشی شما نگاه میکند و میگوید آیا اثر اصل است یا کپی؛ اما هوش مصنوعی مولد مثل خود نقاش است که با دریافت یک ایده چندکلمهای، نقاشی شاهکاری خلق میکند که تا پیش از آن در جهان وجود نداشته است.
۳. تعریف تخصصی
تعریف تخصصی (چارچوب بنیادین آمار محاسباتی و مکتب یادگیری عمیق): مدلهای مولد (Generative Models) دستهای از مدلهای یادگیری آماری هستند که توزیع احتمالاتی توام دادهها، یعنی $P(X)$ یا $P(X, Y)$، را یاد میگیرند. این مدلها به سیستم امکان میدهند تا با نمونهبرداری از توزیع یادگرفتهشده، دادههای نوظهوری تولید کنند که در مجموعه دادههای آموزشی وجود نداشتهاند، اما از همان ویژگیهای آماری و قواعد ساختاری پیروی میکنند.
۴. مفاهیم کلیدی
۴.۱. تمایز ریاضی مدلهای مولد در برابر مدلهای تمایزی 🔴
[مدل تمایزی - Discriminative]
داده ورودی (X: تصویر گربه) ──────────► پیشبینی احتمال شرطی P(Y|X) ──────────► برچسب: گربه (Y)
[مدل مولد - Generative]
نویز تصادفی / پرامپت متنی (Z) ───────► نمونهبرداری از توزیع احتمال P(X) ──────► تصویر نوظهور گربه (X)
| شاخص | مدلهای تمایزی (Discriminative) | مدلهای مولد (Generative) |
|---|---|---|
| توزیع ریاضیاتی | مدلسازی احتمال شرطی $P(Y \mid X)$ | مدلسازی توزیع دادهها $P(X)$ یا توام $P(X, Y)$ |
| سوال اصلی مدل | «با داشتن این داده ورودی، احتمال اینکه متعلق به کلاس Y باشد چقدر است؟» | «این دادهها به طور کلی با چه توزیع و احتمالی در جهان پدید میآیند؟» |
| خروجی نهایی | برچسب، عدد پیشبینیشده یا مرز تصمیمگیری | نمونه داده کاملاً جدید (تصویر، متن، صدا، ویدیو) |
| الگوریتمهای نمونه | رگرسیون لجستیک، SVM، درخت تصمیم، ResNet | مدلهای انتشار (Diffusion)، GANs, VAEs, GPT |
۴.۲. خانوادههای اصلی مدلهای هوش مصنوعی مولد 🔴
۱. شبکههای مولد مقابلهای (GANs - Generative Adversarial Networks)
- ابداعشده توسط یان گودفلو (Ian Goodfellow) در سال ۲۰۱۴ بر پایه تئوری بازیهای دو نفره با مجموع صفر (Minimax Game).
- دو بازیگر درونی:
- تولیدکننده (Generator): نویز تصادفی را گرفته و سعی میکند تصویری جعلی شبیه واقعیت بسازد.
- متمایزکننده (Discriminator): تصاویر واقعی و جعلی را مقایسه کرده و سعی میکند دست تولیدکننده را رو کند!
- با رقابت مداوم این دو، تولیدکننده تصاویری فوقالعاده واقعنما خلق میکند.
- نقطه ضعف اصلی: ناپایداری شدید در آموزش، پدیده سقوط مد (Mode Collapse) و ناتوانی در تولید تصاویر با تنوع بالا.
۲. مدلهای انتشار (Diffusion Models) — استاندارد طلایی مدرن
- الهامگرفته از فیزیک ترمودینامیک نفوذ ذرات؛ اساس مدلهای Stable Diffusion, Midjourney, DALL-E 3 و Sora.
- دو فرآیند اصلی:
- فرآیند پیشرو (Forward Process): تخریب تدریجی تصویر با افزودن نویز گاوسی در چند مرحله (مثلاً ۱۰۰۰ گام) تا جایی که تصویر به نویز خالص برفکی تبدیل شود.
- فرآیند معکوس (Reverse Process): آموزش یک شبکه عصبی (معمولاً معماری UNet) برای پیشبینی و حذف گامبهگام نویز و بازیابی تصویر واضح بر اساس پرامپت کاربر.
- مزیت بر GAN: پایداری ریاضی بینظیر، پوشش کامل توزیع دادهها و کیفیت خیرهکننده.
۳. خودرمزگذارهای متغیر (VAEs - Variational Autoencoders)
- دادهها را به یک توزیع احتمالاتی نرمال در فضای نهان (Latent Space) فشرده کرده و سپس با نمونهبرداری از این فضا، داده جدید را بازسازی میکنند.
- ویژگی: خروجیهای پیوسته و قابلیت درونیابی (Interpolation)، اما تصاویر نهایی تمایل به مات بودن (Blurry) دارند.
۴.۳. فضای نهان (Latent Space) و ریاضیات خلق اثر 🔴
- فضای نهان (Latent Space): یک فضای برداری فشرده با ابعاد پایینتر که در آن مفاهیم معنایی دادهها به صورت پیوسته کدگذاری شدهاند.
- در فضای نهان میتوان مفاهیم را با هم جمع یا تفریق کرد: $$\text{Vector}(\text{زن با عینک}) = \text{Vector}(\text{زن}) + \text{Vector}(\text{عینک})$$
- مدلهای انتشار در فضای نهان (Latent Diffusion Models - LDM): اجرای فرآیند حذف نویز در فضای نهان به جای فضای پیکسلی (مانند معماری Stable Diffusion) که بار پردازشی را تا ۹۰٪ کاهش داده و اجرای مدل را روی کارتهای گرافیک تجاری ممکن ساخت.
۴.۴. ماتریس خروجیهای چندرسانهای GenAI 🔴
| شیوه تبدیل | مدلها و ابزارهای صنعتی پیشرو | حوزه کاربرد سازمانی |
|---|---|---|
| متن به تصویر (Text-to-Image) | Midjourney v6, DALL-E 3, Stable Diffusion XL, FLUX.1 | تبلیغات، طراحی کاتالوگ، طراحی کاراکتر و ایدهپردازی گرافیکی |
| متن به ویدیو (Text-to-Video) | OpenAI Sora, Runway Gen-3, Luma Dream Machine, Kling | تولید تیزرهای تبلیغاتی، انیمیشنسازی و جلوههای ویژه سینمایی |
| متن به صوت و موسیقی (Text-to-Audio) | Suno AI, Udio, ElevenLabs, Meta AudioCraft | دوبله هوشمند، تولید پادکست، صداگذاری بازیها و موسیقی پسزمینه |
| متن به کد (Text-to-Code) | GitHub Copilot, Claude 3.5 Sonnet, CodeLLaMA | خودکارسازی تستنویسی، بازنویسی توابع و تبدیل زبانها |
| متن به آبجکت ۳ بعدی (Text-to-3D) | Tripo3D, Meshy, Point-E | مدلسازی قطعات بازیهای کامپیوتری و شبیهسازیهای صنعتی |
۴.۵. چالشهای سهگانه بنیادین هوش مصنوعی مولد 🔴
- حقوق مالکیت فکری و کپیرایت (Copyright & Fair Use): آیا شرکتهای سازنده مدل مجاز بودهاند آثار هنرمندان را بدون رضایت برای آموزش مدل استفاده کنند؟ دعاوی حقوقی سنگین علیه Stability AI و Midjourney در جریان است.
- جعل عمیق و فریب افکار عمومی (Deepfake & Misinformation): ساخت ویدیوهای جعلی واقعنما از چهره و صدای سیاستمداران یا مدیران شرکتها جهت کلاهبرداریهای مالی (CEO Fraud).
- مسمومیت دادههای وب (Model Collapse): با فراگیر شدن محتوای تولیدشده توسط هوش مصنوعی در اینترنت، مدلهای نسل بعد مجبورند از دادههای تولیدی مدلهای قبلی بیاموزند که موجب افت کیفی تصاعدی و فروپاشی توزیع مدل میشود.
۵. چگونه کار میکند؟
گردش کار تولید تصویر بر مبنای متن در مدلهای Latent Diffusion (مانند Stable Diffusion):
[پرامپت کاربر: «یک فضانورد سوار بر اسب در مریخ، کیفیت سینمایی 4K»]
│
▼
[انکودر متنی CLIP / T5]
(تبدیل متن به بردارهای معنایی جهتدهنده)
│
▼
[نویز تصادفی گاوسی خالص در فضای نهان (Latent Noise)]
│
▼
┌─────────────────────────┐
│ حلقه حذف نویز مکرر │ ◄─── اعمال هدایت پرامپت (Cross-Attention)
│ (شبکه عصبی UNet) │
│ (۲۰ تا ۵۰ گام معکوس) │
└────────────┬────────────┘
│
▼
[تصویر شفاف و نهایی در فضای نهان فشرده]
│
▼ (رمزگشایی با VAE Decoder)
[تصویر پیکسلی خروجی با وضوح فوقالعاده بالا]
۶. مثال واقعی
استفاده از هوش مصنوعی مولد در طراحی محصول و تبلیغات زنجیرهای پوشاک
- مسئله: یک برند بینالمللی پوشاک برای هر فصل نیاز به عکاسی از مدلهای انسانی با صدها دست لباس در لوکیشنهای مختلف (پاریس، کویر، جنگل) داشت. هزینه هر دوره عکاسی بیش از ۲۰۰ هزار دلار و فرآیند آن ۳ ماه زمان میبرد.
- راهکار پیادهسازی هوش مصنوعی مولد:
- آموزش اختصاصی یک مدل سبک LoRA روی قالب لباسهای واقعی شرکت بر بستر Stable Diffusion.
- استفاده از تکنیک ControlNet جهت تثبیت فیگور مدلهای انسانی و حفظ ساختار درزها و دوخت پارچه.
- تولید هزاران پوستر تبلیغاتی فتورئالیستیک با مدلهای مختلف از نژادهای گوناگون بدون نیاز به استودیو عکاسی فیزیکی.
- نتیجه: کاهش ۹۰ درصدی هزینههای تولید محتوای بصری، کاهش زمان رسیدن کمپین به بازار از ۳ ماه به ۳ روز، و توانایی تولید محتوای شخصیسازیشده برای مشتریان در کشورهای مختلف.
۷. مثال خیلی ساده
تفاوت مدلهای تمایزی با مولد مثل تفاوت تست ۴گزینهای با آزمون نقاشی است: - در تست ۴گزینهای، شما صرفاً گزینهها را نگاه میکنید و گزینه درست را تشخیص میدهید (هوش مصنوعی سنتی/تمایزی). - در آزمون نقاشی، برگه سفیدی جلوی شما میگذارند و میگویند «یک غروب زیبا در ساحل بکش»؛ شما از حافظه و ذهن خلاق خود چیزی کاملاً نو میآفرینید (هوش مصنوعی مولد).
۸. تفاوت مفاهیم مشابه
مقایسه عمیق ۴ معماری بنیادین هوش مصنوعی مولد 🔴
| شاخص مقایسه | مدلهای نفوذی (Diffusion) | شبکههای مقابلهای (GAN) | خودرمزگذارهای متغیر (VAE) | خودبازگشتی (Autoregressive/LLM) |
|---|---|---|---|---|
| رویکرد ریاضی | حذف گامبهگام نویز فرآیند معکوس | بازی دونفره مینیماکس ($G$ در برابر $D$) | بهینهسازی کران پایین شواهد (ELBO) | ضرب احتمالات شرطی زنجیرهای توکنها |
| کیفیت خروجی بصری | فوقالعاده بالا و فتورئالیستیک | بالا و شفاف (در صورت پایداری) | مات و دارای جزئیات پایین (Blurry) | فوقالعاده برای متن و منطق |
| تنوع نمونهها | عالی (عدم سقوط مد) | محدود و مستعد Mode Collapse | تنوع بالا در فضای پیوسته | تنوع بالا با کنترل پارامتر Temperature |
| سرعت استنتاج | کند (نیازمند ۲۰ تا ۵۰ گام بازگشتی) | فوقالعاده سریع (تکمرحلهای Forward) | بسیار سریع (یک گام دیکودر) | وابسته به تعداد توکنهای تولیدی |
| پایداری آموزش | بسیار پایدار و همگرا | بسیار ناپایدار و حساس به وزنها | پایدار بر پایه استنتاج بیزی | پایدار با توابع اتلاف آنتروپی تقاطعی |
۹. مزایا و محدودیتها
مزایا ✅
- دموکراتیزه کردن خلاقیت هنری و بصری: توانمندسازی افراد غیرمتخصص برای ساخت انیمیشن، عکس و صوت حرفهای.
- سرعت انفجاری در ساخت نمونههای اولیه (Rapid Prototyping): تولید دهها اتود اولیه معماری یا طراحی خودرو در چند دقیقه.
- انقلاب در کشف دارو و علم مواد: طراحی مولکولها و پروتئینهای نوظهور با پلتفرمهایی نظیر AlphaFold و Diffusion مولکولی.
- صرفهجویی اقتصادی عظیم: کاهش چشمگیر بودجههای استودیوهای گرافیکی و فیلمسازی سنتی.
محدودیتها و ریسکها ⛔
- فقدان اصالت و ادراک فیزیکی: مدلها قوانین واقعی فیزیک، جاذبه یا آناتومی دست انسان (تعداد انگشتان) را نمیفهمند؛ صرفاً الگوهای پیکسلی را شبیهسازی میکنند.
- پیامدهای مخرب جعل هویت (Deepfakes): تهدید امنیت ملی، آبروی افراد و جعل صدا در کلاهبرداریهای تلفنی بانکی.
- هزینه محاسباتی سرسامآور: فرآیند معکوس در مدلهای انتشار نیازمند کارتهای گرافیک توانمند است.
- خطر آلودگی دادگان جهانی (Model Collapse): افت کیفیت هوش مصنوعی در صورت بازتغذیه از دادههای وب آلوده به خروجیهای مصنوعی.
۱۰. کاربردهای مهم در صنایع
| صنعت | سناریوی کاربردی GenAI | ابزار / معماری | ارزش افزوده عملیاتی |
|---|---|---|---|
| داروسازی و بیوتکنولوژی | طراحی ساختار پروتئینها و ترکیبات دارویی | Generative Diffusion for Molecules | کاهش زمان تحقیق و کشف داروهای ضدسرطان از ۱۰ سال به چند ماه |
| سینما، رسانه و بازیسازی | تولید پسزمینهها، کاراکترهای سهبعدی و دوبله | Midjourney + Sora + ElevenLabs | کاهش ۷۰ درصدی هزینه رندرینگ و متحرکسازی انیمیشن |
| معماری و دکوراسیون | طراحی پلان، نما و چیدمان داخلی بر مبنای متراژ | Stable Diffusion + ControlNet | ارائه ۵۰ طرح دکوراسیون در چند دقیقه به مشتری |
| امنیت سایبری و تست نفوذ | شبیهسازی سناریوهای حملات مهندسی اجتماعی | LLM-based Social Engineering Sim | آزمون میزان هوشیاری پرسنل در برابر ایمیلهای فیشینگ فوقهوشمند |
| توسعه نرمافزار و DevOps | تولید خودکار کدهای زیرساخت (IaC) و اسکریپتها | GitHub Copilot / Cursor | افزایش ۳۵ درصدی سرعت تحویل پروژههای نرمافزاری |
۱۱. دیدگاه مشاورهای
چه زمانی ورود سازمان به پروژههای هوش مصنوعی مولد توجیهپذیر است؟
- سازمانهایی با حجم بسیار بالای تولید محتوای تکراری (رسانهها، آژانسهای تبلیغاتی، فروشگاههای ایکامرس با هزاران کالا).
- شرکتهایی که با چالش سرعت در فاز ایدهپردازی و اتود زدنهای اولیه روبرو هستند.
- صنایعی که نیازمند شبیهسازی دادههای ساختگی (Synthetic Data Generation) برای آموزش مدلهای سنتی در حوزههای کمداده هستند.
ریسکهای حقوقی و حاکمیتی که مشاور باید به هیئت مدیره هشدار دهد:
- ریسک کپیرایت: انتشار مستقیم تصاویر یا متون تولیدی بدون روتوش ممکن است منجر به دعاوی نقض حقوق مولفان بینالمللی شود.
- ریسک محرمانگی دادهها: وارد کردن اطلاعات محرمانه تجاری شرکت در ابزارهای عمومی مانند Midjourney یا ChatGPT باعث اضافه شدن آن دادهها به پایگاه یادگیری مدل میشود!
سناریوی مشاورهای ویژه آزمون نظام صنفی:
مسئله: یک شرکت معماری و انبوهسازی مسکن، یک سامانه هوش مصنوعی مولد متن به تصویر راهاندازی کرده تا بر اساس درخواست مشتریان، نمای ساختمان تولید کند. مهندسان سازه شاکی هستند که تصاویر تولیدی بسیار زیبا اما از نظر محاسبات بار مرده، مقاومت بتن و قوانین نظام مهندسی کاملاً غیرقابل ساخت هستند و خریداران پس از عقد قرارداد ادعای مغایرت اجرایی دارند!
راهکار مشاور رسمی هوش مصنوعی: ۱. تبیین محدودیت ذاتی GenAI: مدلهای انتشار کورکورانه روی زیبایی پیکسلها کار میکنند و هیچگونه فهمی از اصول مهندسی عمران، تعادل سازهای و قوانین شهرداری ندارند. ۲. تغییر فرآیند کسبوکار: استفاده از GenAI صرفاً در فاز ایدهپردازی کانسپت اولیه (Moodboard) با درج صریح سلب مسئولیت اجرایی در قراردادهای مشتریان. ۳. پیادهسازی ماژولهای تکمیلی نظیر ControlNet بر پایه نقشههای CAD و اسکچهای خطی دقیق مهندسان، تا هوش مصنوعی موظف شود بافت و رنگ را صرفاً روی خطوط مجاز مهندسی رندر کند.
۱۲. قاعده تصمیمگیری
آیا هدف شما طبقهبندی، کشف تقلب، پیشبینی عدد یا فیلتر کردن محتواست؟
├── بله ──► از هوش مصنوعی تمایزی سنتی (Discriminative / Supervised ML) استفاده کنید.
│
└── خیر (هدف خلق محتوای کاملاً نوظهور متنی، بصری، صوتی یا ویدیویی است)
├── اگر رسانه هدف «متن، استدلال و کد» است ──► مدلهای زبانی خودبازگشتی (Decoder-only LLMs)
└── اگر رسانه هدف «تصویر و ویدیو» است:
├── آیا سرعت میلیثانیهای در استنتاج ملاک است؟ ──► معماریهای یکمرحلهای GANs
└── آیا بالاترین کیفیت فتورئالیستیک و پایداری ملاک است؟ ──► مدلهای انتشار نهان (Latent Diffusion)
۱۳. 🔴 نکات طلایی آزمون
- تمایز بنیادین ریاضی: مدلهای تمایزی احتمال شرطی $P(Y \mid X)$ را تخمین میزنند؛ مدلهای مولد توزیع دادهها $P(X)$ را مدلسازی میکنند.
- سازوکار مدلهای انتشار (Diffusion): تخریب تصویر با نویز در فرآیند پیشرو (Forward) و حذف گامبهگام نویز با شبکه UNet در فرآیند معکوس (Reverse).
- مزیت Diffusion بر GAN: حذف قطعی معضل سقوط مد (Mode Collapse) و پایداری محاسباتی بسیار بالاتر.
- مزیت GAN بر Diffusion: سرعت بسیار بالاتر استنتاج (تولید خروجی در یک مرحله بر خلاف دهها گام در انتشار).
- معماری GAN: رقابت دو شبکه با اهداف متضاد (تولیدکننده Generator در برابر متمایزکننده Discriminator).
- مدلهای انتشار در فضای نهان (Latent Diffusion مانند Stable Diffusion): کاهش بار محاسباتی با انتقال فرآیند حذف نویز به فضای برداری فشرده با VAE.
- تکنیک ControlNet: کنترل هندسی، آناتومی و فیگور خروجیهای تصویری بر پایه نقشههای لبه (Canny)، عمق (Depth) و استخوانبندی انسان (OpenPose).
- پدیده Model Collapse: افت تصاعدی کیفیت و زوال خلاقیت هوش مصنوعی در صورت آموزش مجدد مدلها بر روی دادههای تولیدی هوش مصنوعی.
- دادههای ساختگی (Synthetic Data): استفاده از GenAI برای تولید دادههای آموزشی در صنایع کمداده (نظیر پزشکی و خودروهای خودران).
- استاندارد C2PA: سازوکار بینالمللی واترمارکینگ و امضای دیجیتال برای اثبات اصالت و تشخیص تصاویر تولیدشده با هوش مصنوعی.
۱۴. ⚠️ دامهای رایج آزمون
دام ۱: «مدلهای یادگیری ماشین سنتی مانند رگرسیون لجستیک و SVM در زمره هوش مصنوعی مولد قرار دارند.»
❌ پاسخ غلط! این الگوریتمها تماماً تمایزی (Discriminative) هستند و فقط مرز تصمیمگیری میان کلاسها را رسم میکنند.دام ۲: «مدلهای انتشار (Diffusion) سرعت تولید تصویر بسیار بالاتری نسبت به شبکههای GAN دارند.»
❌ پاسخ غلط! برعکس؛ مدلهای انتشار به دلیل فرآیند تکرارشونده معکوس (Iterative Denoising در دهها گام) کندتر از GANها هستند؛ اما کیفیت و پایداری آنها بسیار برتر است.دام ۳: «تصاویر تولیدشده توسط هوش مصنوعی مولد دارای قوانین فیزیکی و مقاومت مصالح صحیح هستند.»
❌ پاسخ غلط! هوش مصنوعی مولد صرفاً توزیع رنگ و پیکسلها را شبیهسازی میکند و هیچ درکی از قوانین فیزیک ندارد.دام ۴: «در فرآیند پیشرو (Forward Process) مدلهای انتشار، تصویر به صورت مستقیم با متن پرامپت ترکیب میشود.»
❌ پاسخ غلط! در فرآیند پیشرو صرفاً نویز تصادفی به تصویر اضافه میشود؛ پرامپت متنی فقط در فرآیند معکوس (Reverse Denoising) برای هدایت شبکه به کار میرود.
۱۵. 🧠 خلاصه یکدقیقهای
- GenAI پارادایم خلق محتوای نوظهور متنی، تصویری، صوتی و ویدیویی بر پایه مدلسازی توزیع $P(X)$ است.
- تفاوت با هوش مصنوعی سنتی: سنتی = تحلیل و تمایز $P(Y|X)$؛ مولد = آفرینش و تولید $P(X)$.
- خانوادههای اصلی: LLMs (تولید متن خودبازگشتی)، Diffusion (حذف نویز معکوس)، GANs (رقابت مینیماکس ژنراتور و دیسکریمناتور)، VAEs (نمونهبرداری از فضای نهان).
- معماری پیشرو تصویر: Latent Diffusion (Stable Diffusion) با ترکیب انکودر متنی CLIP، شبکه UNet و دیکودر VAE.
- ابزارهای کنترل: ControlNet و LoRA برای مهار خروجی متناسب با نیازهای صنعتی.
- چالشهای اصلی: نقض کپیرایت، جعل عمیق (Deepfake)، خطاهای فیزیکی و پدیده Model Collapse.
۱۶. نقشه ذهنی
هوش مصنوعی مولد (Generative AI)
│
├── ۱. مبانی نظری و تمایز آماری
│ ├── مدلهای تمایزی: P(Y|X) ──► مرز تصمیم، طبقهبندی و تحلیل
│ └── مدلهای مولد: P(X) ──► نمونهبرداری از توزیع داده و خلق محتوای نو
│
├── ۲. معماریهای الگوریتمی محوری
│ ├── مدلهای انتشار (Diffusion): فرآیند پیشرو (افزودن نویز) و معکوس (UNet Denoising)
│ ├── شبکههای مقابلهای (GAN): بازی دو نفره Generator vs Discriminator
│ ├── خودرمزگذارهای متغیر (VAE): کدگذاری در فضای نهان و بازسازی تصویر
│ └── مدلهای خودبازگشتی (Autoregressive): پیشبینی زنجیرهای توکن بعدی در LLMها
│
├── ۳. قلمروهای تولید چندرسانهای
│ ├── Text-to-Image: Midjourney, DALL-E 3, FLUX, Stable Diffusion
│ ├── Text-to-Video: Sora, Runway Gen-3, Kling
│ └── Text-to-Audio: Suno, ElevenLabs
│
├── ۴. ابزارهای هدایت و شخصیسازی
│ ├── فضای نهان (Latent Space): کاهش ابعاد با VAE
│ ├── ControlNet: هدایت خروجی با نقشههای مرز، عمق و استخوانبندی
│ └── LoRA: تنظیم دقیق سبک و سوژه با حجم محاسباتی اندک
│
└── ۵. چالشهای حقوقی و ریسکها
├── مالکیت فکری (IP & Copyright) دادههای آموزشی
├── جعل عمیق (Deepfake) و راههای اثبات اصالت (C2PA Watermarking)
└── پدیده Model Collapse در اثر بازتغذیه از محتوای وب مصنوعی
۱۷. ارتباط با سایر مباحث
| مبحث مرتبط | نوع و ماهیت ارتباط |
|---|---|
| مدلهای زبانی بزرگ (فصل ۳ - مبحث ۲) | بخش متنی هوش مصنوعی مولد منحصراً بر پایه LLMهای خودبازگشتی استوار است. |
| بینایی ماشین (فصل ۴ - مبحث ۱) | شبکههای کانولوشنی (CNN) و ViT زیربنای دیکودرها و شبکههای UNet در مدلهای تولید تصویر هستند. |
| مهندسی پرامپت (فصل ۳ - مبحث ۴) | نحوه فرمولبندی پرامپتهای متنی مستقیماً خروجی بصری مدلهای انتشار را جهتدهی میکند. |
| اخلاق و حاکمیت AI (فصل ۶) | خطرات جعل عمیق، حقوق کپیرایت و شفافیت در حوزه اخلاق و حاکمیت مقرراتی ارزیابی میشوند. |
📚 مراجع و منابع علمی معتبر
منابع مرتبط با همین موضوع- Stanford
- McKinsey
- MIT