🎯
هدف و پرسش کلیدی این صفحه:
پردازش زبان طبیعی چگونه متون را تحلیل می‌کند و چالش‌های پردازش زبان فارسی و توکنایزاسیون BPE چیست؟
فصل 3 — مبحث 1 هوش مصنوعی مولد و مدلهای زبانی بزرگ آموزش تخصصی + تست تحلیلی ⏱️ زمان مطالعه: 16 دقیقه

مبانی پردازش زبان طبیعی (Natural Language Processing - NLP)

پیش‌پردازش زبان فارسی، توکنایزاسیون با BPE و WordPiece، جاسازی برداری Word2Vec و FastText، مدل‌سازی زبانی N-gram تا ترنسفورمرهای مدرن.

اینفوگرافیک معماری و دیاگرام مهندسی مبانی پردازش زبان طبیعی (NLP)؛ توکنایزاسیون، تعبیه کلمات و مدل‌سازی زبان فارسی | بختیار آهنی
نمای جامع معماری و نقشه راه مفهومی: مبانی پردازش زبان طبیعی (NLP)؛ توکنایزاسیون، تعبیه کلمات و مدل‌سازی زبان فارسی

مبحث ۱: مبانی پردازش زبان طبیعی

Natural Language Processing (NLP) Fundamentals


۱. این مبحث دقیقاً درباره چیست؟

زبان طبیعی (Natural Language) اصلی‌ترین ابزار ارتباطی، انتقال فرهنگ و ثبت دانش بشری است؛ اما ساختار آن برای رایانه‌ها به‌غایت مبهم، غیرخطی و پیچیده است. انسان‌ها در سخنان روزمره از کنایه، استعاره، شوخی و ساختارهای گرامری متغیر استفاده می‌کنند و یک کلمه واحد (مانند «شیر») بسته به بافت جمله می‌تواند معنای جانور درنده، شیر خوراکی، شیر آب یا شجاعت داشته باشد.

پردازش زبان طبیعی (NLP) شاخه‌ای بین‌رشته‌ای از هوش مصنوعی، زبان‌شناسی محاسباتی و علوم داده است که به ماشین‌ها امکان خواندن، رمزگشایی، درک، پردازش و تولید معنادار زبان انسان را می‌دهد.

از تحلیل احساسات نظرات مشتریان در شبکه‌های اجتماعی تا ترجمه ماشینی گوگل و از دستیارهای صوتی تا پایه‌ریزی مدل‌های زبانی بزرگ (LLM)، همگی بر روی خط لوله و مفاهیم بنیادین NLP بنا شده‌اند. بدون درک این مبانی، تسلط بر مدل‌های زبانی نوین و هوش مصنوعی مولد ناممکن است.


۲. تعریف ساده

تعریف ساده: NLP یعنی آموزش دادن به کامپیوتر به طوری که بتواند جملات، مکالمات و متون فارسی، انگلیسی یا هر زبان انسانی دیگر را بخواند، مقصود گوینده را بفهمد و مانند یک انسان پاسخ‌های منطقی و درست بنویسد.


۳. تعریف تخصصی

تعریف تخصصی (مرجع ژورافسکی و مارتین - Speech and Language Processing): پردازش زبان طبیعی حوزه‌ای تئوریک و کاربردی است که با طراحی و پیاده‌سازی مدل‌های محاسباتی، بازنمایی‌های آماری-برداری و الگوریتم‌های یادگیری ماشین، امکان استخراج ساختارهای نحوی (Syntactic)، معنایی (Semantic) و کاربردشناختی (Pragmatic) را از متون و گفتار زبان‌های بشری در سطوح مختلف انتزاع فراهم می‌سازد.


۴. مفاهیم کلیدی

۴.۱. خط لوله استاندارد پیش‌پردازش متن (Text Preprocessing Pipeline) 🔴

کامپیوترها کلمات را نمی‌فهمند، بلکه فقط با ماتریس‌های عددی کار می‌کنند؛ بنابراین اولین گام در هر سیستم NLP، تبدیل متن خام به سیگنال‌های عددی تمیز است:

[متن خام] ──► [پاکسازی و نرمال‌سازی] ──► [توکنایز کردن] ──► [حذف ایست‌واژه‌ها] ──► [ریشه‌یابی/بن‌واژه] ──► [برداری‌سازی]
  1. نرمال‌سازی متن (Text Normalization):
  2. یکدست‌سازی حروف (تبدیل «ي» و «ك» عربی به «ی» و «ک» فارسی).
  3. مدیریت نیم‌فاصله‌ها (تبدیل «می شود» به «می‌شود»).
  4. تبدیل حروف کوچک و بزرگ در زبان‌های لاتین (Lowercasing).
  5. توکنایز کردن (Tokenization):
  6. شکستن متن به واحدهای پایه کوچک‌تر به نام «توکن» (Token).
  7. انواع توکنایزیشن:
    • کلمه‌محور (Word-level): ساده اما دارای مشکل کلمات ناشناخته (Out-of-Vocabulary - OOV).
    • نویسه‌محور (Character-level): فاقد مشکل OOV اما نیازمند توالی‌های بسیار طولانی و تخریب معانی کلمات.
    • زیرکلمه‌محور (Subword-level): استاندارد طلایی مدل‌های مدرن؛ شکستن کلمات نادر به اجزای سازنده (مانند الگوریتم‌های Byte-Pair Encoding - BPE و WordPiece مورد استفاده در BERT و GPT).
  8. حذف ایست‌واژه‌ها (Stop Words Removal):
  9. حذف کلمات پرتکرار با بار معنایی کم (مانند «از»، «به»، «در»، «که»، «the»، «is») در روش‌های آماری کلاسیک (در ترنسفورمرهای مدرن معمولاً این کلمات حفظ می‌شوند تا ساختار جمله مخدوش نشود).
  10. برچسب‌گذاری نقش دستوری (Part-of-Speech Tagging - POS):
  11. تعیین نقش گرامری واژه‌ها (اسم، فعل، صفت، قید).
  12. تشخیص موجودیت‌های نام‌دار (Named Entity Recognition - NER):
  13. استخراج اسامی اشخاص، شرکت‌ها، اماکن، ارقام، مبالغ مالی و تاریخ‌ها از بافت متن.

۴.۲. ریشه‌یابی (Stemming) در برابر بن‌واژه‌سازی (Lemmatization) 🔴

یکی از پرتکرارترین و مهم‌ترین مفاهیم آزمونی، تمایز دقیق این دو تکنیک کاهش شکل کلمات است:

شاخص مقایسه ریشه‌یابی (Stemming) بن‌واژه‌سازی (Lemmatization)
روش کار اعمال قوانین اکتشافی و الگوریتمی خشن برای بریدن پیشوندها و پسوندها تحلیل صرفی (Morphological Analysis) و مراجعه به واژه‌نامه (Vocabulary/Lexicon)
خروجی کلمه ممکن است کلمه‌ای نامفهوم یا فاقد معنای لغوی تولید شود همیشه یک ریشه معتبر و معنادار قاموسی (Lemma) تولید می‌کند
توجه به نقش دستوری خیر؛ به نقش کلمه در جمله هیچ توجهی ندارد بله؛ نقش کلمه (اسم یا فعل بودن) را در تعیین ریشه لحاظ می‌کند
سرعت پردازش بسیار سریع و سبک (برش مکانیکی کاراکترها) کندتر به دلیل لزوم جستجو در فرهنگ لغت و جدول ریشه‌ها
الگوریتم‌های معروف Porter Stemmer, Snowball Stemmer WordNet Lemmatizer, کتابخانه Spacy
مثال انگلیسی studies $\rightarrow$ studi | better $\rightarrow$ better studies $\rightarrow$ study | better $\rightarrow$ good
مثال فارسی «می‌روم» $\rightarrow$ «می‌رو» | «کتاب‌ها» $\rightarrow$ «کتاب» «می‌روم» $\rightarrow$ «رفت» (یا بن مضارع «رو»)

۴.۳. مدل‌های بازنمایی سنتی: کیسه کلمات (BoW) و معیار TF-IDF 🔴

۱. مدل کیسه کلمات (Bag of Words - BoW)

  • متن به عنوان کیسه‌ای از کلمات در نظر گرفته می‌شود که فقط فراوانی کلمات شمرده می‌شود.
  • نقطه ضعف‌های مرگبار: نادیده گرفتن کامل ترتیب کلمات و گرامر جملات؛ ایجاد ماتریس‌های به شدت خلوت و پراکنده (Sparse Matrices) با ابعاد بسیار بزرگ؛ عدم توانایی در درک هم‌معنایی.

۲. معیار بسامد کلمه-معکوس بسامد سند (TF-IDF)

  • فرمولی ریاضی برای تعیین درجه اهمیت یک کلمه در یک سند خاص نسبت به کل مجموعه اسناد (Corpus):

$$\text{TF-IDF}(t, d, D) = \text{TF}(t, d) \times \text{IDF}(t, D)$$

$$\text{TF}(t, d) = \frac{\text{تعداد تکرار کلمه } t \text{ در سند } d}{\text{کل کلمات سند } d}$$

$$\text{IDF}(t, D) = \log\left(\frac{N}{|{d \in D : t \in d}|}\right)$$

  • شهود فرمول: اگر کلمه‌ای در سند فعلی زیاد تکرار شود، امتیاز TF بالا می‌گیرد؛ اما اگر در تمام اسناد کل کتابخانه تکرار شده باشد (مثل کلمه «شرکت» در اسناد اداری)، مخرج کسر بزرگ شده و مقدار IDF آن صفر یا بسیار کوچک می‌شود. بنابراین کلماتی بیشترین وزن را می‌گیرند که به طور اختصاصی مختص آن سند باشند.

۴.۴. جاسازی‌های ایستا (Static Word Embeddings) 🔴

تبدیل کلمات به بردارهای عددی متراکم (Dense Vectors) در فضایی با ابعاد پایین (مثلاً ۳۰۰ بعد) به‌گونه‌ای که کلمات با معنای مشابه، در این فضای برداری فاصله کسینوسی کمتری داشته باشند:

               [فضای معنایی بردارهای کلمات]
                   پادشاه (King) ─────────► مرد (Man)
                        │                      │
       (بردار جنسیت)    │                      │ (بردار جنسیت)
                        ▼                      ▼
                    ملکه (Queen) ─────────► زن (Woman)
           بردار(پادشاه) - بردار(مرد) + بردار(زن) ≈ بردار(ملکه)

الگوریتم معروف Word2Vec (ارائه‌شده توسط گوگل):

  • معماری CBOW (Continuous Bag of Words): پیش‌بینی کلمه هدف جاری از روی کلمات پیرامون و بافتار (Context $\rightarrow$ Target). برای دیتاست‌های متنی بزرگ بسیار سریع است.
  • معماری Skip-Gram: پیش‌بینی کلمات همسایه و پیرامون از روی کلمه هدف جاری (Target $\rightarrow$ Context). برای داده‌های کوچک‌تر و کلمات نادر عملکرد فوق‌العاده‌ای دارد.

سایر مدل‌های ایستا:

  • GloVe (استنفورد): مبتنی بر فاکتورگیری ماتریس هم‌رخدادی جهانی کلمات (Global Co-occurrence Matrix).
  • FastText (متا/فیسبوک): کلمات را به صورت N-gram کاراکتری نمایش می‌دهد؛ این روش بر خلاف Word2Vec قادر است برای کلمات ناشناخته خارج از واژگان (OOV) بردار تولید کند.

محدودیت بزرگ مدل‌های ایستا (تله آزمونی): در Word2Vec و GloVe، برای هر کلمه فارغ از بافت جمله تنها یک بردار ثابت وجود دارد؛ یعنی برای کلمه «شیر» چه در جمله «شیر جنگل دوید» و چه در «شیر گاز را ببندید» دقیقاً همان بردار یکسان برگردانده می‌شود!


۴.۵. جاسازی‌های زمینه‌ای و متنی (Contextual Embeddings) 🔴

  • انقلاب ترنسفورمرها (BERT و نسل‌های نوین): با تکیه بر مکانیزم خود-توجهی (Self-Attention)، بازنمایی برداری یک کلمه بر اساس کل جمله و کلمات چپ و راست آن محاسبه می‌شود.
  • به این ترتیب کلمه «شیر» در جمله مربوط به حیات وحش یک بردار و در جمله آشپزخانه برداری کاملاً متفاوت متناسب با بستر معنایی دریافت می‌کند.
  • مدل‌های فارسی شاخص: ParsBERT (تربیت‌شده بر روی میلیاردها توکن زبان فارسی)، ALBERT فارسی و mT5.

۴.۶. چالش‌های بومی پردازش زبان طبیعی در زبان فارسی 🟠

  1. رعایت نشدن نیم‌فاصله: تفاوت ساختاری در توکنایزیشن کلماتی نظیر «می شود» با «می‌شود» و «دست گاه ها» با «دستگاه‌ها».
  2. ناهمگونی حروف و رسم‌الخط: اختلاط حروف عربی و فارسی (ی و ك، ۀ و ه، اعراب‌گذاری).
  3. افعال مرکب و گسسته: افعالی مانند «به دست آوردن» یا «به زمین گرم زدن» که اجزای آن در طول جمله از هم فاصله می‌گیرند.
  4. حذف آزاد ضمیر (Pro-drop Language): در فارسی فاعل ضمیر می‌تواند به راحتی حذف شود و فعل شناسه را حمل می‌کند («رفتم» به جای «من رفتم»).
  5. ابزارهای متن‌باز فارسی: کتابخانه‌های Hazm و Parsivar برای پیش‌پردازش استاندارد متون فارسی.

۵. چگونه کار می‌کند؟

خط لوله جامع مهندسی NLP (از متن تا استنتاج مدل):

[متن خام فارسی] 
 (مثال: «این گوشی بسیار عالیه ولی گارانتیش افتضاح بود!!»)
       │
       ▼ (گام ۱: نرمال‌سازی با کتابخانه Hazm)
 [«این گوشی بسیار عالی است ولی گارانتی‌اش افتضاح بود.»]
       │
       ▼ (گام ۲: توکنایزیشن Subword با BPE/WordPiece)
 [«این», «گوشی», «بسیار», «عالی», «است», «ولی», «گارانتی», «##اش», «افتضاح», «بود»]
       │
       ▼ (گام ۳: استخراج امبدینگ‌های زمینه‌ای از لایه‌های ترنسفورمر ParsBERT)
 [بردار ۷۶۸ بعدی به ازای هر توکن متناسب با کل بافت جمله]
       │
       ▼ (گام ۴: لایه طبقه‌بند نهایی - Classification Head)
 ┌──────────────────────────────────────────────────────────┐
 │ تحلیل احساسات چندبعدی (Aspect-based Sentiment Analysis): │
 │  - جنبه محصول (گوشی): احساس مثبت (امتیاز ۰.۹۵)           │
 │  - جنبه خدمات (گارانتی): احساس منفی (امتیاز ۰.۹۲)         │
 └──────────────────────────────────────────────────────────┘

۶. مثال واقعی

سامانه خودکار روتینگ و اولویت‌بندی تیکت‌های پشتیبانی در یک پلتفرم تجارت الکترونیک

  • مسئله: یک شرکت بزرگ ایکامرس روزانه بیش از ۵۰ هزار تیکت پشتیبانی متنی از مشتریان دریافت می‌کرد. تیم پشتیبانی انسانی بیش از ۴ ساعت زمان صرف خواندن، دسته‌بندی و ارجاع تیکت‌ها به دپارتمان‌های مربوطه (مالی، لجستیک، مرجوعی، گارانتی) می‌کرد که منجر به نارضایتی شدید خریداران و تاخیر در پاسخگویی می‌شد.
  • راهکار پیاده‌سازی NLP:
  • پیش‌پردازش متون با کتابخانه Hazm و استانداردسازی نیم‌فاصله‌ها و تبدیل اصطلاحات محاوره‌ای.
  • استفاده از مدل زبانی ParsBERT برای استخراج بازنمایی‌های متنی عمیق جملات.
  • اعمال الگوریتم Named Entity Recognition (NER) برای استخراج خودکار شماره سفارش، کد کالا و نام شهر از دل متن تیکت.
  • استقرار یک طبقه‌بند چندکلاسه فست جهت رتبه‌بندی فوریت تیکت (Priority Scoring) و هدایت خودکار آن به کارتابل اپراتور تخصصی.
  • نتیجه: کاهش زمان ارجاع تیکت‌ها از ۴ ساعت به زیر ۱ ثانیه، کشف خودکار تیکت‌های تهدید به شکایت حقوقی و کاهش ۴۵ درصدی نرخ ریزش مشتریان وفادار.

۷. مثال خیلی ساده

فرض کنید می‌خواهید متنی را به یک کودک آموزش دهید: - روش کیسه کلمات (BoW): تمام کلمات کتاب داستان را قیچی می‌کنید و در یک کیسه می‌ریزید و تکان می‌دهید! متوجه می‌شوید کلمه «شیر» ۵ بار آمده و «خرگوش» ۳ بار؛ اما اصلاً نمی‌دانید آیا «شیر خرگوش را خورد» یا «خرگوش شیر را خورد»! - روش مدرن ترنسفورمر و NLP: کتاب را با همان چیدمان جملات در دست می‌گیرید، به ربط کلمات، فاعل و مفعول دقت می‌کنید و می‌فهمید رابطه میان شخصیت‌ها چیست و داستان در چه فضایی روایت شده است.


۸. تفاوت مفاهیم مشابه

ماتریس مقایسه متدهای بازنمایی متن 🔴

مدل / روش نوع بردار درک ترتیب کلمات حل مشکل OOV چندمعنایی (Context-aware) پیچیدگی محاسباتی
One-Hot Encoding خلوت (Sparse) و بسیار طویل خیر خیر خیر بسیار پایین
TF-IDF خلوت (Sparse) مبتنی بر وزن آماری خیر خیر خیر پایین
Word2Vec (Skip-gram/CBOW) متراکم (Dense - مثلاً ۳۰۰ بعد) محدود به پنجره همسایگی خیر خیر (بردار تک و ثابت) متوسط
FastText متراکم (مبتنی بر N-gram کاراکتر) محدود به پنجره همسایگی بله (با ترکیب زیرکلمات) خیر (بردار ایستا) متوسط
BERT / ParsBERT متراکم متنی (Contextual) بله (با پوزیشنال امبدینگ) بله (با Subword BPE) بله (درک کامل چندمعنایی) بسیار بالا (کارت گرافیک GPU)

۹. مزایا و محدودیت‌ها

مزایا ✅

  • اتوماسیون پردازش حجم عظیمی از متون: خواندن و تحلیل میلیون‌ها صفحه سند در چند دقیقه.
  • کشف الگوهای عمیق رفتاری: سنجش نامحسوس لحن، احساسات و ترجیحات کاربران از لاگ‌های چت.
  • ارتقای دسترسی‌پذیری و شمول: تسهیل تعامل افراد کم‌سواد یا نابینا با فناوری از طریق دستیارهای صوتی و متنی.
  • قابلیت سفارشی‌سازی برای زبان‌های بومی: امکان تیونینگ مدل‌های پایه برای صنایع خاص (پزشکی، حقوقی، مهندسی).

محدودیت‌ها و چالش‌ها ⛔

  • ابهام و لایه‌های ضمنی زبان: دشواری بسیار زیاد در تشخیص طعنه، کنایه (Sarcasm) و شوخی‌های فرهنگی.
  • وابستگی به داده‌های حجیم برچسب‌خورده: هزینه بسیار بالای تولید دیتاست‌های حاشیه‌نویسی‌شده (Annotated) برای زبان‌های کم‌منبع (Low-resource Languages).
  • سوگیری‌های تعبیه‌شده (Embedded Bias): مدل‌های امبدینگ سوگیری‌های جنسیتی، نژادی یا طبقاتی موجود در متون وب را عینا یاد می‌گیرند.
  • هزینه سخت‌افزاری پردازش مدل‌های ترنسفورمر: نیاز به زیرساخت‌های محاسباتی سنگین جهت استنتاج سریع.

۱۰. کاربردهای مهم در صنایع

حوزه صنعت وظیفه اصلی NLP تکنیک و الگوریتم خروجی عملیاتی
تجارت الکترونیک و برندها تحلیل احساسات (Sentiment Analysis) مدل طبقه‌بند مبتنی بر ParsBERT رصد نارضایتی از کیفیت محصولات در توییتر و اینستاگرام
حقوق و قراردادها خلاصه‌سازی اسناد و استخراج اطلاعات Text Summarization + NER خلاصه‌سازی پرونده‌های ۱۰۰ صفحه‌ای دادگاه در یک صفحه
بانکداری و فین‌تک چت‌بات‌های مالی و اعتبارسنجی متنی Intent Recognition + Slot Filling پاسخ به سوالات مشتریان درباره شرایط وام و مسدودی کارت
موتورهای جستجو و ویکی‌ها بازیابی معنایی اطلاعات (Semantic Search) Dense Vector Search (امبدینگ‌ها) یافتن اسناد مرتبط بر مبنای مفهوم، حتی بدون تشابه املایی
بهداشت و درمان استخراج داده از پرونده الکترونیک سلامت Clinical NER استخراج دوز داروها و حساسیت‌های بیمار از نسخه‌های پزشکی

۱۱. دیدگاه مشاوره‌ای

چه زمانی روش‌های سنتی NLP کافی هستند و چه زمانی باید سراغ ترنسفورمرها رفت؟

  1. مسائل ساده طبقه‌بندی موضوعی با حجم کم: اگر هدف دسته‌بندی ایمیل‌های اسپم یا موضوعات ورزشی/سیاسی با چند هزار نمونه است، ترکیب TF-IDF + رگرسیون لجستیک یا SVM در کمتر از ۱ دقیقه آموزش دیده و دقت بالای ۹۰٪ به دست می‌دهد؛ در این شرایط استفاده از ترنسفورمر هدر دادن بودجه سرور است.
  2. مسائل پیچیده وابسته به زمینه: در تحلیل احساسات، خلاصه‌سازی، پاسخ به پرسش و استخراج موجودیت‌های تخصصی حقوقی/پزشکی، مدل‌های آماری سنتی شکست می‌خورند و استفاده از مدل‌های مبتنی بر ترنسفورمر (BERT/ParsBERT) اجباری است.

سناریوی مشاوره‌ای ویژه آزمون نظام صنفی:

مسئله: یک استارتاپ سامانه جستجوی اخبار مناقصات دولتی متوجه شده که کاربران هنگام جستجوی عبارت «خرید لوله‌های چدنی انتقال آب»، مناقصاتی که در عنوان آن‌ها عبارت «خرید تجهیزات پایپینگ آبرسانی» درج شده را پیدا نمی‌کنند؛ زیرا سیستم از جستجوی متنی سنتی کلمه به کلمه (Exact Match) در دیتابیس SQL استفاده می‌کند.

راهکار مشاور رسمی هوش مصنوعی: ۱. شناسایی علت ریشه‌ای: ناتوانی سیستم‌های تطبیق کلمه در درک مترادف‌ها و ارتباطات معنایی واژگان تخصصی. ۲. مهاجرت به معماری جستجوی معنایی (Semantic / Vector Search): تبدیل عنوان و متن مناقصات به بردارهای متراکم معنایی با استفاده از مدل‌های امبدینگ دوزبانه یا فارسی. ۳. ذخیره بردارها در یک پایگاه داده برداری (Vector Database مانند Qdrant یا Milvus) و محاسبه شباهت کسینوسی (Cosine Similarity) میان بردار کوئری کاربر و متن مناقصه. ۴. ترکیب جستجوی معنایی با جستجوی کلیدواژه‌ای سنتی در قالب معماری جستجوی ترکیبی (Hybrid Search) برای پوشش همزمان شماره مناقصه و مفاهیم فنی.


۱۲. قاعده تصمیم‌گیری

آیا در مسئله شما ترتیب کلمات و وابستگی‌های پیچیده دستوری نقشی کلیدی دارند؟
├── خیر (مثلاً طبقه‌بندی ساده اسپم یا دسته‌بندی موضوعی کلی متن)
│   └── آیا سرعت فوق‌العاده بالا و سخت‌افزار ارزان ملاک است؟
│       └── بله ──► استفاده از TF-IDF + طبقه‌بند ساده (Linear SVM / Logistic Regression)
│
└── بله (مثلاً تحلیل دقیق احساسات، پاسخ به سوالات، ترجمه و خلاصه‌سازی)
    ├── آیا متن به زبان فارسی است؟
    │   └── بله ──► پیش‌پردازش استاندارد با Hazm + استفاده از ParsBERT یا مدل‌های زبانی فارسی
    └── آیا کلمات تخصصی خارج از واژگان (OOV) در متن فراوان است؟
        └── بله ──► الزام استفاده از توکنایزیشن Subword (مانند BPE/WordPiece) به جای Word-level

۱۳. 🔴 نکات طلایی آزمون

  1. تفاوت بنیادین Stemming و Lemmatization: استمینگ برشی الگوریتمی، بدون واژه‌نامه و خشن است که ممکن است کلمه نامفهوم تولید کند؛ لماتایزیشن متکی بر دانش صرفی، گرامر و واژه‌نامه است و همواره یک ریشه معتبر لغوی تحویل می‌دهد.
  2. فرمول TF-IDF: حاصل‌ضرب فراوانی کلمه در سند (TF) در لگاریتم نسبت کل اسناد به اسناد حاوی آن کلمه (IDF)؛ کلماتی که فقط در اسناد خاصی تکرار شده‌اند بالاترین وزن را می‌گیرند.
  3. محدودیت بزرگ Word2Vec و GloVe: تولید یک بردار ثابت برای هر کلمه و ناتوانی در تمایز معانی کلمات چندمعنایی وابسته به بافتار.
  4. تفاوت معماری‌های Word2Vec: در CBOW بافتار ورودی است و کلمه هدف پیش‌بینی می‌شود؛ در Skip-Gram کلمه هدف ورودی است و کلمات بافتار پیرامون پیش‌بینی می‌شوند.
  5. توکنایزیشن Subword (مانند BPE و WordPiece): حل قطعی مشکل کلمات ناشناخته (Out-of-Vocabulary) در مدل‌های زبانی بزرگ مدرن.
  6. مدل‌های متنی Contextual (مانند BERT): تولید بردار وابسته به بافتار و موقعیت مکانی برای هر کلمه بر مبنای مکانیزم Self-Attention.
  7. مدل کیسه کلمات (BoW): از دست رفتن کامل ترتیب، گرامر و توالی کلمات.
  8. روش FastText: نمایش کلمات بر پایه N-gram کاراکترها؛ توانایی تولید امبدینگ برای کلمات ندیده بر اساس تشابه ساختاری.
  9. تشخیص موجودیت‌های نام‌دار (NER): استخراج اشخاص، اماکن، مبالغ و تاریخ‌ها به عنوان ورودی گراف دانش یا سیستم‌های مالی.
  10. پیش‌پردازش زبان فارسی: ضرورت حیاتی رعایت نیم‌فاصله‌ها و اصلاح ی/ک عربی با ابزارهایی نظیر Hazm.

۱۴. ⚠️ دام‌های رایج آزمون

دام ۱: «فرآیند Stemming همیشه خروجی دقیق‌تر و بهتری نسبت به Lemmatization ارائه می‌دهد.»
پاسخ غلط! استمینگ صرفاً سریع‌تر است اما به دلیل بریدن مکانیکی پسوندها، کلمات نامعتبر و غلط تولید می‌کند؛ لماتایزیشن به دلیل استفاده از دیکشنری بسیار دقیق‌تر است.

دام ۲: «در مدل Word2Vec، کلمه "شیر" در جمله حیات وحش و در جمله لبنیات دو بردار کاملاً متفاوت دریافت می‌کند.»
پاسخ غلط! این ویژگی متعلق به مدل‌های زمینه‌ای نظیر BERT است؛ در Word2Vec هر کلمه دارای یک بردار عددی ثابت است و امکان تمایز چندمعنایی وجود ندارد.

دام ۳: «حذف ایست‌واژه‌ها (Stop Words) در تمام سامانه‌های مدرن NLP بدون استثنا الزامی است.»
پاسخ غلط! در مدل‌های زبانی بزرگ و ترنسفورمرها (مانند GPT و BERT)، ایست‌واژه‌ها هرگز حذف نمی‌شوند؛ زیرا حذف کلماتی مثل «نه»، «در» یا «که» معنای کل جمله و توجه لایه‌ها را تخریب می‌کند.

دام ۴: «معیار TF-IDF کلماتی را که در تمام اسناد مجموعه تکرار شده‌اند به عنوان مهم‌ترین کلمات شناسایی می‌کند.»
پاسخ غلط! کلماتی که در تمام اسناد تکرار شوند مقدار $\text{IDF} = \log(1) = 0$ دریافت کرده و وزن نهایی آن‌ها صفر می‌شود.


۱۵. 🧠 خلاصه یک‌دقیقه‌ای

  • NLP هنر و علم درک، تفسیر و تولید زبان انسانی توسط رایانه‌هاست.
  • خط لوله پیش‌پردازش: نرمال‌سازی $\rightarrow$ توکنایزیشن (Subword/BPE) $\rightarrow$ مدیریت ریشه و بن‌واژه.
  • تمایز طلایی: Stemming (برش خشن بدون دیکشنری) در برابر Lemmatization (ریشه دقیق واژه‌نامه‌ای).
  • نمایش متن: BoW (شمارش ساده، بدون ترتیب) $\rightarrow$ TF-IDF (وزن‌دهی اختصاصی به کلمات شاخص) $\rightarrow$ Word2Vec/GloVe (بردارهای متراکم اما ایستا) $\rightarrow$ BERT (بردارهای زمینه‌ای وابسته به بافتار).
  • معماری‌های Word2Vec: مدل CBOW (بافت به هدف) و Skip-Gram (هدف به بافت).
  • چالش‌های خاص زبان فارسی: نیم‌فاصله، نویسه‌های عربی و افعال چندجزئی با کتابخانه Hazm.

۱۶. نقشه ذهنی

پردازش زبان طبیعی (NLP Fundamentals)
│
├── ۱. مراحل پیش‌پردازش و آماده‌سازی متن
│   ├── نرمال‌سازی: یکدست‌سازی رسم‌الخط، نیم‌فاصله (Hazm در فارسی)
│   ├── توکنایزیشن: Word-level | Character-level | Subword (BPE / WordPiece)
│   ├── تقلیل واژگان:
│   │   ├── Stemming: برش قاعده‌محور و تقریبی پسوندها (Porter)
│   │   └── Lemmatization: تبدیل دقیق به ریشه قاموسی بر پایه گرامر
│   └── وظایف زبانی پایه: POS Tagging (نقش دستوری) | NER (موجودیت‌های نام‌دار)
│
├── ۲. مدل‌های برداری‌سازی سنتی (Traditional Representations)
│   ├── Bag of Words (BoW): شمارش فراوانی، ماتریس خلوت، فاقد ترتیب
│   └── TF-IDF: سنجش اهمیت نسبی کلمه در سند نسبت به کل اسناد
│
├── ۳. جاسازی‌های آماری ایستا (Static Word Embeddings)
│   ├── Word2Vec: معماری CBOW (پیش‌بینی هدف) و Skip-Gram (پیش‌بینی بافتار)
│   ├── GloVe: ماتریس هم‌رخدادی سراسری کلمات
│   └── FastText: تجزیه به زیرکلمات کاراکتری (حل چالش OOV)
│
└── ۴. بازنمایی‌های نوین متنی (Contextual Embeddings)
    ├── مبتنی بر ترنسفورمر: مکانیزم Self-Attention، درک چندمعنایی
    └── مدل‌های بومی: BERT، RoBERTa و ParsBERT فارسی

۱۷. ارتباط با سایر مباحث

مبحث مرتبط نوع و ماهیت ارتباط
مدل‌های زبانی بزرگ (LLM) (فصل ۳ - مبحث ۲) توکنایزیشن BPE، ساختار ترنسفورمر و امبدینگ‌های NLP زیربنای ساخت LLMها هستند.
مهندسی پرامپت (فصل ۳ - مبحث ۴) نحوه تعامل متنی با مدل‌ها مستلزم درک محدودیت‌های زبانی و پنجره توکن است.
سیستم‌های RAG (فصل ۳ - مبحث ۵) جستجوی معنایی و پایگاه‌های داده برداری مستقیماً بر مبنای امبدینگ‌های NLP کار می‌کنند.
دریاچه داده (فصل ۲ - مبحث ۳) متون خام تیکت‌ها و اسناد بدون ساختار در لایه برنز دریاچه داده ذخیره می‌شوند.

📚 مراجع و منابع علمی معتبر

منابع مرتبط با همین موضوع
نویسنده و مؤلف اثر ✓ بازبینی، تحلیل و غنی‌سازی انسانی
👨‍💻

بختیار آهنی

مشاور سازمان نظام صنفی رایانه‌ای در رسته هوش مصنوعی و نرم‌افزار و معمار سیستم‌های AI و رشد | بنیانگذار Webeon Venture Studio | مهندسی وب، سئو و اتوماسیون AI | ساخت دارایی‌های دیجیتال و سیستم‌های رشد مقیاس‌پذیر برای کسب‌وکارهای پزشکی و دانش‌محور
شفاف‌سازی اخلاقی و شیوه تدوین: این مبحث با استفاده از هوش مصنوعی در مراحل تحقیق، ساختاربندی و پیش‌نویس اولیه تهیه شده و توسط نویسنده به صورت تخصصی بازبینی، تحلیل، اصلاح و تکمیل شده است.
مشاهده پروفایل و سوابق تخصصی نویسنده ←