مبحث ۷: کیفیت داده
Data Quality (DQ) & Data Cleansing Lifecycle
۱. این مبحث دقیقاً درباره چیست؟
در دنیای هوش مصنوعی و یادگیری ماشین، یک ضربالمثل طلایی و قطعی وجود دارد: «ورودی زباله، خروجی زباله تحویل میدهد» (Garbage In, Garbage Out - GIGO). پیشرفتهترین الگوریتمهای شبکههای عصبی عمیق یا مدلهای زبانی بزرگ، در مواجهه با دادههای نادقیق، دارای مقادیر خالی، متناقض یا تاریخگذشته، پیشبینیهای فاجعهباری تولید میکنند که میتواند به زیانهای مالی میلیاردی یا به خطر افتادن جان انسانها در کاربردهای پزشکی و خودران منجر شود.
کیفیت داده (Data Quality) علمی است که شرایط، ابعاد و فرآیندهای لازم برای اطمینان از صحت، اعتبار، قابلیت اعتماد و کاربردپذیری دادهها را تعریف، اندازهگیری، پالایش و پایش میکند.
در پروژههای علم داده سازمانی، بررسیها نشان میدهد که بیش از ۷۰ تا ۸۰ درصد زمان دانشمندان و مهندسان هوش مصنوعی صرف کشف، پاکسازی و ارتقای کیفیت دادهها میشود؛ بنابراین کیفیت داده شرط لازم برای هرگونه سیستم تصمیمیار معتبر است.
۲. تعریف ساده
تعریف ساده: کیفیت داده یعنی اطمینان از اینکه اطلاعات موجود در کامپیوترها دقیقاً واقعیت را نشان میدهند، دستنخورده، کامل، بدون اشتباه املایی و بهموقع هستند؛ مثل این است که قبل از پخت غذا، مواد اولیه را بازرسی کنیم تا گوشت یا سبزی فاسد وارد قابلمه نشود.
۳. تعریف تخصصی
تعریف تخصصی (استاندارد بینالمللی ISO 8000 و چارچوب DAMA-DMBOK): کیفیت داده به معنای میزان شایستگی، انطباق و تناسب دادهها برای هدف و کاربرد مورد نظر (Fitness for Use / Purpose) است. داده زمانی باکیفیت تلقی میشود که برای تصمیمگیریهای مدیریتی، عملیات سازمانی، فرآیندهای تحلیلی و آموزش مدلهای هوش مصنوعی، انتظارات مربوط به صحت، تمامیت، سازگاری، اعتبار، یکتایی و بهموقع بودن را به طور پایدار برآورده سازد.
۴. مفاهیم کلیدی
۴.۱. ابعاد ششگانه استاندارد کیفیت داده (The 6 Data Quality Dimensions) 🔴
+------------------------+
| صحت و درستی (Accuracy) | تطابق داده با واقعیت بیرونی جهان
+-----------+------------+
|
+---------------------+---------------------+
| | |
+-------+--------+ +-------+--------+ +-------+--------+
| کامل بودن | | سازگاری | | اعتبار و انطباق |
| (Completeness) | | (Consistency) | | (Validity) |
| نبود رکورد تهی | | نبود تناقض | | انطباق با فرمت |
+-------+--------+ +-------+--------+ +-------+--------+
| | |
+---------------------+---------------------+
|
+-----------+------------+
| یکتایی (Uniqueness) | نبود رکوردهای تکراری
+-----------+------------+
|
+-----------+------------+
| بهموقع بودن (Timeliness)| تازگی و در دسترس بودن زمانی
+------------------------+
| بُعد کیفیت | تعریف دقیق مفهومی | فرمول سنجش آماری | مثال از نقض این بُعد در واقعیت |
|---|---|---|---|
| ۱. صحت (Accuracy) | میزان انطباق داده ذخیرهشده با پدیده واقعی جهان خارج | $\frac{\text{تعداد رکوردهای کاملاً صحیح}}{\text{کل رکوردها}} \times 100$ | وزن کالا ۱۰ کیلوگرم است اما در سیستم به اشتباه ۱۰۰ کیلوگرم تایپ شده باشد |
| ۲. کامل بودن (Completeness) | ثبت تمام اطلاعات ضروری و عدم وجود فیلدهای مفقوده (Null) | $1 - \left(\frac{\text{تعداد مقادیر مفقوده Null}}{\text{کل فیلدهای مورد انتظار}}\right) \times 100$ | ۴۰٪ کاربران در فرم ثبتنام فیلد «کد پستی» یا «سن» را خالی گذاشته باشند |
| ۳. سازگاری (Consistency) | عدم وجود تناقض و تعارض بین فیلدها در سیستمهای مختلف | $\frac{\text{تعداد رکوردهای هماهنگ}}{\text{کل رکوردهای مشترک}} \times 100$ | وضعیت تاهل کارمند در دیتابیس منابع انسانی «مجرد» و در دیتابیس بیمه «متاهل» باشد |
| ۴. اعتبار (Validity) | همخوانی داده با قوانین تجاری، دامنهها (Domain) و فرمتها | $\frac{\text{رکوردهای منطبق با گرامر و بازه}}{\text{کل رکوردها}} \times 100$ | قیمت یک کالا عدد منفی درج شود یا فرمت ایمیل فاقد علامت @ باشد |
| ۵. یکتایی (Uniqueness) | عدم وجود دادهها یا اشخاص تکراری در سیستم | $\frac{\text{تعداد رکوردهای یکتا (بدون همزاد)}}{\text{کل رکوردها}} \times 100$ | یک مشتری به دلیل ۳ بار خرید مهمان، با ۳ رکورد مجزا در جدول دیتابیس ثبت شده باشد |
| ۶. بهموقع بودن (Timeliness) | فاصله زمانی تولید داده تا در دسترس قرار گرفتن برای تصمیم | $\text{تاخیر} = \text{زمان دسترسی} - \text{زمان رخداد}$ | قیمت سهام بورس با تاخیر ۴۵ دقیقهای به مدل هوش مصنوعی معاملهگر برسد |
۴.۲. پروفایلینگ داده (Data Profiling) 🔴
- تعریف: فرآیند اکتشافی و آماری خودکار برای اسکن ساختار، توزیع فراوانی، نرخ مقادیر یکتا (Cardinality)، نسبت مقادیر تهی (Null Rate) و مقادیر مینیمم/ماکزیمم در یک مجموعه داده، پیش از شروع پردازش.
- چرا پروفایلینگ الزامی است؟ بدون پروفایلینگ، ناهنجاریها و خطاهای ساختاری در لایههای عمیق مدل هوش مصنوعی پنهان شده و هزینههای اصلاح را تصاعدی میکنند.
۴.۳. پاکسازی دادهها (Data Cleansing / Scrubbing) 🔴
شامل ۳ فرآیند اصلی در مهندسی داده:
۱. مدیریت مقادیر گمشده (Imputation Strategies)
- حذف (Deletion): حذف سطر یا ستون (تنها در صورتی مجاز است که نرخ گمشدگی بسیار بالا باشد؛ مثلاً بیش از ۵۰٪).
- جایگزینی آماری (Simple Imputation): جایگزینی با میانگین (Mean) برای دادههای متقارن نرمال، میانه (Median) برای دادههای چوله و دارای داده پرت، یا مُد (Mode) برای دادههای دستهای متنی.
- جایگزینی پیشرفته مبتنی بر مدل (Advanced Imputation): استفاده از الگوریتمهای KNN Imputer، رگرسیون یا جنگل تصادفی (MissForest) برای تخمین مقدار خالی بر اساس سایر ستونها.
۲. کشف و مدیریت دادههای پرت (Outlier Detection & Treatment)
- روش دامنه میانچارکی (IQR Rule): نقاط خارج از بازه $[Q_1 - 1.5 \times IQR, Q_3 + 1.5 \times IQR]$ پرت تلقی میشوند.
- روش نمره استاندارد (Z-Score): دادههایی با $|Z| > 3$ در توزیع نرمال ناهنجار در نظر گرفته میشوند.
- الگوریتمهای یادگیری ماشین: استفاده از Isolation Forest یا Local Outlier Factor (LOF) برای فضاهای با ابعاد بالا.
۳. پالایش تکرارها (Deduplication)
- تطبیق قطعی با کلیدهای یکتا یا تطبیق فازی (Fuzzy Matching با الگوریتم Levenshtein Distance) برای شناسایی نامهای مشابه که املای متفاوتی دارند (مانند «علیرضا» و «علی رضا»).
۴.۴. قانون اقتصادی ۱-۱۰-۱۰۰ در کیفیت داده 🔴
[هزینه پیشگیری] ──► ۱ دلار (اعتبارسنجی در لحظه ورود فرم و تنظیم قوانین پایگاه داده)
[هزینه پاکسازی] ──► ۱۰ دلار (اصلاح، اسکریپتنویسی ETL و پاکسازی در انبار داده)
[هزینه شکست] ──► ۱۰۰ دلار (خطای پیشبینی هوش مصنوعی، مرجوعی کالا و جریمه دادگاه)
نکته آزمونی: هزینه حل مشکل کیفیت داده با حرکت در طول پایپلاین به صورت تصاعدی (نمایی) افزایش مییابد. کشف خطا در فرم ورودی ۱ دلار هزینه دارد، اما رفع اثر تصمیم اشتباه هوش مصنوعی ۱۰۰ دلار به سازمان خسارت میزند.
۴.۵. پایش مستمر و فریمورکهای تست کیفیت داده 🟠
کیفیت داده یک فرآیند یکباره نیست، بلکه نیازمند آزمونهای خودکار در پایپلاین داده است:
- فریمورک Great Expectations: ابزار پیشرو پایتونی برای تعریف قراردادهای داده (Data Contracts) و تست ادعاها (Assertions) مانند: expect_column_values_to_not_be_null یا expect_column_values_to_be_between(0, 120).
- ابزار AWS Deequ / Soda Core: ارزیابی خودکار کیفیت داده در کلاسترهای آپاچی اسپارک.
۴.۶. رانش داده و کیفیت در طول زمان (Data Drift & Concept Drift) 🔴
- رانش داده (Data Drift): تغییر در توزیع آماری دادههای ورودی نسبت به دادههای زمان آموزش مدل هوش مصنوعی (مثلاً تغییر ناگهانی میانگین سن خریداران در یک کمپین).
- رانش مفهوم (Concept Drift): تغییر در رابطه میان ویژگیها و متغیر هدف در گذر زمان (مثلاً تغییر تعریف «خرید مشکوک» پس از تغییر رفتار مجرمان سایبری).
۵. چگونه کار میکند؟
پایپلاین مهندسی تضمین کیفیت داده با گیتهای اعتبارسنجی:
[داده خام از منابع]
│
▼
[گیت ۱: اعتبارسنجی الگو (Schema & Type Validation)]
آیا نوع فیلدها و فرمتها صحیح است؟ ──(خیر)──► [ایزولهسازی در قرنطینه داده (Quarantine)]
│ (بله)
▼
[گیت ۲: پروفایلینگ و اعتبارسنجی دامنه (Business Rules)]
بررسی رکوردهای Null، اعداد منفی، بازههای نامعتبر
│ (بله)
▼
[گیت ۳: پاکسازی و غنیسازی (Cleaning & Imputation)]
پر کردن مقادیر مفقوده با میانه، فیلتر دادههای پرت
│
▼
[گیت ۴: حذف تکرارها (Deduplication)]
تطبیق فازی و ادغام با Master Data Management
│
▼
[داده پاکیزه باکیفیت ──► انبار داده و خط آموزش مدلهای AI]
۶. مثال واقعی
خسارت ناشی از دادههای بیکیفیت در سیستم هوشمند قیمتگذاری بلیت هواپیما
- مسئله: یک سامانه آنلاین فروش بلیت هواپیما از مدل یادگیری ماشین برای قیمتگذاری پویا بر اساس تقاضا استفاده میکرد. در پی اختلال فنی در وبسرویس فرودگاه، تعداد صندلیهای خالی به جای عدد، مقدار
NULLارسال شد. اسکریپت ساده پرکننده، مقادیر خالی را به اشتباه با عدد صفر جایگزین کرد! - پیامد فاجعهبار: مدل هوش مصنوعی تصور کرد تمام صندلیها پر شده و تقاضا بینهایت است؛ بنابراین قیمت بلیتهای یک پرواز معمولی ۱ میلیون تومانی را به ۹۵ میلیون تومان افزایش داد! فروش متوقف شد و اعتبار برند به شدت لطمه دید.
- راهکار استقرار کیفیت داده:
- پیادهسازی گیت اعتبارسنجی با Great Expectations در لایه ورودی وبسرویس؛ به طوری که اگر نرخ مقادیر Null از ۵٪ فراتر رفت، کل تراکنش متوقف شده و به ادمین هشدار داده شود.
- استفاده از قوانین بازهای سختگیرانه (قیمت بلیت نمیتواند خارج از محدوده مصوب سازمان هواپیمایی باشد).
- اعمال استراتژی جایگزینی هوشمند با آخرین مقدار معتبر قبلی (Forward Fill) به جای جایگزینی با صفر.
۷. مثال خیلی ساده
فرض کنید به یک پزشک مراجعه میکنید و برگه آزمایش خونی را نشان میدهید: - اگر نام بیمار مخدوش باشد (نقض Completeness)، - اگر قند خون به جای ۱۱۰ عدد منفی درج شده باشد (نقض Validity)، - اگر ساعت آزمایش مشخص نباشد و معلوم نباشد مال دیروز است یا ۱۰ سال پیش (نقض Timeliness)، - اگر قند خون با واقعیت بدن شما فرق داشته باشد (نقض Accuracy)، پزشک نمیتواند برای شما دارویی تجویز کند؛ یا اگر تجویز کند، شما را به کشتن میدهد! کیفیت داده یعنی اطمینان از سلامت برگه آزمایش قبل از اینکه بیمار دارو مصرف کند.
۸. تفاوت مفاهیم مشابه
ماتریس تفکیک ابعاد و مفاهیم کیفیت داده 🔴
| صفت داده | معنای دقیق | سوال ارزیابی | مثال نقض |
|---|---|---|---|
| صحت (Accuracy) | تطابق داده با جهان واقع | آیا این عدد در حقیقت هم همین است؟ | ثبت آدرس در خیابان دیگر |
| اعتبار (Validity) | تطابق با فرمت و قوانین ساختار | آیا این داده در دامنه تعریفشده میگنجد؟ | ثبت سن ۱۵۰ سال یا عدد منفی |
| سازگاری (Consistency) | هماهنگی بین دو پایگاه مختلف | آیا دو سیستم حرف متناقض نمیزنند؟ | کد ملی یکسان با دو نام متفاوت |
| تمامیت (Completeness) | نبود جاهای خالی و تهی | آیا تمام ستونهای حیاتی پر شدهاند؟ | فاکتور خرید بدون قیمت یا تاریخ |
| یکپارچگی (Integrity) | روابط صحیح کلیدهای خارجی و انتسابها | آیا کلید خارجی به کلید اصلی معتبر وصل است؟ | سفارش خریدی که مشتری آن در سیستم وجود ندارد |
۹. مزایا و محدودیتها
مزایا ✅
- افزایش دقت و پایداری مدلهای هوش مصنوعی: حذف نویزها و کاهش خطای تعمیمپذیری (Generalization Error).
- کاهش هزینههای دوبارهکاری: کاهش ۸۰ درصدی زمان هدررفته دانشمندان داده برای پاکسازیهای تکراری.
- جلب اعتماد تصمیمگیران ارشد: رفع بدبینی مدیران به خروجی سیستمهای گزارشگیری و داشبوردها.
- انطباق قانونی: رعایت استانداردهای کیفیت داده در حوزههای سلامت و بانکی.
محدودیتها و چالشها ⛔
- هزینه محاسباتی و تاخیر زمانی: اعمال آزمونهای اعتبارسنجی سنگین روی جریانهای داده با سرعت بالا، تاخیر ورود داده (Ingestion Latency) را افزایش میدهد.
- تضاد میان ابعاد (Trade-offs): گاهی افزایش دقت (Accuracy) مستلزم تاخیر زمانی است و بُعد بهموقع بودن (Timeliness) را قربانی میکند.
- ریسک تحریف داده در Imputation نامناسب: پر کردن ناشیانه مقادیر مفقوده میتواند توزیع طبیعی متغیر را مخدوش کرده و مدل AI را گمراه کند.
۱۰. کاربردهای مهم در صنایع
| صنعت | بُعد کلیدی کیفیت | مکانیزم کنترل کیفی | ریسک تجاری در صورت افت کیفیت |
|---|---|---|---|
| بانکداری و کشف تقلب | Timeliness (بهموقع بودن) | پایش تاخیر استریمهای Kafka با آستانه زیر ثانیه | عدم شناسایی به موقع کلاهبرداری و فرار مجرم |
| مراقبتهای بهداشتی و سلامت | Accuracy & Completeness | اعتبارسنجی دوگانه پرونده بیمار با بارکد داروها | تزریق داروی اشتباه و مرگ بیمار |
| تجارت الکترونیک و فروش | Validity & Uniqueness | تطبیق فازی محصولات و اعتبارسنجی فرمت آدرس | ارسال بسته پستی به آدرس اشتباه و اتلاف هزینه پیک |
| سیستمهای توصیهگر هوشمند | Consistency | یکپارچهسازی پروفایل کاربر در وبسایت و اپلیکیشن | پیشنهاد کالای خریداریشده قبلی و نارضایتی مشتری |
| تجهیزات صنعتی و اینترنت اشیاء | Outlier Detection | فیلتر نویز امواج سنسورها با الگوریتم IQR | توقف اشتباه کل خط تولید کارخانه به دلیل نویز لحظهای |
۱۱. دیدگاه مشاورهای
چه زمانی سرمایهگذاری سنگین در خط لوله کیفیت داده الزامی است؟
- پیش از آغاز هرگونه پروژه هوش مصنوعی سازمانی؛ زیرا بهبود کیفیت دادهها تقریباً همیشه بیش از تغییر الگوریتم مدل به بهبود عملکرد منجر میشود (Data-Centric AI).
- وقتی بیش از ۱۰ درصد رکوردهای سیستم دچار نواقص ساختاری یا فیلدهای Null در ستونهای حیاتی هستند.
- وقتی سازمان دارای فرآیندهای ادغام (Merger & Acquisition) با سامانههای خارجی و ناهمگن است.
توصیههای مشاور رسمی هوش مصنوعی:
- رویکرد دادهمحور (Data-Centric AI): به جای اینکه ماهها زمان صرف بهینهسازی فراپارامترهای مدل کنید، دادههای کثیف آموزشی را پالایش نمایید؛ نتیجه شگفتآور خواهد بود.
- پیشگیری در مبدا (Root-cause Prevention): همیشه اعتبارسنجی را در لحظه ورود داده به فرمهای کاربری اعمال کنید؛ هزینه اصلاح خطا در مبدا طبق قانون ۱-۱۰-۱۰۰ یکصدم هزینه رفع آن در دیتابیس است.
سناریوی مشاورهای ویژه آزمون نظام صنفی:
مسئله: یک شرکت خردهفروشی آنلاین گزارش میدهد که مدل رگرسیونی تخمین تقاضای انبار، پیشبینیهای به شدت نوسانی و غلط تولید میکند. بررسی دادههای ورودی نشان میدهد در ستون درآمد خانوار مشتریان، مقادیر صفر، مقادیر منفی، و در مواردی درآمد ۱۰۰۰ میلیارد تومانی (ناشی از تایپ ریال به جای تومان توسط اپراتور) ثبت شده و ۳۰ درصد دادهها خالی هستند. تیم فنی این ستون را با میانگین پر کرده است.
راهکار مشاور رسمی هوش مصنوعی: ۱. تبیین خطای فاجعهبار تیم فنی: استفاده از میانگین (Mean) در حضور دادههای پرت سرسامآور (۱۰۰۰ میلیارد تومان)، میانگین را به شدت منحرف کرده و باعث تزریق دادههای جعلی به کل ستون شده است! ۲. اصلاح استراتژی برخورد با مقادیر پرت: اعمال فیلتر دامنه میانچارکی (IQR) یا Z-Score و شناسایی خطای تغییر واحد (تبدیل ریال به تومان بر اساس طول ارقام). ۳. برای مقادیر مفقوده پس از حذف دادههای نامعتبر: استفاده از میانه (Median) یا مدل KNN Imputer بر اساس شغل و تحصیلات مشتری، به جای میانگین ساده. ۴. پیادهسازی گیت اعتبارسنجی اعتبارسنجی دامنه (Validity Rule) در نرمافزار ورودی تا هیچ عددی کمتر از صفر یا فراتر از ارقام معقول قابل ثبت نباشد.
۱۲. قاعده تصمیمگیری
آیا در متغیرهای عددی مقادیر مفقوده (Missing Values) دارید؟
├── نرخ گمشدگی بیش از ۵۰٪ است ──► آن ستون را کلاً حذف کنید (Drop Column).
└── نرخ گمشدگی کمتر از ۵۰٪ است:
├── آیا توزیع دادهها نرمال، متقارن و فاقد داده پرت است؟
│ └── بله ──► پر کردن با میانگین (Mean Imputation)
└── آیا توزیع چوله است یا دادههای پرت (Outliers) وجود دارد؟
├── بله (روش سریع) ──► پر کردن با میانه (Median Imputation)
└── بله (روش دقیق) ──► استفاده از الگوریتمهای هوشمند (KNN Imputer / MissForest)
۱۳. 🔴 نکات طلایی آزمون
- اصل GIGO: ورودی زباله = خروجی زباله؛ کیفیت داده مهمترین پیشنیاز کارکرد مدلهای یادگیری ماشین است.
- شش بُعد استاندارد کیفیت داده: Accuracy (صحت)، Completeness (تمامیت)، Consistency (سازگاری)، Timeliness (بهموقع بودن)، Uniqueness (یکتایی)، Validity (اعتبار).
- تفاوت Accuracy و Validity: در Validity داده با قوانین فرمت و دامنه میخواند (مثلاً سن ۴۵ سال معتبر است)؛ اما در Accuracy داده باید با واقعیت بیرونی تطابق داشته باشد (اگر سن واقعی شخص ۲۰ باشد، ۴۵ نادقیق است).
- قانون ۱-۱۰-۱۰۰: هزینه اصلاح خطا در مبدا ۱ دلار، در لایه پاکسازی ۱۰ دلار و پس از ورود به تصمیم نهایی ۱۰۰ دلار است.
- پر کردن مقادیر پرتدار: در حضور دادههای پرت، هرگز از میانگین استفاده نمیشود؛ حتماً باید از میانه (Median) استفاده کرد.
- روشهای کشف داده پرت: قاعده IQR ($1.5 \times IQR$)، قاعده Z-Score ($|Z|>3$) و الگوریتم Isolation Forest.
- پروفایلینگ داده (Data Profiling): تحلیل آماری توزیع و ناهنجاریهای داده پیش از اجرای هرگونه فرآیند پردازشی.
- فریمورکهای تست کیفیت داده: ابزارهای معروفی نظیر Great Expectations و Deequ.
- رویکرد هوش مصنوعی دادهمحور (Data-Centric AI): تمرکز بر بهبود پایدار کیفیت دادهها به جای تغییرات مکرر در کد مدل.
- پدیده Data Drift: تغییر در توزیع آماری دادههای ورودی در گذر زمان که مستلزم بازآموزی مدل است.
۱۴. ⚠️ دامهای رایج آزمون
دام ۱: «اگر یک داده فرمت درستی داشته باشد (مثلاً کد ملی ۱۰ رقم باشد)، قطعاً صحیح (Accurate) است.»
❌ پاسخ غلط! این داده فقط معتبر (Valid) است؛ اما اگر کد ملی متعلق به فرد دیگری باشد یا جعلی باشد، بُعد صحت (Accuracy) نقض شده است.دام ۲: «همیشه بهترین روش برای پر کردن دادههای مفقوده عددی، استفاده از میانگین (Mean) است.»
❌ پاسخ غلط! میانگین به شدت به دادههای پرت حساس است. در بیشتر دادههای واقعی به دلیل وجود دادههای چوله، میانه (Median) انتخاب به مراتب امنتر و دقیقتری است.دام ۳: «حذف تمام دادههای دارای فیلد خالی، کیفیت داده را بدون هیچ مشکلی بالا میبرد.»
❌ پاسخ غلط! حذف کورکورانه سطرها باعث از دست رفتن حجم عظیمی از دادهها و ایجاد سوگیری سیستماتیک (Selection Bias) در آموزش مدل هوش مصنوعی میشود.دام ۴: «کیفیت داده صرفاً وظیفه تیم مهندسی نرمافزار در زمان کدنویسی فرمهای وب است.»
❌ پاسخ غلط! کیفیت داده یک چرخه حیات کامل در طول تمام لایههای ذخیرهسازی، تبدیل و مصرف است و نیازمند همکاری نزدیک Data Stewardها و تحلیلگران کسبوکار است.
۱۵. 🧠 خلاصه یکدقیقهای
- کیفیت داده یعنی تناسب داده برای کاربرد و تصمیمگیری مورد نظر (Fitness for Use).
- اصل GIGO: تضمین کیفیت داده مهمترین گام در موفقیت هوش مصنوعی است.
- ابعاد ۶ گانه: صحت (درستی واقعیت)، کامل بودن (نبود مقادیر خالی)، سازگاری (نبود تناقض بین سیستمها)، اعتبار (انطباق با فرمت و قوانین دامنه)، یکتایی (نبود رکوردهای تکراری)، بهموقع بودن (تازگی داده).
- چرخه حیات: پروفایلینگ (شناسایی آماری ناهنجاریها) $\rightarrow$ پاکسازی (Imputation و Outlier Detection) $\rightarrow$ پایش مستمر با ابزارهایی نظیر Great Expectations.
- پر کردن مقادیر تهی: میانه برای دادههای پرتدار؛ میانگین فقط برای دادههای متقارن نرمال.
- قانون اقتصادی ۱-۱۰-۱۰۰: هزینه تصاعدی نادیده گرفتن کیفیت داده.
۱۶. نقشه ذهنی
کیفیت داده (Data Quality)
│
├── ۱. ابعاد ششگانه استاندارد (Dimensions)
│ ├── Accuracy (صحت): انطباق کامل با واقعیت جهان بیرونی
│ ├── Completeness (کامل بودن): حداقل بودن فیلدهای تهی (Null Rate)
│ ├── Consistency (سازگاری): نبود تناقض میان دیتابیسها و جدولها
│ ├── Validity (اعتبار): تطابق با دامنه مجاز و فرمت استاندارد (Regex)
│ ├── Uniqueness (یکتایی): حذف رکوردهای تکراری (Deduplication)
│ └── Timeliness (بهموقع بودن): حداقل بودن تاخیر زمانی تا لحظه تصمیم
│
├── ۲. مراحل چرخه حیات ارتقای کیفیت
│ ├── پروفایلینگ داده (Data Profiling): اسکن آماری و کشف ناهنجاریها
│ ├── پاکسازی داده (Data Cleansing):
│ │ ├── مقادیر مفقوده (Imputation): میانگین، میانه، KNN Imputer
│ │ └── مقادیر پرت (Outliers): روشهای IQR، Z-score، Isolation Forest
│ └── پایش خودکار (Data Testing): قراردادهای داده با Great Expectations
│
├── ۳. مفاهیم اقتصادی و استراتژیک
│ ├── قانون ۱-۱۰-۱۰۰ در هزینه داده کثیف (Cost of Bad Data)
│ ├── اصل هوش مصنوعی دادهمحور (Data-Centric AI)
│ └── رانش داده و رانش مفهوم (Data Drift & Concept Drift)
۱۷. ارتباط با سایر مباحث
| مبحث مرتبط | نوع و ماهیت ارتباط |
|---|---|
| حاکمیت داده (فصل ۲ - مبحث ۶) | حاکمیت داده سیاستها و نقشهای مسئول تضمین کیفیت داده (مانند Data Steward) را تعیین میکند. |
| مبانی یادگیری ماشین (فصل ۱ - مبحث ۱) | پاکسازی داده و مهندسی ویژگی مرحله اصلی آمادهسازی دیتا در یادگیری ماشین است. |
| انبار داده و دریاچه داده (فصل ۲ - مباحث ۲ و ۳) | کیفیت داده خط دفاعی اصلی در لایه ETL/ELT برای جلوگیری از تبدیل دریاچه به باتلاق است. |
| عملیات یادگیری ماشین (MLOps) (فصل ۵ - مبحث ۶) | سیستمهای Data Quality Testing و پایش Data Drift از ماژولهای حیاتی پایپلاین MLOps هستند. |
📚 مراجع و منابع علمی معتبر
منابع مرتبط با همین موضوع- DAMA UK
- Great Expectations
- MIT