آزمون جامع شبیهسازی ۲ — مهندسی داده، زیرساخت و MLOps
ویژه آزمون مشاوران و کارشناسان سازمان نظام صنفی رایانهای کشور (نصر)
رشته: هوش مصنوعی و تحلیل داده
کدهای حوزه امتحانی: AI03 (داده و زیرساخت داده - ۲۰٪) | AI04 (مدلهای زبانی و استقرار - ۱۵٪) | AI06 (مدیریت پروژه و MLOps - ۱۰٪)
تعداد سوالات: ۱۰ سوال سناریومحور چهارگزینهای تخصصی
نمره منفی: دارد (به ازای هر ۳ پاسخ نادرست، یک پاسخ درست حذف میشود)
مدت زمان پیشنهادی: ۳۵ دقیقه
راهنمای داوطلبان:
این آزمون بر مبنای آخرین الگوهای استاندارد آزمونهای مشاوره نظام صنفی رایانهای، سناریوهای واقعی مهندسی سیستم و استانداردهای DAMA و MLOps طراحی شده است. تمام سوالات در قالب موقعیتهای عملیاتی سازمانها مطرح شدهاند. در پایان سوالات، کلید پاسخها و تحلیل تشریحی تکتک گزینهها درج گردیده است.
بخش اول: سوالات آزمون
سناریو: یک بانک بزرگ با بیش از ۵۰ میلیون مشتری قصد دارد انبار داده تحلیلی خود را بازطراحی کند. مدیریت بانک نیازمند بررسی اثر تغییر وضعیت شغلی و رتبه اعتباری مشتریان بر نرخ نکول تسهیلات در دورههای ۵ ساله است؛ به گونهای که هر وام صادرشده در سالهای گذشته دقیقاً به رتبه اعتباری مشتری در زمان دریافت وام پیوند خورده باشد. همچنین تیم BI خواهان اجرای سریع کوئریهای تحلیلی با کمترین تعداد JOIN میان جداول است.
سوال: کدام الگوی طراحی انبار داده و تکنیک مدیریت بعد به عنوان راهکار بهینه مشاورهای باید انتخاب شود؟
سناریو: یک پلتفرم پخش آنلاین ویدیو (VOD)، روزانه ترابایتها لاگ رویدادهای کلیک، متوقف کردن و پرش فیلمها را به همراه نظرات متنی و دادههای رتبهبندی دریافت میکند. سیستم فعلی به دلیل استفاده از معماری سنتی دریاچه داده و فایلهای خام، دچار فقدان تراکنشهای ACID شده و اجرای همزمان کوئریهای تحلیلی و نوشتن دادههای جدید منجر به خواندن دادههای ناقص و شکست جابهای یادگیری ماشین میشود.
سوال: مناسبترین راهکار معماری برای حل این بحران بدون افزایش سرسامآور هزینهها چیست؟
سناریو: یک خط لوله پردازش داده در Apache Spark وظیفه دارد دادههای تراکنشهای بانکی را با اطلاعات پذیرندگان پیوند دهد (Join Operation). بررسی مانیتورینگ اسپارک نشان میدهد که از میان ۲۰۰ تسک موازی، ۱۹۹ تسک در کمتر از ۲۰ ثانیه به اتمام میرسند، اما تسک پایانی بیش از ۴۵ دقیقه به طول انجامیده و باعث شکست کل جاب میشود (پدیده Data Skew شدید روی کلید یک پذیرنده بسیار بزرگ مانند فروشگاه کوروش).
سوال: مهندسانهترین تکنیک برای رفع این گلوگاه در اسپارک کدام است؟
سناریو: در یک سامانه اینترنت اشیاء صنعتی (IIoT)، حسگرهای لرزشسنج توربینها دادههای خود را از طریق شبکه مخابراتی بیسیم به کلاستر آپاچی کافکا ارسال میکنند. به دلیل قطع و وصل مکرر آنتنهای محلی، برخی پیامهای حیاتی سنسورها با تاخیر چنددقیقهای و خارج از ترتیب زمانی ارسال (Out-of-Order Events) به سیستم میرسند. موتور پردازش باید بر اساس «زمان وقوع رخداد در فیزیک سنسور» محاسبات پنجره لغزان ۵ دقیقهای را انجام دهد.
سوال: کدام ترکیب تنظیمی در موتور پردازش Apache Flink تضمینکننده تحلیل دقیق محاسبات است؟
سناریو: یک تیم هوش مصنوعی قصد دارد یک مدل پردازش زبان طبیعی با ابعاد ۷۰ میلیارد پارامتر را روی یک کلاستر مجهز به ۳۲ کارت گرافیک Nvidia A100 (با حافظه ۸۰ گیگابایت برای هر GPU) آموزش دهد. وزنهای مدل به همراه گرادیانها و وضعیت بهینهساز Adam نیازمند بیش از ۵۰۰ گیگابایت حافظه هستند و در یک کارت گرافیک جا نمیشوند. همچنین ارتباط سرورها از طریق شبکه ۴۰۰ گیگابیت InfiniBand برقرار است.
سوال: استراتژی استاندارد توزیع محاسبات برای جلوگیری از سرریز حافظه و اشباع شبکه چیست؟
سناریو: در پی استعلام رسمی بانک مرکزی از یک نئوبانک پیرامون یک پرونده مشکوک پولشویی، نهاد نظارتی خواستار اثبات منبع دقیق دادههای اعتباری یک مشتری و تمام فرمولهای تبدیلاتی است که در طول ۶ ماه گذشته روی رکوردهای او در سیستم اعمال شده است. تیم فنی به دلیل مستند نبودن خطوط لوله و عدم آگاهی از نسخههای قبلی دیتابیس قادر به پاسخگویی شفاف نیست.
سوال: استقرار کدام مولفه حاکمیت داده (DAMA-DMBOK) این الزام قانونی را به طور ریشهای حل میکند؟
سناریو: یک مدل یادگیری ماشین ارزیابی ریسک صدور بیمهنامه اتومبیل که برای ۲ سال با دقت ۹۲٪ کار میکرده است، در طول ۳ ماه اخیر دچار افت عملکرد فاجعهبار شده و شرکت بیمه با خسارتهای سنگین روبرو گردیده است. بررسیهای اولیه نشان میدهد الگوریتم مدل دستنخورده باقی مانده اما سهم خودروهای برقی و هیبریدی در شهرها به شدت افزایش یافته و توزیع ویژگی «نوع سوخت» و «هزینه قطعات» در ورودیهای زنده سیستم نسبت به دادههای زمان آموزش تغییر اساسی کرده است.
سوال: این پدیده چیست و مکانیزم استاندارد MLOps برای کشف خودکار و مقابله با آن چیست؟
سناریو: در یک اپلیکیشن مسیریابی و تاکسی اینترنتی، در ساعات اوج ترافیک عصرگاهی، کوئریهای سنگین جستجوی نزدیکترین رانندگان و مشاهده نقشه ترافیکی، منابع پردازشی دیتابیس اصلی را بلعیده و مانع از ثبت درخواستهای سفر و تراکنشهای پرداخت رانندگان میشود. بررسیها نشان میدهد نسبت درخواستهای خواندن نقشه به درخواستهای ثبت سفر بیش از ۱۰۰ به ۱ است.
سوال: کدام الگوی معماری دادهمحور پایدارترین و اصولیترین راهکار حل این بحران است؟
سناریو: در یک پلتفرم تجارت الکترونیک، دانشمندان داده برای آموزش آفلاین مدلهای رتبهبندی کالا از اسکریپتهای پایتونی برای استخراج ویژگی «میانگین خرید کاربر در ۳۰ روز گذشته» استفاده میکنند؛ اما تیم مهندسی نرمافزار در زمان استنتاج بلادرنگ (Real-Time Inference) همان ویژگی را با یک کوئری SQL متناقض حساب میکند که منجر به تفاوت خروجی و افت دقت در محیط عملیاتی شده است (پدیده Training-Serving Skew).
سوال: راهحل استاندارد MLOps برای رفع این ناهماهنگی چیست؟
سناریو: یک سازمان قصد دارد چتبات هوشمند خود مبتنی بر یک مدل زبانی بزرگ را برای پاسخگویی به صدها کاربر همزمان مستقر کند. چالش اصلی، تاخیر بالای تولید اولین توکن (Time to First Token - TTFT) و اتلاف شدید حافظه کارت گرافیک به دلیل تخصیص فضاهای خالی و پیوسته برای نگهداری کش مقادیر کلید-مقدار (KV Cache) در مکالمههای طولانی کاربران است.
سوال: بهکارگیری کدام فناوری و معماری سرویسدهی این چالش را در سطح هسته GPU برطرف میسازد؟