آزمون استاندارد ارزیابی مهارت ۱۰ سوال سناریومحور تخصصی کارنامه تحلیلی آنی

آزمون جامع شبیه‌سازی ۲ — مهندسی داده، زیرساخت و MLOps

۱۰ سوال عمیق و تخصصی کلاسترها، پردازش توزیع‌شده Spark، انبارهای داده و پایپ‌لاین‌های استقرار MLOps با کارنامه تحلیلی.

آزمون جامع شبیه‌سازی ۲ — مهندسی داده، زیرساخت و MLOps

ویژه آزمون مشاوران و کارشناسان سازمان نظام صنفی رایانه‌ای کشور (نصر)

رشته: هوش مصنوعی و تحلیل داده
کدهای حوزه امتحانی: AI03 (داده و زیرساخت داده - ۲۰٪) | AI04 (مدل‌های زبانی و استقرار - ۱۵٪) | AI06 (مدیریت پروژه و MLOps - ۱۰٪)
تعداد سوالات: ۱۰ سوال سناریومحور چهارگزینه‌ای تخصصی
نمره منفی: دارد (به ازای هر ۳ پاسخ نادرست، یک پاسخ درست حذف می‌شود)
مدت زمان پیشنهادی: ۳۵ دقیقه


راهنمای داوطلبان:

این آزمون بر مبنای آخرین الگوهای استاندارد آزمون‌های مشاوره نظام صنفی رایانه‌ای، سناریوهای واقعی مهندسی سیستم و استانداردهای DAMA و MLOps طراحی شده است. تمام سوالات در قالب موقعیت‌های عملیاتی سازمان‌ها مطرح شده‌اند. در پایان سوالات، کلید پاسخ‌ها و تحلیل تشریحی تک‌تک گزینه‌ها درج گردیده است.


بخش اول: سوالات آزمون

📝 سامانه آزمون تعاملی و شبیه‌سازی جامع (10 سوال تستی سناریومحور)
همراه با نمره‌دهی و صدور کارنامه هوشمند
سوال 1 معماری انبار داده و مدل‌سازی ابعادی

سناریو: یک بانک بزرگ با بیش از ۵۰ میلیون مشتری قصد دارد انبار داده تحلیلی خود را بازطراحی کند. مدیریت بانک نیازمند بررسی اثر تغییر وضعیت شغلی و رتبه اعتباری مشتریان بر نرخ نکول تسهیلات در دوره‌های ۵ ساله است؛ به گونه‌ای که هر وام صادرشده در سال‌های گذشته دقیقاً به رتبه اعتباری مشتری در زمان دریافت وام پیوند خورده باشد. همچنین تیم BI خواهان اجرای سریع کوئری‌های تحلیلی با کمترین تعداد JOIN میان جداول است.

سوال: کدام الگوی طراحی انبار داده و تکنیک مدیریت بعد به عنوان راهکار بهینه مشاوره‌ای باید انتخاب شود؟

سوال 2 معماری دریاچه داده و Lakehouse

سناریو: یک پلتفرم پخش آنلاین ویدیو (VOD)، روزانه ترابایت‌ها لاگ رویدادهای کلیک، متوقف کردن و پرش فیلم‌ها را به همراه نظرات متنی و داده‌های رتبه‌بندی دریافت می‌کند. سیستم فعلی به دلیل استفاده از معماری سنتی دریاچه داده و فایل‌های خام، دچار فقدان تراکنش‌های ACID شده و اجرای همزمان کوئری‌های تحلیلی و نوشتن داده‌های جدید منجر به خواندن داده‌های ناقص و شکست جاب‌های یادگیری ماشین می‌شود.

سوال: مناسب‌ترین راهکار معماری برای حل این بحران بدون افزایش سرسام‌آور هزینه‌ها چیست؟

سوال 3 پردازش کلان‌داده با آپاچی اسپارک

سناریو: یک خط لوله پردازش داده در Apache Spark وظیفه دارد داده‌های تراکنش‌های بانکی را با اطلاعات پذیرندگان پیوند دهد (Join Operation). بررسی مانیتورینگ اسپارک نشان می‌دهد که از میان ۲۰۰ تسک موازی، ۱۹۹ تسک در کمتر از ۲۰ ثانیه به اتمام می‌رسند، اما تسک پایانی بیش از ۴۵ دقیقه به طول انجامیده و باعث شکست کل جاب می‌شود (پدیده Data Skew شدید روی کلید یک پذیرنده بسیار بزرگ مانند فروشگاه کوروش).

سوال: مهندسانه‌ترین تکنیک برای رفع این گلوگاه در اسپارک کدام است؟

سوال 4 پردازش استریم بلادرنگ با کافکا و فلینک

سناریو: در یک سامانه اینترنت اشیاء صنعتی (IIoT)، حسگرهای لرزش‌سنج توربین‌ها داده‌های خود را از طریق شبکه مخابراتی بی‌سیم به کلاستر آپاچی کافکا ارسال می‌کنند. به دلیل قطع و وصل مکرر آنتن‌های محلی، برخی پیام‌های حیاتی سنسورها با تاخیر چنددقیقه‌ای و خارج از ترتیب زمانی ارسال (Out-of-Order Events) به سیستم می‌رسند. موتور پردازش باید بر اساس «زمان وقوع رخداد در فیزیک سنسور» محاسبات پنجره لغزان ۵ دقیقه‌ای را انجام دهد.

سوال: کدام ترکیب تنظیمی در موتور پردازش Apache Flink تضمین‌کننده تحلیل دقیق محاسبات است؟

سوال 5 پردازش توزیع‌شده و آموزش مدل‌های زبانی بزرگ

سناریو: یک تیم هوش مصنوعی قصد دارد یک مدل پردازش زبان طبیعی با ابعاد ۷۰ میلیارد پارامتر را روی یک کلاستر مجهز به ۳۲ کارت گرافیک Nvidia A100 (با حافظه ۸۰ گیگابایت برای هر GPU) آموزش دهد. وزن‌های مدل به همراه گرادیان‌ها و وضعیت بهینه‌ساز Adam نیازمند بیش از ۵۰۰ گیگابایت حافظه هستند و در یک کارت گرافیک جا نمی‌شوند. همچنین ارتباط سرورها از طریق شبکه ۴۰۰ گیگابیت InfiniBand برقرار است.

سوال: استراتژی استاندارد توزیع محاسبات برای جلوگیری از سرریز حافظه و اشباع شبکه چیست؟

سوال 6 حاکمیت داده و تبارشناسی

سناریو: در پی استعلام رسمی بانک مرکزی از یک نئوبانک پیرامون یک پرونده مشکوک پولشویی، نهاد نظارتی خواستار اثبات منبع دقیق داده‌های اعتباری یک مشتری و تمام فرمول‌های تبدیلاتی است که در طول ۶ ماه گذشته روی رکوردهای او در سیستم اعمال شده است. تیم فنی به دلیل مستند نبودن خطوط لوله و عدم آگاهی از نسخه‌های قبلی دیتابیس قادر به پاسخگویی شفاف نیست.

سوال: استقرار کدام مولفه حاکمیت داده (DAMA-DMBOK) این الزام قانونی را به طور ریشه‌ای حل می‌کند؟

سوال 7 مهندسی کیفیت داده و پدیده رانش

سناریو: یک مدل یادگیری ماشین ارزیابی ریسک صدور بیمه‌نامه اتومبیل که برای ۲ سال با دقت ۹۲٪ کار می‌کرده است، در طول ۳ ماه اخیر دچار افت عملکرد فاجعه‌بار شده و شرکت بیمه با خسارت‌های سنگین روبرو گردیده است. بررسی‌های اولیه نشان می‌دهد الگوریتم مدل دست‌نخورده باقی مانده اما سهم خودروهای برقی و هیبریدی در شهرها به شدت افزایش یافته و توزیع ویژگی «نوع سوخت» و «هزینه قطعات» در ورودی‌های زنده سیستم نسبت به داده‌های زمان آموزش تغییر اساسی کرده است.

سوال: این پدیده چیست و مکانیزم استاندارد MLOps برای کشف خودکار و مقابله با آن چیست؟

سوال 8 سامانه‌های داده‌محور و الگوهای مقیاس‌پذیری

سناریو: در یک اپلیکیشن مسیریابی و تاکسی اینترنتی، در ساعات اوج ترافیک عصرگاهی، کوئری‌های سنگین جستجوی نزدیک‌ترین رانندگان و مشاهده نقشه ترافیکی، منابع پردازشی دیتابیس اصلی را بلعیده و مانع از ثبت درخواست‌های سفر و تراکنش‌های پرداخت رانندگان می‌شود. بررسی‌ها نشان می‌دهد نسبت درخواست‌های خواندن نقشه به درخواست‌های ثبت سفر بیش از ۱۰۰ به ۱ است.

سوال: کدام الگوی معماری داده‌محور پایدارترین و اصولی‌ترین راهکار حل این بحران است؟

سوال 9 معماری Feature Store در MLOps

سناریو: در یک پلتفرم تجارت الکترونیک، دانشمندان داده برای آموزش آفلاین مدل‌های رتبه‌بندی کالا از اسکریپت‌های پایتونی برای استخراج ویژگی «میانگین خرید کاربر در ۳۰ روز گذشته» استفاده می‌کنند؛ اما تیم مهندسی نرم‌افزار در زمان استنتاج بلادرنگ (Real-Time Inference) همان ویژگی را با یک کوئری SQL متناقض حساب می‌کند که منجر به تفاوت خروجی و افت دقت در محیط عملیاتی شده است (پدیده Training-Serving Skew).

سوال: راه‌حل استاندارد MLOps برای رفع این ناهماهنگی چیست؟

سوال 10 بهینه‌سازی استنتاج و فریمورک‌های سرویس‌دهی LLM

سناریو: یک سازمان قصد دارد چت‌بات هوشمند خود مبتنی بر یک مدل زبانی بزرگ را برای پاسخگویی به صدها کاربر هم‌زمان مستقر کند. چالش اصلی، تاخیر بالای تولید اولین توکن (Time to First Token - TTFT) و اتلاف شدید حافظه کارت گرافیک به دلیل تخصیص فضاهای خالی و پیوسته برای نگه‌داری کش مقادیر کلید-مقدار (KV Cache) در مکالمه‌های طولانی کاربران است.

سوال: به‌کارگیری کدام فناوری و معماری سرویس‌دهی این چالش را در سطح هسته GPU برطرف می‌سازد؟

نویسنده و مؤلف اثر ✓ بازبینی، تحلیل و غنی‌سازی انسانی
👨‍💻

بختیار آهنی

مشاور سازمان نظام صنفی رایانه‌ای در رسته هوش مصنوعی و نرم‌افزار و معمار سیستم‌های AI و رشد | بنیانگذار Webeon Venture Studio | مهندسی وب، سئو و اتوماسیون AI | ساخت دارایی‌های دیجیتال و سیستم‌های رشد مقیاس‌پذیر برای کسب‌وکارهای پزشکی و دانش‌محور
شفاف‌سازی اخلاقی و شیوه تدوین: این فصل با استفاده از هوش مصنوعی در مراحل تحقیق، ساختاربندی و پیش‌نویس اولیه تهیه شده و توسط نویسنده به صورت تخصصی بازبینی، تحلیل، اصلاح و تکمیل شده است.
مشاهده پروفایل و سوابق تخصصی نویسنده ←