مدرسه پردازش و تحلیل داده دقیقه
توضیحات روش‌شناختی

قواعد و نکات مهم

  • تمام شناسه‌ها ناشناس و بازگشت‌ناپذیرند و ترتیب ردیف‌ها هیچ سیگنالی ندارد؛ تلاش برای مهندسی معکوس شناسه‌ها بی‌فایده است.
  • ویژگی‌ها فقط از دادهٔ پیش از بازهٔ برچسب محاسبه شده‌اند؛ بنابراین هیچ نشتی داده‌ای (Data Leakage) از آینده در داده وجود ندارد و استفاده از چنین نشتی‌ای در راه‌حل نیز مجاز نیست.
  • دادهٔ آموزش و دادهٔ ارزیابی به مجموعه‌های کاملاً مجزا از خرده‌فروش‌ها تعلق دارند (بدون هم‌پوشانی). به بیان دیگر، مدل شما روی خرده‌فروش‌هایی سنجیده می‌شود که هرگز در آموزش ندیده است؛ این موضوع تعمیم‌پذیری واقعی مدل را می‌سنجد.
  • ارزیابی نهایی روی یک فایل پاسخ محرمانه (که در اختیار برگزارکننده است) انجام می‌شود و برچسب‌های دادهٔ ارزیابی در دسترس شرکت‌کننده نیست.
  • نکتهٔ فنی: استفادهٔ نادرست از فیلترینگ مشارکتی (Collaborative Filtering) برای رتبه‌بندی «کاربران» به‌جای «اقلام» یک دام رایج است؛ برای این مسئله، مدل‌های تمایل نظارت‌شده (Supervised Propensity) رویکرد درست‌تری هستند.
  • مدلسازی با تعداد مشاهدات اندک یکی از چالش‌های رایج پیش‌بینی رفتار برند در صنعت خرده‌فروشی است. به همین خاطر برای حل چنین مسائلی استفاده از مدل‌هایی مثل شبکه‌های عصبی و یادگیری عمیق که نیاز به داده‌های زیادی دارند توصیه نمی‌شود. دانش و خلاقیت خود در مدلسازی را به گونه‌ای به کار بگیرید که بهترین نتیجه با آگاهی نسبت به این محدودیت حاصل شود. 

معیارهای ارزیابی

  • معیار اصلی: PR-AUC (میانگین دقت، Average Precision). این معیار در شرایط نامتوازن بودن کلاس‌ها (که در این مسئله برند هدف معمولاً اقلیت است) قابل‌اعتمادتر از دقت (Accuracy) یا حتی ROC-AUC است.
  • معیارهای فرعی برای گزارش و رفع تساوی: ROC-AUC و همچنین Precision@Top-10٪ (از میان ۱۰٪ خرده‌فروش با بالاترین امتیاز، چه نسبتی واقعاً خرید کرده‌اند). این معیار آخر مستقیماً کاربرد تجاری واقعی را می‌سنجد: در عمل کمپین فقط برای فهرست کوتاهی از خرده‌فروش‌ها اجرا می‌شود.
Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors