מודלים פרוגנוסטיים
מודלים פרוגנוסטיים
מודלים לחיזוי הם אלגוריתמים המעריכים ערכים או אירועים עתידיים המבוססים על נתונים היסטוריים. הם מסתמכים על ניתוח מוצרים, ניהול סיכונים, שיווק, אנטי הונאה ואופטימיזציה תפעולית. להלן מדריך מעשי: החל בבחירת ניסוח המשימה וכלה בהפעלת בקרת איכות.
1) גיבוש משימות ואותות
רגרסיה: תחזית ערך רציפה (LTV, גודל הפקדה, סימון).
סיווג: הסתברות לאירוע (זרימת לקוחות של 30 יום, הונאה/אי הונאה).
דירוג: הזמנת אובייקטים על ידי רלוונטיות (המלצות).
סדרת זמן: תחזית לוח שנה (תנועה, עומס, הכנסות).
הישרדות/זמן לאירוע: זמן משוער לזרום/להחזיר.
דוגמנות מרוממת: העלייה בהשפעת ההשפעה (שהמניה באמת משנה את ההתנהגות).
הפקות רב-מערכתיות/רב-תוויות: מספר מצבים/אירועים בו זמנית.
מודלים ביזאריים והסתברותיים: תחזית עם אי ודאות נראית לעין.
2) נתונים והכנה
חלון תבואה ותצפית: הגדר את יחידת התחזית (משתמש/סשן/יום) ו ”חלון” ישר לאיסוף מאפיינים עד לרגע התחזית.
משתנה מטרה: הגדרה ברורה, אופקים (7/30/90 ימים), ביטול של דליפות עתידיות.
תכונות: צבירה של חלונות (7/30/90), תדרים התנהגותיים, רצפים, קידוד קטגורי, אינטראקציות, סטטיסטיקות קטע.
איכות נתונים: השמטות, חריגות, שכפולים, שינויי מעגל, עקביות חותמת זמן.
איזון כיתתי: סטריטיזציה, תזונה, הידרדרות יתר/ירידה חדה - היזהרו שלא להציג דעות קדומות.
3) בחירת אלגוריתמים
ליניארי בסיסי: רגרסיה ליניארית/לוגיסטית, רגולריזציה (L1/L2/Elastic Net) - מהיר, בר-פרשנות.
עצים וקבצים: Random Forest, Gradient Hosting (XGBoost/LightGBM/CatBost) - קווי בסיס חזקים.
רשתות עצביות: MLP/Seq2Seq/Transformer לתבניות מורכבות (טקסטים, רצפים, סדרות זמן).
סדרת זמן: ARIMA/ETS, Prophet, Gradient Hosting with lags, DeepAR/N-BEATS/Temporal Fusion Transformer.
גישה דו-מודלית, T-Learner/S-Learner/X-Learner, עצי אפקט סיבתי.
הישרדות: Cox, AFT, יערות הישרדות אקראיים.
Bayesian: GLM/hierarchical models עם הפצות קודמות.
תרגול: התחל עם קו בסיס פשוט ומתרבה, הוסף קושי רק עם רווחים מוחשיים במדדים ויציבות.
4) הפרדה ואימות
קורות חיים זמניים: עבור משימות עם קטעי זמן לפי תאריכים (גלגול/הרחבת חלונות).
סטרטיפיקציה: לשיעורים לא מאוזנים.
אימות קבוצתי: למנוע ”הדלפות” בין קבוצות (user_id, campaign_id).
מבחן מחוץ לזמן: בדיקה אחרונה על תקופת ”העתיד”.
קווי בסיס: נאיבי (ערך אחרון, ממוצע), תדירות, לוגרג פשוט - למדוד ערך אמיתי.
5) מדדים איכותיים
סיווג: ROC-AUC, PR-AUC (חשוב באירועים נדירים), Logloss, Brier Score, F1, decision/recall @ k, lift/NDCG.
רגרסיה: RMSE/MAE/MAPE, sMAPE, R/R, אובדן כמותי (לאחוזים).
סדרת זמן: MAPE/sMAPE/MASE, אובדן פינבול (חיזוי כמותי).
אינדקס קונקורדנציה, ברייר עבור זמן לאירוע.
התרוממות רוח: Kini, UUC, Uplift @ k, AUUC.
מדדים עסקיים: רווח מצטבר, משתמשים נשמרים, הפחתת הונאה, SLAA דיוק.
המלצה: תמיד לאחסן שתי רמות של מדדים - ”ML-איכות” ו ”אפקט עסקי”.
6) כיול וסף
כיול הסתברותי: פלאט, איזוטוני, מדד טמפרטורה.
בחירת הסף: על ידי מטרות עסקיות (רווח/הגבלה מקסימלית של חיובי כוזב), על ידי עלויות/קנסות.
יציבות סף: ניטור לוקח בחשבון שינויים בהתפלגויות.
7) יכולת פירוש והסברה
גלובלי: חשיבות המאפיינים (רווח, תמורה), PDP/ICE, סיכומי SHAP.
מקומי: SHAP/LIME כדי להסביר את פתרון העצם.
Caveat: Interpretability הוא כלי לאימות היפותזה ואמון, לא ”אמת” מוחלטת.
8) פריסת אמצעי לחימה
הגשה: מקוונת (REST/gRPC, Latency) ואצווה (שעה/יום).
Versioning: מודלים, נתונים, תוכניות ותכונות (registry).
פיצ 'סטורס: עקביות מקוונת/לא מקוונת, תקינות נקודה בזמן.
בקרת עיכוב: תקציב מיצוי תכונה, הסקה, לאחר תהליכים.
חוקי ברירת מחדל, הידרדרות קו הבסיס, פסקי זמן ומגשים מחדש.
A/B ועלייה הדרגתית: הקנרית משחררת, שיקוף צל/הסקה.
9) מעקב וסחף
איכות: מדדים למכירה (ROC-AUC/PR-AUC על ידי תוויות דחויות, KPIs עסקיות).
הפצות: PSI/JS-Divergence/KL, סחיפת תכונה ומטרה.
בריאות נתונים: נתח של פערים, קרדינליות של קטגוריות, קוצים, עיכובי צינור.
התראה ו-SLO: סף, רניבוקים (מה לעשות כאשר מושפל).
אימון מחדש: לפי לוח זמנים, על ידי גרירת סחף, על פי עונתיות; בקרת רגרסיה איכותית.
10) בטיחות, ציות ואתיקה
פרטיות: מזעור נתונים, פסאודונימיזציה, בקרת גישה.
הגינות: בדיקת הטיה על ידי מקטעים (שיעור חיובי/שלילי שגוי), התאמת דגימות/סף.
GDPR/נורמות מקומיות: יעדי עיבוד, חיי מדף, זכות הסברה.
ביקורת והתרבות: איתור גרסאות, אספות רבייה, יומן פתרונות.
11) תבניות למקרים טיפוסיים
Turn: סיווג בינארי; מדדים - יחסי ציבור, מבחן התרוממות רוח לקמפיינים לשימור; מסקנה - עדיפות להצעות.
אנטי-פראוד: סיווג באיזון גבוה; Metrics - יחסי ציבור-UC, recall @ low-FPR; הגבלות לאחיזה קפדניות.
LTV/ARPU: רגרסיה או רגרסיה כמותית; כיול מחדש רגיל.
תחזית עומס/הכנסות: סדרת זמן; אנסמבל של מודלים סטטיסטיים ו-ML; עונתיות וחגים כמאפיינים.
המלצות אישיות: דירוג/matrixing/seq-models; עדכונים וניצול מקוונים (שודדים חמושים).
12) תהליך (ML Lifecycle)
1. בעיה ו ־ KPI # 2. נתונים ותכונות = 3. קו בסיס # 4. מודלים ובחירת extweather con
2. כיול וסיפים = 6. אימות ו A/B # 7. מגיש ומפקח על פי 8. אימון מחדש/אבולוציה.
כל שלב מתועד: דיאגרמות נתונים, תצורות אימון, גרסאות של חפצים, תוצאות ניסיוניות.
13) הנדסת תכונה (תקציר)
אגרגטים: סכומים/ממוצעים/כמויות על ידי חלון.
מונים ותדרים: המרות, נדירות של קטגוריות.
פיגור בזמן ומגמות: דלתות, שייק אקספוננציאלי.
קטגוריות קידוד: קידוד יעד/סטטוסים (עם דליפות בזהירות), WoE, One-Hashing.
טקסטים ואירועים: צה "ל, שיבוץ, מאפייני רצף.
לוגיקה עסקית: מאפייני תחום (לדוגמה, ”מספר ימים בתשלום אחרון”).
14) ניהול ניסויים
מדדים, פרמטרים, חפצים, מערכות נתונים.
יתר פרמטרים: טענה בייסיאנית, חיפוש אקראי/רשת, עצירה מוקדמת.
בקרת תכונה: קטלוג נתונים, חוזה מעגל, מבחני תאימות.
15) רשימת בדיקות לפני המכירה
[ ] אין דליפות עתידיות; תקן אימות זמני
[ ] Metrics עמידים בפני גזירה; יש לי מבחן OOT
[ ] כיול מאומת; הסף העסקי נבחר
[ ] נתונים ותיעוד חוזה
[ ] תפקודי התפלה והתראה מוגדרים
[ ] תוכנית אימון מחדש ועצירת קריטריונים
[ ] המחאות משפטיות ואתיות עברו
מיני גלוסרי
סחף הפצה: שינוי בנתונים/יעד לאורך זמן.
כיול: הפחתת ההסתברויות לתדירות האמיתית של אירועים.
רוממות: ניבוי של הבדל אפקט בין ”מטופל” ו ”שליטה”.
מבחן OOT: אימות מודל על תקופה בלתי נראית לחלוטין במהלך אימון/אימות.
סך הכל
מודל חיזוי הוא לא רק אלגוריתם, אלא גם תהליך: הצהרה נכונה של הבעיה, דיסציפלינת נתונים, אימות קפדני, צינורות דיספלרה רבעוניים, ניטור ואתיקה. המעגל המתואר מפחית את הסיכון של ”מדדים לא מקוונים יפים” ומגדיל את הערך האמיתי של המוצר.