पूर्वानुमानित मॉडल
प्रोग्नोस्टिक मॉडल
भविष्यवाणी करने वाले मॉडल एल्गोरिदम हैं जो ऐतिहासिक डेटा के आधार पर भविष्य के मूल्यों या घटनाओं का अनुमान ल वे उत्पाद एनालिटिक्स, जोखिम प्रबंधन, विपणन, धोखाधड़ी विरोधी और परिचालन अनुकूलन को रेखां नीचे एक व्यावहारिक गाइड है: कार्य के शब्दों को संचालन और गुणवत्ता नियंत्रण के लिए चुनने से।
1) कार्य निर्माण और संकेत
प्रतिगमन: निरंतर मूल्य पूर्वानुमान (LTV, जमा आकार, जांच आकार)।
वर्गीकरण: एक घटना की संभावना (30 दिनों का ग्राहक बहिर्वाह, धोखाधड़ी/गैर-धोखाधड़ी)।
रैंकिंग: प्रासंगिकता (सिफारिशों) द्वारा वस्तुओं का आदेश देना।
समय श्रृंखला: कैलेंडर भविष्यवाणी (यातायात, भार, राजस्व)।
अस्तित्व/घटना का समय: बहिर्वाह/चुकाने का अनुमानित समय।
उत्थान मॉडलिंग: प्रभाव के प्रभाव में वृद्धि (जो वास्तव में व्यवहार को बदलता है)।
मल्टी-क्लास/मल्टी-लेबल प्रोडक्शंस: एक ही समय में कई राज्य/घटनाएं।
बायेसियन और संभाव्य मॉडल: स्पष्ट अनिश्चितता के साथ भविष्यवाणी।
2) डेटा और तैयारी
अनाज और अवलोकन खिड़की: पूर्वानुमान इकाई (उपयोगकर्ता/सत्र/दिन) और पूर्वानुमान के क्षण तक विशेषताओं को इकट्ठा करने के लिए एक ईमानदार "खिड़की" को परिभाषित करें।
लक्ष्य चर: स्पष्ट परिभाषा, क्षितिज (7/30/90 दिन), भविष्य के लीक का उन्मूलन।
विशेषताएं: खिड़कियों (7/30/90), व्यवहार आवृत्तियों, अनुक्रमों, श्रेणीबद्ध एन्कोडिंग, इंटरैक्शन, खंड आँकड़े द्वारा समुच्चय।
डेटा गुणवत्ता: चूक, आउटलेयर, डुप्लिकेट, सर्किट परिवर्तन, टाइमस्टैम्प स्थिरता।
वर्ग संतुलन: स्तरीकरण, भार, ओवरसैम्पलिंग/अंडरसैम्पलिंग - पूर्वाग्रह को पेश न करने के लिए सावधान।
3) एल्गोरिदम का विकल्प
मूल रैखिक: रैखिक/लॉजिस्टिक प्रतिगमन, नियमितीकरण (L1/L2/Elastic नेट) - तेज, व्याख्यात्मक।
पेड़ और पहनावा: रैंडम फॉरेस्ट, ग्रेडिएंट बूस्टिंग (XGBoost/LightGBM/CatBoust) - मजबूत बेसलाइन।
तंत्रिका नेटवर्क: जटिल पैटर्न (ग्रंथ, अनुक्रम, समय श्रृंखला) के लिए।
समय श्रृंखला: ARIMA/ETS, पैगंबर, पिछले के साथ ग्रेडिएंट बूस्टिंग, दीपार/एन-बीट्स/टेम्पोरल फ्यूजन ट्रांसफॉर्मर।
उत्थान: दो-मॉडल दृष्टिकोण, टी-लर्नर/एस-लर्नर/एक्स-लर्नर, कारण प्रभाव पेड़।
उत्तरजीविता: कॉक्स, एएफटी, रैंडम सर्वाइवल फॉरेस्ट।
बायेसियन: पूर्व वितरण के साथ जीएलएम/पदानुक्रमित मॉडल।
अभ्यास: एक सरल और प्रजनन योग्य बेसलाइन के साथ शुरू करें, केवल मैट्रिक्स और स्थिरता में मूर्त लाभ के साथ कठिनाई जोड़ें।
4) पृथक्करण और सत्यापन
टेम्पोरल सीवी: समय - अनुभाग के साथ कार्यों के लिए तिथियों द्वारा (रोलिंग/विस्तार विंडो)।
स्तरीकरण: असंतुलित वर्गों के लिए।
समूह सत्यापन: समूहों (user_id, campaign_id) के बीच "लीक" को रोकें।
आउट-ऑफ-टाइम टेस्ट: "भविष्य" अवधि पर अंतिम जांच।
आधारभूत: भोले (अंतिम मूल्य, औसत), आवृत्ति, सरल लॉग्रेग - वास्तविक मूल्य को मापने के लिए।
5) गुणवत्ता मैट्रिक्स
वर्गीकरण: आरओसी-एयूसी, पीआर-एयूसी (दुर्लभ घटनाओं में महत्वपूर्ण), लॉगलॉस, ब्रियर स्कोर, एफ 1, सटीक/रिकॉल @ k, लिफ्ट/एनडीसीजी।
प्रतिगमन: RMSE/MAE/MAPE, sMAPE, R ², मात्रा हानि (प्रतिशत के लिए)।
समय श्रृंखला: MAPE/sMAPE/MASE, पिनबॉल हानि (मात्रा भविष्यवाणी)।
सर्वाइवल: कॉनकॉर्ड इंडेक्स, टाइम-टू-इवेंट के लिए बैरियर।
उत्थान: Qini, उत्थान @ k, AUUC।
बिजनेस मैट्रिक्स: वृद्धिशील लाभ, उपयोगकर्ताओं को बनाए रखा, धोखाधड़ी में कमी, सटीकता एसएलए।
सिफारिश: हमेशा मैट्रिक्स के दो स्तरों को संग्रहीत करें - "एमएल-गुणवत्ता" और "व्यावसायिक प्रभाव"।
6) कैलिब्रेशन और थ्रेसहोल्ड
संभावना अंशांकन: प्लाट, आइसोटोनिक, तापमान स्केलिंग।
सीमा का चयन: व्यावसायिक लक्ष्यों (अधिकतम लाभ/झूठी सकारात्मक सीमा), लागत/जुर्माना द्वारा।
थ्रेशोल्ड स्थिरता: वितरण में परिवर्तन को ध्यान में रखते हुए निगरानी।
7) व्याख्या और व्याख्या
वैश्विक: विशेषताओं का महत्व (लाभ, क्रमपरिवर्तन), पीडीपी/आईसीई, एसएचएपी सारांश।
स्थानीय रूप से: वस्तु समाधान की व्याख्या करने के लिए SHAP/LIME।
कैवेट: व्याख्या परिकल्पना सत्यापन और विश्वास के लिए एक उपकरण है, न कि एक पूर्ण "सत्य"।
8) मुकाबला तैनाती
सेवारत: ऑनलाइन (REST/gRPC, कम विलंबता) और बैच (प्रति घंटा/दैनिक)।
संस्करण: मॉडल, डेटा, योजनाएं और सुविधाएँ (रजिस्ट्री)।
Fichestores: ऑनलाइन/ऑफ़लाइन स्थिरता, बिंदु-इन-टाइम शुद्धता।
देरी नियंत्रण: सुविधा निष्कर्षण बजट, निष्कर्ष, पोस्ट-प्रक्रियाएं।
विफल-सुरक्षित: डिफ़ॉल्ट नियम, आधारभूत गिरावट, समय समाप्ति और रिट्रे।
ए/बी और क्रमिक रोलआउट: कैनरी रिलीज, छाया/अनुमान दर्पण।
9) निगरानी और बहाव
गुणवत्ता: बिक्री पर मैट्रिक्स (आरओसी-एयूसी/पीआर-एयूसी स्थगित लेबल, व्यवसाय केपीआई द्वारा)।
वितरण: पीएसआई/जेएस-विचलन/केएल, सुविधा बहाव और लक्ष्य।
डेटा हेल्थ: अंतराल का हिस्सा, श्रेणियों की कार्डिनैलिटी, स्पाइक्स, पाइपलाइन देरी।
अलर्टिंग और एसएलओ: थ्रेसहोल्ड, रनिबुक (अपमानित होने पर क्या करना है)।
पुनर्प्राप्ति: अनुसूची द्वारा, बहाव ट्रिगर द्वारा, मौसमी द्वारा; गुणवत्ता प्रतिगमन नियंत्रण
10) सुरक्षा, अनुपालन और नैतिकता
गोपनीयता: डेटा कम से कम, छद्म नाम, पहुंच नियंत्रण।
निष्पक्षता: खंडों द्वारा पूर्वाग्रह की जाँच (झूठी सकारात्मक/नकारात्मक दर), नमूनों/थ्रेसहोल्ड को समायोजित करना।
GDPR/स्थानीय मानदंड: प्रसंस्करण उद्देश्य, शेल्फ जीवन, समझाने का अधिकार।
ऑडिटिंग और प्रजनन क्षमता: संस्करण ट्रेसिंग, प्रजनन योग्य विधानसभाएं, समाधान लॉग।
11) ठेठ मामलों के लिए साँचा
मंथन: द्विआधारी वर्गीकरण; मैट्रिक्स - पीआर-एयूसी, प्रतिधारण अभियानों के लिए उत्थान परीक्षण; निष्कर्ष - प्रस्तावों का प्राथमिकता।
एंटीफ्राड: उच्च-संतुलन वर्गीकरण; मैट्रिक्स - पीआर-एयूसी, रिकॉल @ लो-एफपीआर; सख्त विलंबता प्रतिबंध।
LTV/ARPPU: प्रतिगमन या मात्रा प्रतिगमन; नियमित पुनर्गणना।
लोड/राजस्व पूर्वानुमान: समय श्रृंखला; सांख्यिकीय और एमएल-मॉडल का पहनावा; मौसमी और छुट्टियां सुविधाओं के रूप में।
व्यक्तिगत सिफारिशें: रैंकिंग/मैट्रिक्सिंग/सेक-मॉडल; ऑनलाइन अपडेट और शोषण (माल्ट-सशस्त्र डाकू)।
12) प्रक्रिया (एमएल लाइफसाइकिल)
1. समस्या और KPI → 2। डेटा और सुविधाएँ → 3। बेसलाइन → 4। मॉडल और → चयन
2. अंशांकन और थ्रेसहोल्ड → 6। सत्यापन और ए/बी → 7। → 8 की सेवा और निगरानी। पुनर्प्राप्ति/विकास।
प्रत्येक चरण को प्रलेखित किया जाता है: डेटा आरेख, प्रशिक्षण कॉन्फ़िग, कलाकृतियों के संस्करण, प्रायोगिक परिणाम।
13) फीचर इंजीनियरिंग (संक्षिप्त)
समुच्चय: विंडो द्वारा योग/औसत/मात्रा।
काउंटर और आवृत्तियां: रूपांतरण, श्रेणियों की दुर्लभता।
समय पिछड़ जाता है और रुझान: डेल्टा, घातीय स्मूथ।
एन्कोडिंग श्रेणियां: लक्ष्य/आँकड़ेएन्कोडिंग (सावधानीपूर्वक लीक के साथ), WoE, वन-हॉट/हैशिंग।
ग्रंथ और घटनाएँ: TF-IDF, एम्बेडिंग, अनुक्रम सुविधाएँ।
व्यावसायिक तर्क: डोमेन विशेषताएं (उदाहरण के लिए, "अंतिम भुगतान के साथ दिनों की संख्या")।
14) प्रयोग प्रबंधन
ट्रैकिंग: मैट्रिक्स, पैरामीटर, कलाकृतियां, डेटासेट।
Hyperparameters: बायेसियन का दावा, यादृच्छिक/ग्रिड खोज, शुरुआती पड़ाव।
सुविधा नियंत्रण: डेटा कैटलॉग, सर्किट अनुबंध, संगतता परीक्षण।
15) प्री-सेल चेकलिस्ट
- कोई भविष्य लीक नहीं; सही अस्थायी सत्यापन
- मेट्रिक्स कतरनी प्रतिरोधी हैं; एक OOT परीक्षण है
- कैलिब्रेशन सत्यापित; व्यापार सीमा चयनित
- डेटा सुविधा और अनुबंध प्रलेखन
- क्षरण और सतर्क कार्य विन्यस्त हैं
- योजना को वापस लेना और मानदंड को रोकना
- कानूनी और नैतिकता की जाँच पारित
मिनी शब्दावली
वितरण बहाव: समय के साथ डेटा आंकड़ों/लक्ष्य में परिवर्तन।
अंशांकन: घटनाओं की वास्तविक आवृत्ति में संभावनाओं की कमी।
उत्थान: "उपचारित" और "नियंत्रण" के बीच प्रभाव अंतर की भविष्यवाणी।
OOT परीक्षण: प्रशिक्षण/सत्यापन के दौरान पूरी तरह से अदृश्य अवधि पर मॉडल सत्यापन।
कुल
एक भविष्यवाणी करने वाला मॉडल न केवल एक एल्गोरिथ्म है, बल्कि एक प्रक्रिया है: समस्या का सही बयान, डेटा अनुशासन, सख्त सत्यापन, प्रजनन योग्य डीप्ला पाइपलाइनें, निगरानी और नैतिकता। वर्णित चक्र के बाद "सुंदर ऑफ़ लाइन मेट्रिक्स" का जोखिम कम हो जाता है और उत्पाद में वास्तविक मूल्य बढ़ जाता है।