პროგნოზული მოდელები
პროგნოზული მოდელები
პროგნოზული მოდელები არის ალგორითმები, რომლებიც აფასებენ მომავალ მნიშვნელობებს ან მოვლენებს ისტორიული მონაცემების საფუძველზე. ისინი ემყარება სასურსათო ანალიტიკას, რისკების მენეჯმენტს, მარკეტინგს, ანტიფროდს და ოპერაციულ ოპტიმიზაციას. ქვემოთ მოცემულია პრაქტიკული სახელმძღვანელო: პრობლემის ფორმულირების არჩევიდან ექსპლუატაციამდე და ხარისხის კონტროლამდე.
1) დავალებებისა და სიგნალების ფორმულირება
რეგრესია: უწყვეტი მასშტაბის პროგნოზი (LTV, ანაბრის ზომა, ჩეკის ზომა).
კლასიფიკაცია: მოვლენის ალბათობა (კლიენტის გადინება 30 დღეში, frode/არა frode).
რანგირება: შესაბამისი ობიექტების მოწესრიგება (რეკომენდაციები).
დროებითი რიგები: პროგნოზი კალენდრის მიხედვით (ტრაფიკი, დატვირთვა, შემოსავალი).
Survival/ღონისძიებამდე დრო: დროის შეფასება გადინებამდე/ხელახლა გადახდამდე.
Uplift მოდელირება: ეფექტის ზრდა (რომელი მოქმედება ნამდვილად ცვლის ქცევას).
მრავალკლასიანი/მრავალმხრივი სპექტაკლები: ერთდროულად რამდენიმე სახელმწიფო/მოვლენა.
ბაიესოვსკის და სავარაუდო მოდელები: პროგნოზი აშკარა გაურკვევლობით.
2) მონაცემები და მომზადება
მარცვლეული და სათვალთვალო ფანჯარა: განსაზღვრეთ პროგნოზის ერთეული (მომხმარებელი/სესია/დღე) და გულწრფელი „ფანჯარა“ ნიშნების შეგროვების მომენტამდე.
სამიზნე ცვლადი: მკაფიო განმარტება, ჰორიზონტები (7/30/90 დღე), მომავლის გაჟონვის გამორიცხვა.
ნიშნები: ფანჯრების დანაყოფები (7/30/90), ქცევითი სიხშირეები, თანმიმდევრობები, კატეგორიული ენკოდინგი, ურთიერთქმედება, სეგმენტების სტატისტიკა.
მონაცემთა ხარისხი: გამოტოვება, ემისიები, დუბლიკატები, სქემების შეცვლა, დროებითი ეტიკეტების თანმიმდევრულობა.
კლასების ბალანსი: სტრატიფიკაცია, წონა, oversampling/undersampling - სისუფთავე ისე, რომ არ მოხდეს გადაადგილება.
3) ალგორითმების არჩევანი
ძირითადი ხაზოვანი: ხაზოვანი/ლოგისტიკური რეგრესია, რეგულირება (L1/L2/Elastic Net) - სწრაფი, ინტერპრეტირებული.
ხეები და ანსამბლები: Random Forest, Gradient Boosting (XGBoost/LightGBM/CatBoost) - ძლიერი ბასლაინები.
ნერვული ქსელები: MLP/Seq2Seq/Transformer რთული ნიმუშებისთვის (ტექსტები, თანმიმდევრობები, დროებითი რიგები).
დროებითი რიგები: ARIMA/ETS, Prophet, Gradient Boosting ერთად lages, DeepAR/N-BEATS/Temporal Fusion Transformer.
Uplift: ორმაგი მოდელის მიდგომა, T-Learner/S-Learner/X-Learner, მიზეზობრივი ეფექტის ხეები.
Survival: Cox, AFT, Random Survival Forests.
ბაიესოვსკი: GLM/იერარქიული მოდელები პრიორიტეტული განაწილებით.
პრაქტიკა: დაიწყეთ მარტივი და რეპროდუქციული ბეისლაინიდან, დაამატეთ სირთულე მხოლოდ მეტრიკებით და სტაბილურობით ხელშესახები გამარჯვებით.
4) განცალკევება და ვალდებულება
Temporal CV: დროთა განმავლობაში დავალებებისთვის - თარიღები (rolling/expanding windows).
სტრატიფიკაცია: დისბალანსული კლასებისთვის.
ჯგუფური შესაბამისობა: ნუ დაუშვებთ ჯგუფებს შორის „გაჟონვას“ (user _ id, campaign _ id).
Out-time ტესტი: საბოლოო გამოცდა „მომავალი“ პერიოდისთვის.
ბასლაინები: გულუბრყვილო (ბოლო მნიშვნელობა, საშუალო), სიხშირე, მარტივი ლოგრაგი - რეალური მნიშვნელობის გაზომვისთვის.
5) ხარისხის მეტრიკა
კლასიფიკაცია: ROC-AUC, PR-AUC (მნიშვნელოვანია იშვიათი მოვლენებისთვის), ლოგოები, Brier score, F1, precision/recall @ k, lift/NDCG.
რეგრესია: RMSE/MAE/MAPE, sMAPE, R ², quantile loss (პერცენტილებისთვის).
დროებითი რიგები: MAPE/sMAPE/MASE, Pinball loss (quantile პროგნოზი).
Survival: Concordance index, Brier Do.
Uplift: Qini, uplift@k, AUUC.
ბიზნეს მეტრიკა: სავარაუდო მოგება, მომხმარებლების მიერ დაკავებული, ფროიდის შემცირება, SLA სიზუსტით.
რეკომენდაცია: ყოველთვის შეინახეთ მეტრიკის ორი დონე - „ML ხარისხი“ და „ბიზნეს ეფექტი“.
6) კალიბრაცია და ბარიერები
ალბათობის კალიბრაცია: Platt, isotonic, temperature სკალირება.
ბარიერის არჩევანი: ბიზნეს მიზნებზე (მაქსიმალური მოგება/ყალბი პოზიტიური შეზღუდვა), ხარჯები/ჯარიმები.
ბარიერის სტაბილურობა: მონიტორინგი განაწილების ცვლილების გათვალისწინებით.
7) ინტერპრეტაცია და ახსნა
გლობალურად: ნიშნების მნიშვნელობა (gain, permutation), PDP/ICE, SHAP ცნობები.
ადგილობრივად: SHAP/LIME ობიექტის შესახებ გადაწყვეტილების ასახსნელად.
Caveat: ინტერპრეტაცია არის ჰიპოთეზებისა და ნდობის შენარჩუნების ინსტრუმენტი და არა აბსოლუტური „ჭეშმარიტება“.
8) საბრძოლო განლაგება
სერვინგი: ონლაინ რეჟიმში (REST/gRPC, დაბალი შეფერხება) და ბრძოლა (საათობრივი/ყოველდღიური).
ვერსია: მოდელები, მონაცემები, სქემები და ძაფები (რეგისტრი).
Ichestors: ონლაინ/offline კოორდინაცია, წერტილის ტიპის სისწორე.
შეფერხებების კონტროლი: ბიუჯეტი ნიშნების, ინვესტიციის, პოსტ-პროცესების მოპოვებისთვის.
Fail-safe: ნაგულისხმევი წესები, Beisline- ის დეგრადაცია, Taimauta და retrai.
A/B და თანდათანობითი rollout: კანარის გამოშვებები, shadow/inference mirroring.
9) მონიტორინგი და დრიფტი
ხარისხი: გაყიდვების მეტრიკა (ROC-AUC/PR-AUC გადავადებულ ეტიკეტებზე, ბიზნეს KPI).
განაწილება: PSI/JS-divergence/KL, ნიშნების დრიფტი და სამიზნე.
Data Health: საგუშაგოების წილი, კატეგორიების კარდინალობა, შეჯვარება, შეფერხებების შეფერხება.
ალერტინგი და SLO: ბარიერი მნიშვნელობები, რუნიბუკები (რა უნდა გავაკეთოთ დეგრადაციის დროს).
რეტრენინგი: გრაფიკის მიხედვით, დრიფტის გამომწვევი, სეზონური; ხარისხის რეგრესიის კონტროლი.
10) უსაფრთხოება, შესაბამისობა და ეთიკა
კონფიდენციალურობა: მონაცემების შემცირება, ფსევდონიმები, წვდომის კონტროლი.
სამართლიანობა: bias- ის შემოწმება სეგმენტებში (false positive/negative), samples/რეიდების კორექტირება.
GDPR/ადგილობრივი სტანდარტები: დამუშავების მიზნები, შენახვის ვადა, ახსნის უფლება.
აუდიტი და რეპროდუქცია: შეკრების რეპროდუქციული ვერსიების კვალი, გადაწყვეტილებების ჟურნალი.
11) ტიპიური შემთხვევების შაბლონები
გადინება: ორობითი კლასიფიკაცია; მეტრიკა - PR-AUC, შეფერხების კამპანიის ტესტირება; დასკვნა არის ოფისის პრიორიტეტი.
ანტიფროდი: მაღალი ზომის ბალანსის კლასიფიკაცია; მეტრიკა - PR-AUC, recall @ low-FPR; მკაცრი შეზღუდვები.
LTV/ARPPU: რეგრესია ან კვანტილური რეგრესია; რეგულარული გადატვირთვა.
დატვირთვის/შემოსავლის პროგნოზი: დროებითი რიგები; სტატისტიკური და ML მოდელების ანსამბლი; სეზონურობა და არდადეგები, როგორც ფიჩები.
პერსონალური რეკომენდაციები: რანჟირება/მატრაქტორიზაცია/seq მოდელები; ონლაინ განახლებები და ექსპლოატაცია.
12) პროცესი (ML Lifecycle)
1. პრობლემა და KPI 2. მონაცემები და ფიჩები 3. ბაზლაინი 4. მოდელები და შერჩევა
2. კალიბრაცია და ბარიერები - 6. ვალიდაცია და A/B-7. სერვინგი და მონიტორინგი 8. რეტრენინგი/ევოლუცია.
თითოეული ეტაპი არის აღწერილი: მონაცემთა სქემები, ტრენინგის კონფიგურაცია, არტეფაქტების ვერსიები, ექსპერიმენტების შედეგები.
13) ნიშნების ინჟინერია (მოკლედ)
დანაყოფები: თანხები/საშუალო/ფანჯრები.
მრიცხველები და სიხშირეები: კონვერტაცია, კატეგორიების იშვიათობა.
დროებითი ბლოკები და ტენდენციები: დელტა, ექსპონენციალური გამკვრივება.
კატეგორიების Encoding: target/stats encoding (ფრთხილად გაჟონვით), WoE, one-hot/Hashing.
ტექსტები და მოვლენები: TF-IDF, ემბედინგი, sequence ფიჩები.
ბიზნეს ლოგიკა: აფეთქების ღუმელის ნიშნები (მაგალითად, „დღეების რაოდენობა ბოლო გადახდით“).
14) ექსპერიმენტების მართვა
ტრეკინგი: მეტრიკა, პარამეტრები, არტეფაქტები, Datasets.
ჰიპერპარმეტრები: ბაიესის სარჩელი, random/grid search, ადრეული გაჩერება.
ფირების კონტროლი: მონაცემთა კატალოგი, სქემების ხელშეკრულება, თავსებადობის ტესტები.
15) ჩეკის სია გაყიდვამდე
არ არსებობს მომავლის გაჟონვა; სწორი დროებითი დადასტურება
- მეტრიკა მდგრადია ცვლისთვის; არსებობს OOT ტესტი
შემოწმებულია კალიბრაცია; არჩეულია ბიზნეს ბარიერი
- ძაფებისა და მონაცემთა კონტრაქტების დოკუმენტაცია
- დეგრადაციის და ალერტას ფუნქციები
- რეტრენინგის გეგმა და შეჩერების კრიტერიუმები
გაიარა იურიდიული და ეთიკური შემოწმებები
მინი გლოსარიუმი
განაწილების დრიფტი: მონაცემთა სტატისტიკის ცვლილება/მიზნობრივი დრო.
კალიბრაცია: ალბათობის რეალურ სიხშირემდე მიტანა.
Uplift: „დამუშავებულ“ და „კონტროლს“ შორის ეფექტის სხვაობის პროგნოზი.
OOT ტესტი: მოდელის შემოწმება იმ პერიოდისთვის, რომელიც სრულიად უხილავია ტრენინგის/ვალიდაციის დროს.
შედეგი
Prognostic მოდელი არა მხოლოდ ალგორითმია, არამედ პროცესია: დავალების სწორად დაყენება, მონაცემთა დისციპლინა, მკაცრი შესაბამისობა, რეპროდუცირება deplines, მონიტორინგი და ეთიკა. აღწერილი ციკლის შემდეგ ამცირებს „ლამაზი მეტრიკის ხაზის“ რისკს და ზრდის პროდუქტის რეალურ ღირებულებას.