Սեմպիլացիա և ռեպրեսենտալիզմ
Սեմպիլացիա և ներկայացուցչություն
Սեմպլացիան դիտարկման ենթաբազմության ընտրություն է մոդելների պատրաստման, փորձերի և ուսուցման համար։ Ներկայացուցչությունը նշանակում է, որ նմուշից եզրակացությունները մեծանում են նպատակային բնակչության վրա առանց համակարգված սխալների։ Ներքևում, թե ինչպես պատրաստել նմուշը, գնահատել դրա որակը և կարգավորել այն։
1) Հիմնական հասկացությունները
Բնակչությունը ՝ օբյեկտների ռուսական հավաքածու (բոլոր օգտագործողները/նստաշրջանները/գործարքները)։
Նմուշառման շրջանակը (sampling frame) 'ցուցակ/մեխանիզմ, որից մենք իրականում վերցնում ենք (կարևոր է հայտնաբերել կոմպոզիցիաները և «անցքերը»)։
Ընտրության միավորը օգտագործողն է, նստաշրջանը, իրադարձությունը, գործարքը, սարքը։
Ներկայացուցչությունը 'ընտրության և բնակչության հիմնական նշանների բաշխման համընկնում (պատահական սխալի հետ)։
Պատահական vs-ը համակարգված սխալ է 'գնահատականների ցրումը ռուսական դեմ (bias)։
2) Սեմպիլացիայի տեսակները
2. 1 Հավանական (նախընտրելի)
SYS (պարզ պատահական) 'ընտրության հավասար հավանականությունը։
Ստրատիֆիկացված 'բնակչության կոտրումը կրքի վրա (երկիր/ջրանցք/պլատֆորմ), ապա SNS-ը կրքի ներսում գտնվում է ցրման ցածր և ավելի լավ ծածկույթ։
Կլաստեր 'խմբերի ընտրություն (օրեր/սերվերներ/խանութներ); էժան է, բայց ավելի բարձր է ներերակային հարաբերակցությունը։
Համակարգված 'յուրաքանչյուր k-րդ տարրը պատահական մեկնարկից հետո (պահանջվում է «ոչ գծային» տվյալներ)։
PPS (probability proportional to size), հավանականությունը հաստատվում է յունիտի չափին (օրինակ, ռուսական գործընկերոջ ծավալը)։
2. 2 Անհավատալի (զգուշությամբ)
Հարմարավետություն/կամավորներ 'արագ հարցումներ, լոգներ «կլիկացնող» ռիսկի ռիսկը։
Քվոտայի/ձյան կոմ 'օգտակար է նիշային խմբերում, բայց անհրաժեշտ է հաջորդ տրամաչափը։
3) Տեղահանման աղբյուրները
Ծածկույթը (coverage) 'բնակչության մի մասը բացակայում է շրջանակներում (օրինակ, iOS տվյալները արգելելիս)։
Ընտրության մեխանիզմը կապված է փոփոխականի ավելացման հետ (ակտիվները ավելի հաճախ ընկնում են)։
Nonresponse (nonresponse) 'ոչ վետերանները համակարգված տարբերվում են։
Գոյատևողները (survivorship) 'հեռու/արգելափակված։
Լեյբլ-2019 'աղմկոտ հյուրանոցներ, 71-պիտակներ, «ձեռքով»։
Աղվեսներ 'դեղորայքային ինֆայի օգտագործումը նմուշառման/ֆիչի ձևավորման ժամանակ։
4) Նմուշառման և հզորության չափը
4. 1 Մոտենալ
Մասնաբաժնի համար (p) ճշգրտությամբ (e) և վստահությամբ (1-91 ալֆա)
[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
Պահպանողականորեն վերցնում ենք (p = 0 + 5)։ Ուղղեք վերջնական բնակչությունը անհրաժեշտության դեպքում։
Միջին համար հայտնի է (108 sigma)
[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4. 2 Դիզայնի էֆեկտը և չափսը
Design Effect : /mathrm + Corf = 1 + (m-1) prho), որտեղ (m) - կոդավորման չափը, (/rho) - ներերակային հարաբերակցությունը։
Ստանդարտ չափսը: (n _ 105 + eff = n/108 mathrm + Systf +)։ Կլաստերային/կշռված դիզայնները հաճախ պահանջում են ավելի մեծ (n)։
4. 3 A/B և MDE
Երկնային մետրի համար սիմետրիկ խմբերում
[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
որտեղ (www.bar + p) հիմնական մակարդակն է, MDE-ը նվազագույն դետեկտիվ ազդեցություն է։
Հաշվի առեք սեզոնայնությունը և միջամտությունը (spillover), օգտագործեք CUPED/կովարիատները ցրման նվազեցման համար։
5) Քաշը և տրամաչափումը (մենք ընտրում ենք «նման» բնակչության)
Դիզայնի քաշը ՝ (w _ i = 1/pi _ i) (ընտրության հակառակը հավանականությունը)։
Post-strational և raking: Մենք կշռում ենք մարգինալին (երկիր/պլատֆորմ/կես տարիք և այլն) դեպի հայտնի բաժնետոմսեր։
Կալիբրացիա (calibration weighting), մենք նվազեցնում ենք քաշի շեղումը, երբ ճշգրիտ համընկնում ենք վերահսկողական տոտալների հետ։
Botstrap/վերարտադրողական 'քաշի ցրման ճիշտ գնահատումը։
Ախտորոշումը 'ESS (effective sample size), քաշի (CV, p95/p5), համեմատությունը մինչև/հետո հիմնական նշաններով։
6) Դասերի իմբալանսը և հազվագյուտ իրադարձությունները
Տարգետի ստրատիֆիկացված ընտրությունը 'oversample-ը հազվագյուտ դաս է, բայց միշտ օգտագործել շեմին/քաշը սովորելիս։
Cost-sultitive learning: կշռված լոսներ սինթիկայի փոխարեն։
SMOTE/ADASYN 'զգույշ' արտահոսքի/արտեֆակտների վտանգը։ պահպանեք խիստ ժամանակային/խմբակային համախմբումներ։
Գնահատականը ՝ PR-AUC, Recall @ FPR 24X; հավանականության տրամաչափություն։
7) Հոսքային և մեծ տվյալներ
Reservoir sampling: Մենք պահում ենք ներկայացուցչական ենթախումբ անհայտ երկարության հոսքից։
Իրադարձությունների Սեմփլինգը 'համամասնորեն հաճախականությամբ/կարևորությամբ։ հազվագյուտ բաների համար 'ձգողական խառնուրդներ։
Հաշվիչները և էսքիզները ՝ Bloom/Count-Min հաճախականության/եզակի համար։ Վերլուծաբանների համար 'ուղղեք պարբերական ճշգրիտ հաշվարկով։
De-dup և impotenty 'իրադարձությունների բանալիներ, dedupliation պատուհաններ։
8) Ժամանակավոր և տարածական ասպեկտները
Time-based sampling: ֆիքսված պատուհաններ (rolling), point-in-time ճիշտ։
Cluster/geo-sampling: կլաստերիզացիա հանգույցներով/տարածքներով; հաշվի առեք տարածական ինքնորոշումը։
Սեզոնայնությունը/ռիթմը 'շաբաթվա/օրվա/արձակուրդների ռեպրեսենտատիվ ծածկույթ։
9) Off-policy/logic տվյալները և քաուզալությունը
10) Ռեպրեսենտալիզմի ախտորոշումը
Մարգինալների համեմատությունը 'աղյուսակները, vs-ի բնակչությունը ընտրվում է հիմնական նշաններով։
Հավասարակշռությունը 'SMD (standardized mean defference), Love plots։
Խտություն/քվանալի ՝ KS թեստեր, quantile-plots, PSI։
Մոդելի սերտիֆիկացումը 'մոդելի կայունացումը out-of-time և out-of-domain հատվածներում։
ESS և քաշը 'ցածր ESS-ը ազդարարում է գնահատականների բարձր ցրման մասին։
11) Anti-patterna
«Samplim միայն ակտիվ երեկ» նշանակում է սառը/քնած կորուստ։
Կրճատել «միջին հատվածների» տոկոսները առանց քաշի։
Խառնել ագրեգացիայի մակարդակները (իրադարձություններ և օգտագործողներ) մեկ նմուշում։
Պատահական ընտրություն այն ֆիլտրերից հետո, որոնք կախված են target- ից (www.dw.co.ru)։
Cross-val-ը առանց խմբի/wwww.clits կախված տվյալների հետ։
Օգտագործել SMOTE-ը մինչև train/val (արտահոսք)։
12) Մասնավոր սցենարներ (քեյսներ)
Խաղացողների հետազոտությունը 'երկրի/պլատֆորմի/տարիքի ստրատիֆիկացիան։ POSTIFT-ստրատիֆիկացիա MAU մասնիկների համար; nonresponse-ի վերահսկումը։
Logs EDA-ի համար 'համակարգված 1: N semple + հազվագյուտ տեսակների ամբողջական ծածկույթ։
Ֆրոդ երեխա 'target-strational, cost-sultitive loss, PR-AUC և Recall @ FPR 24x տոկոսը։
A/B սահմանափակ օպտիկայով 'MDE հաշվարկը, երկարացումը համաձայն կանոնների, CUPED-ը։
Off-policy գնահատումը պրոմո ՝ IPS/DR, քաշի սահմանափակումով (trimming), աջակցության համընկնման ստուգում։
13) Արտեֆակտների օրինակները
Sempling պլանը (template)
Նպատակը/բնակչությունը '...
Նմուշառման շրջանակը ՝ աղբյուրներ, աղբյուրներ/անցքեր
Ընտրության միավորը 'օգտագործողը/նստաշրջան/իրադարձություն
Դիզայն 'կրքեր (country, platform),
Չափը (n) 'հաշվարկը, հաշվարկը (108, 108, MDE), Systef
Քաշի սխեման 'դիզայնի քաշը, փոփոստը (ստուգման տոտալներ)
Օրացույց ՝ օրվա/ժամ/արձակուրդների ծածկույթ
Որակը 'թեստեր, nonresponse պլան, շփման ընթացակարգեր
Ռիսկերը ՝ ընտրության, միջամտության, privacy/PII
Սեփականատերերը և վերահսկողությունը. Ո՞ վ է կարծում/պահում/տարբերակում
Կշռման անձնագիր (template)
Հիմնական քաշները ՝ (w _ i = 1/pi _ i)
Տրամաչափություն ՝ նպատակներ (country, platform, age), մեթոդ (raking), ընդունիր
Սահմանափակումներ ՝ trimming w no [w _ min, w _ max]
Ախտորոշումը 'ESS, CV (w), SMD մինչև/հետո
Օգտագործումը 'ինչ հաշվետվություններ/մոդելներ են օգտագործում քաշը
Տարբերակներ ՝ v1 71 v2, ամսաթիվը, սեփականատերերը
14) Գաղտնիությունը և էթիկան
Privacy by Design-ը 'դաշտերի նվազեցումը, ագրեգացիան, կեղծանունացումը։
Դիֆերենցիալ գաղտնիությունը 'randomization/subsempionation որպես մասնավոր (privacy amplifae)։
Արդարություն 'ստուգեք սխալների տարբերությունը/քաշը զգայուն օրինակների վրա։ թույլ մի տվեք խմբերի «անտեսանելիությունը»։
15) Չեկ թուղթ արձակելուց առաջ
- Նմուշառման շրջանակը նկարագրված է. բացահայտվել և մեկնաբանվել են «անցքեր» -ի կողմից։
- Ընտրվել է դիզայն (կրքեր/կլաստերներ), հաշվարկված (n), Nof, MDE), հաշվարկված (n), MDE, MDE, Md
- Դիզայնի քաշը և հաշվարկման պլանը (ստուգման տոտալները համաձայնեցված են)
- Որոշված են ժամանակավոր պատուհանները/սեզոնայնությունը; plan nonresponse
- Վալիդացիայի սպլիտները հաշվի են առնում ժամանակը/խումբը։ արտահոսք չկա
- Որակի մետրերը ՝ ESS, SMD, PSI, botstrap ընդմիջումներ
- Մոսկվան և տարբերակները; մուտքերը և privacy-ուրվագծերը ստուգված են
Mini-glossaria
Դելֆը 'շատ մարդ, ով ավելացնում է գնահատականների ցուցադրումը դիզայնի պատճառով։
ESS 'կշռելուց հետո նմուշառման միջին չափը։
IPS/DR 'off-policy/logic տվյալների համար կշռման մեթոդներ։
SMD 'միջին ստանդարտացված տարբերությունը (հավասարակշռությունը կովարիատ)։
Reservoir sampling-ը հոսքից պատահական սեմպլի պահպանումն է։
Արդյունքը
Ռեպրեսենտիվացիան ոչ թե «հաջողակ է սեմպլի հետ», այլ նախագծված գործընթաց 'ճիշտ շրջանակ, մտածված ընտրության դիզայն, բավարար չափսեր, կշռում և տրամաչափում, ազնիվ կոնտակտներ և խիստ ախտորոշում։ Նկարագրված գործերին հետևելով ՝ դուք նվազեցնում եք վճարումները, ավելացնում եզրակացությունների հանդուրժողականությունը և ստանում եք հուսալի լուծումներ ապրանքի, մարքեթինգի, ռիսկերի և ML-ի համար։