Samplash va reprezentativlik
Samplash va reprezentativlik
Samplash - bu o’lchash, tajriba o’tkazish va modellarni o’qitish uchun bir nechta kuzatishlarni tanlash. Reprezentativlik shuni anglatadiki, namunadagi xulosalar maqsadli populyatsiyaga nisbatan tizimli xatosiz kengaytiriladi. Quyida - tanlanmani qanday loyihalash, uning sifatini baholash va siljishlarni tuzatish.
1) Bazaviy tushunchalar
Populyatsiya: obʼektlar toʻplami (barcha foydalanuvchilar/sessiyalar/tranzaksiyalar).
Tanlov ramkasi (sampling frame): ro’yxat/mexanizm (qoplamalar va teshiklarni aniqlash muhimdir).
Tanlash birligi: foydalanuvchi, sessiya, hodisa, tranzaksiya, qurilma.
Reprezentativlik: tanlov va populyatsiyadagi asosiy belgilar taqsimotining mos kelishi (tasodifiy xatoga yo’l qo’yish bilan).
Tasodifiy vs tizimli xato: siljishga qarshi baholar dispersiyasi (bias).
2) Semplash turlari
2. 1 Ehtimollik (afzal)
SRS (oddiy tasodifiy): tanlash ehtimoli teng.
Stratifikatsiyalangan: populatsiyani stratalarga bo’lish (mamlakat/kanal/platforma), so’ngra SRS strat ichida → dispersiyadan past va yaxshiroq qoplash.
Klaster: guruhlarni tanlash (kunlar/serverlar/do’konlar); arzon, lekin yuqori ichki klaster korrelyatsiyasi.
Tizimli: har bir k-n element tasodifiy boshlangandan keyin («sinxron bo’lmagan» ma’lumotlar talab qilinadi).
PPS (probability proportional to size): unit oʻlchami ∝ ehtimollik (masalan, sherik trafigi hajmi).
2. 2 Aql bovar qilmaydigan (ehtiyotkorlik bilan)
Qulayliklar/ko’ngillilar: tezkor so’rovlar, «bosish» jurnallari → seleksiya siljishi xavfi.
Kvota/qor to’plami: nish guruhlarida foydali, ammo keyingi kalibrlash kerak.
3) Siljish manbalari
Qoplash (coverage): populyatsiyaning bir qismi ramkada mavjud emas (masalan, treking taqiqlanganda iOS ma’lumotlari).
Seleksiya: tanlash mexanizmi maqsadli o’zgaruvchiga bog’liq (faollar ko’proq tushadi).
Notoʻgʻri tanlov (nonresponse): javob bermaganlar tizimli ravishda farq qiladi.
Omon qolganlar (survivorship): ketganlarni/bloklanganlarni e’tiborsiz qoldirish.
Yorliq siljishlari: shovqinli belgilar, proksi yorliqlar, «qo’lda» tuzatishlar.
Liki: namunani shakllantirishda kelajakdagi axborotdan foydalanish.
4) Tanlov hajmi va quvvati
4. 1 Yaqinlashishlar
(e) va ishonch (1-\alpha) bilan (p) ulushi uchun:[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
Konservativ (p = 0 {.} 5). Agar kerak bo’lsa, oxirgi populyatsiyaga tuzatish kiriting.
Maʼlum boʻlgan oʻrta (\sigma) uchun:[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4. 2 Dizayn-effekt va samarali o’lcham
Design Effect: (\mathrm {Deff} = 1 + (m-1 )\rho), bu yerda (m) - klaster oʻlchami, (\rho) - klaster ichidagi korrelyatsiya.
Samarali hajmi: (n_\text{eff}=n/\mathrm{Deff}). Klaster/vaznli dizaynlar ko’pincha ko’proq narsani talab qiladi (n).
4. 3 A/B va MDE
Simmetrik guruhlardagi binar metrika uchun:[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
bu yerda (\bar {p}) - asosiy daraja, MDE - minimal aniqlanadigan effekt.
Mavsumiylik va interferentsiyani (spillover) hisobga oling, dispersiyani kamaytirish uchun CUPED/kovariatlarni qo’llang.
5) Og’irlik va kalibrlash (populatsiyaga «o’xshash» namunani tayyorlaymiz)
Dizayn-og’irlik: (w_i=1/\pi_i) (tanlashning teskari ehtimoli).
Post-stratifikatsiya va raking: o’lchangan marginallarni (mamlakat/platforma/yarim yosh va boshqalar) ma’lum ulushlarga moslashtiramiz.
Kalibrlash (calibration weighting): Nazorat totallariga aniq mos kelganda og’irlik og’irligini minimallashtiramiz.
Butstrep/replikatsiyalar: tarozida dispersiyalarni to’g "ri baholash.
Diagnostika: ESS (effective sample size), tarozilar tarqalishi (CV, p95/p5), asosiy belgilar bo’yicha solishtirish.
6) Sinflar imbalansi va noyob voqealar
Target bo’yicha tabaqalashtirilgan tanlov: oversample noyob sinf, lekin o’qitishda doimo chegara/og’irlikni tuzatishdan foydalaning.
Cost-sensitive learning: sintetika o’rniga tortilgan losslar.
SMOTE/ADASYN: ehtiyotkorlik bilan - sizib chiqish/artefaktlar xavfi; qattiq vaqtinchalik/guruh bo’linmalarini saqlang.
Baholash: PR-AUC, Recall @FPR ≤ x%; ehtimollarni kalibrlash.
7) Oqimli va katta ma’lumotlar
Reservoir sampling: nomaʼlum uzunlikdagi oqimdan reprezentativ yordamni ushlab turing.
Voqealar samplingi: chastota/ahamiyatiga mutanosib ravishda; kamyob uchun - trigger buferlar.
Hisoblagichlar va eskizlar: chastotalar/noyoblik uchun Bloom/Count-Min; tahlilchilar uchun - davriy aniq hisoblash bilan birlashtiring.
De-dup va idempotentlik: voqealar kalitlari, deduplikatsiya oynalari.
8) Vaqtinchalik va fazoviy jihatlar
Time-based sampling: oʻrnatilgan oynalar (rolling), point-in-time toʻgʻrilik.
Cluster/geo-sampling: uzellar/hududlar bo’yicha klasterlash; fazoviy avtokorrelyatsiyani hisobga oling.
Mavsumiylik/ritm: haftaning/kunlarning/bayramlarning reprezentativ qoplamasi.
9) Off-policy/logik ma’lumotlar va kauzallik
10) Reprezentativlik tashxisi
Marginallarni qiyoslash: jadvallar populyatsiyasi va asosiy belgilar boʻyicha tanlash.
Balans kovariati: SMD (standardized mean difference), Love plots.
Zichligi/kvantili: KS-testlar, quantile-plots, PSI.
Modelni attestatsiyadan o’tkazish: metriklarni out-of-time va out-of-domain kesimlarida barqarorlashtirish.
ESS va og’irlik: past ESS yuqori baholar dispersiyasini ko’rsatadi.
11) Anti-patternlar
«Samplim faqat faol kecha» → sovuq/uxlayotgan yo’qotish.
Foizlarni «segmentlar bo’yicha o’rtacha» vaznsiz o’rtacha qilish.
Bitta namunada agregatsiya darajalarini (hodisalar va foydalanuvchilar) aralashtirish.
Targetga bogʻliq filtrlardan keyin tasodifiy tanlash (selection on the outcome).
Bog’liq ma’lumotlarda guruh/vaqt splitlarisiz cross-val.
SMOTEni train/val ga boʻlgunga qadar qoʻllash.
12) Xususiy ssenariylar (keyslar)
Futbolchilar so’rovi: mamlakat/platforma/yosh bo’yicha tabaqalanish; MAU ulushlariga post-stratifikatsiya; siljishni nazorat qilish.
EDA uchun loglar: hodisalar jadvalini tizimli 1:N + noyob turlarni toʻliq qoplash.
Frod-detekt: target-stratifikatsiya, cost-sensitive losslar, PR-AUC va Recall bo’yicha baholash @FPR ≤ x%.
A/B cheklangan trafik: MDE hisoblash, power-qoidalar bo’yicha uzaytirish, CUPED.
Off-policy promo baholash: IPS/DR cheklangan og’irlik (trimming), qo’llab-quvvatlashni tekshirish.
13) Artefaktlar shablonlari
Semplash rejasi (template)
Maqsad/populyatsiya:...
Tanlov doirasi: manbalar, qoplamalar/teshiklar
Tanlash birligi: foydalanuvchi/sessiya/tadbir
Dizayn: stratlar (country, platform), ulushlar, tanlash usuli
Oʻlchami (n): hisoblash, farazlar (α, power, MDE), Deff
Og’irlik sxemasi: dizayn-og’irlik, post-stratifikatsiya (nazorat totallari)
Kalendar: kunlar/soatlar/bayramlar
Sifat: qoplama testlari, nonresponse-reja, aloqa tartib-taomillari
Xavflar: seleksiya, interferensiya, privacy/PII
Egalari va nazorati: kim sanaydi/saqlaydi/versiyalaydi
Tortish pasporti (template)
Asosiy vazn: (w_i=1/\pi_i)
Kalibrlash: maqsadlar (country, platform, age), usul (raking), chegaralar
Cheklovlar: trimming w ∈ [w_min, w_max]
Diagnostika: ESS, CV (w), SMD dan oldin/keyin
Foydalanish: qanday hisobotlar/modellar og’irlikni qo’llaydi
Versiyalar: v1 → v2, sana, egalari
14) Maxfiylik va axloq
Privacy by Design: maydonlarni, agregatsiyalarni, taxallusni minimallashtirish.
Differensial maxfiylik: maxfiylikni kuchaytirish sifatida randomizatsiya/subsempirlash (privacy amplification).
Adolat: nozik atributlar bo’yicha xato/og’irlik farqini tekshiring; guruhlarning «koʻrinmasligiga» yoʻl qoʻymang.
15) Ishga tushirishdan oldin chek-varaq
- Tanlov ramkasi tavsiflangan; qoplamaning «teshiklari» aniqlandi va hujjatlashtirildi
- Tanlangan dizayn (stratlar/klasterlar), hisoblab chiqilgan (n), Deff, MDE
- Dizayn vazni va kalibrlash rejasi sozlandi (nazorat totallari kelishilgan)
- Vaqtinchalik oynalar/mavsumiylik aniqlandi; nonresponse rejasi mavjud
- Validatsiya splitlari vaqt/guruhni hisobga oladi; hech qanday oqish
- Sifat metrikasi: ESS, SMD, PSI, butstrep oraliqlari
- Hujjatlar va versiyalar; kirish huquqi va privacy-konturlar tekshirildi
Mini-lugʻat
Deff: dizayn tufayli baholar dispersini oshiruvchi koʻpaytirgich.
ESS: tarozidan keyin samarali tanlash hajmi.
IPS/DR: off-policy/log uchun tortish usullari.
SMD: o’rtacha standartlashtirilgan farq (kovariat balansi).
Reservoir sampling: Tasodifiy samplni oqimda saqlash.
Jami
Reprezentativlik - bu «sampl bilan omadli» emas, balki loyihalashtirilgan jarayon: toʻgʻri ramka, puxta oʻylangan tanlov dizayni, yetarli oʻlcham, tortish va kalibrlash, halol splitlar va qatʼiy diagnostika. Ta’riflangan amaliyotlarga amal qilib, siz o’zgarishlarni kamaytirasiz, xulosalarning chidamliligini oshirasiz va mahsulot, marketing, xavf va ML uchun ishonchli echimlarga ega bo’lasiz.