Logo GH

Samplash va reprezentativlik

Samplash va reprezentativlik

Samplash - bu o’lchash, tajriba o’tkazish va modellarni o’qitish uchun bir nechta kuzatishlarni tanlash. Reprezentativlik shuni anglatadiki, namunadagi xulosalar maqsadli populyatsiyaga nisbatan tizimli xatosiz kengaytiriladi. Quyida - tanlanmani qanday loyihalash, uning sifatini baholash va siljishlarni tuzatish.

1) Bazaviy tushunchalar

Populyatsiya: obʼektlar toʻplami (barcha foydalanuvchilar/sessiyalar/tranzaksiyalar).
Tanlov ramkasi (sampling frame): ro’yxat/mexanizm (qoplamalar va teshiklarni aniqlash muhimdir).
Tanlash birligi: foydalanuvchi, sessiya, hodisa, tranzaksiya, qurilma.
Reprezentativlik: tanlov va populyatsiyadagi asosiy belgilar taqsimotining mos kelishi (tasodifiy xatoga yo’l qo’yish bilan).
Tasodifiy vs tizimli xato: siljishga qarshi baholar dispersiyasi (bias).

2) Semplash turlari

2. 1 Ehtimollik (afzal)

SRS (oddiy tasodifiy): tanlash ehtimoli teng.
Stratifikatsiyalangan: populatsiyani stratalarga bo’lish (mamlakat/kanal/platforma), so’ngra SRS strat ichida → dispersiyadan past va yaxshiroq qoplash.
Klaster: guruhlarni tanlash (kunlar/serverlar/do’konlar); arzon, lekin yuqori ichki klaster korrelyatsiyasi.
Tizimli: har bir k-n element tasodifiy boshlangandan keyin («sinxron bo’lmagan» ma’lumotlar talab qilinadi).
PPS (probability proportional to size): unit oʻlchami ∝ ehtimollik (masalan, sherik trafigi hajmi).

2. 2 Aql bovar qilmaydigan (ehtiyotkorlik bilan)

Qulayliklar/ko’ngillilar: tezkor so’rovlar, «bosish» jurnallari → seleksiya siljishi xavfi.
Kvota/qor to’plami: nish guruhlarida foydali, ammo keyingi kalibrlash kerak.

3) Siljish manbalari

Qoplash (coverage): populyatsiyaning bir qismi ramkada mavjud emas (masalan, treking taqiqlanganda iOS ma’lumotlari).
Seleksiya: tanlash mexanizmi maqsadli o’zgaruvchiga bog’liq (faollar ko’proq tushadi).
Notoʻgʻri tanlov (nonresponse): javob bermaganlar tizimli ravishda farq qiladi.
Omon qolganlar (survivorship): ketganlarni/bloklanganlarni e’tiborsiz qoldirish.
Yorliq siljishlari: shovqinli belgilar, proksi yorliqlar, «qo’lda» tuzatishlar.
Liki: namunani shakllantirishda kelajakdagi axborotdan foydalanish.

4) Tanlov hajmi va quvvati

4. 1 Yaqinlashishlar

(e) va ishonch (1-\alpha) bilan (p) ulushi uchun:
[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]

Konservativ (p = 0 {.} 5). Agar kerak bo’lsa, oxirgi populyatsiyaga tuzatish kiriting.

Maʼlum boʻlgan oʻrta (\sigma) uchun:
[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]

4. 2 Dizayn-effekt va samarali o’lcham

Design Effect: (\mathrm {Deff} = 1 + (m-1 )\rho), bu yerda (m) - klaster oʻlchami, (\rho) - klaster ichidagi korrelyatsiya.
Samarali hajmi: (n_\text{eff}=n/\mathrm{Deff}). Klaster/vaznli dizaynlar ko’pincha ko’proq narsani talab qiladi (n).

4. 3 A/B va MDE

Simmetrik guruhlardagi binar metrika uchun:
[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]

bu yerda (\bar {p}) - asosiy daraja, MDE - minimal aniqlanadigan effekt.
Mavsumiylik va interferentsiyani (spillover) hisobga oling, dispersiyani kamaytirish uchun CUPED/kovariatlarni qo’llang.

5) Og’irlik va kalibrlash (populatsiyaga «o’xshash» namunani tayyorlaymiz)

Dizayn-og’irlik: (w_i=1/\pi_i) (tanlashning teskari ehtimoli).
Post-stratifikatsiya va raking: o’lchangan marginallarni (mamlakat/platforma/yarim yosh va boshqalar) ma’lum ulushlarga moslashtiramiz.
Kalibrlash (calibration weighting): Nazorat totallariga aniq mos kelganda og’irlik og’irligini minimallashtiramiz.
Butstrep/replikatsiyalar: tarozida dispersiyalarni to’g "ri baholash.
Diagnostika: ESS (effective sample size), tarozilar tarqalishi (CV, p95/p5), asosiy belgilar bo’yicha solishtirish.

6) Sinflar imbalansi va noyob voqealar

Target bo’yicha tabaqalashtirilgan tanlov: oversample noyob sinf, lekin o’qitishda doimo chegara/og’irlikni tuzatishdan foydalaning.
Cost-sensitive learning: sintetika o’rniga tortilgan losslar.
SMOTE/ADASYN: ehtiyotkorlik bilan - sizib chiqish/artefaktlar xavfi; qattiq vaqtinchalik/guruh bo’linmalarini saqlang.
Baholash: PR-AUC, Recall @FPR ≤ x%; ehtimollarni kalibrlash.

7) Oqimli va katta ma’lumotlar

Reservoir sampling: nomaʼlum uzunlikdagi oqimdan reprezentativ yordamni ushlab turing.
Voqealar samplingi: chastota/ahamiyatiga mutanosib ravishda; kamyob uchun - trigger buferlar.
Hisoblagichlar va eskizlar: chastotalar/noyoblik uchun Bloom/Count-Min; tahlilchilar uchun - davriy aniq hisoblash bilan birlashtiring.
De-dup va idempotentlik: voqealar kalitlari, deduplikatsiya oynalari.

8) Vaqtinchalik va fazoviy jihatlar

Time-based sampling: oʻrnatilgan oynalar (rolling), point-in-time toʻgʻrilik.
Cluster/geo-sampling: uzellar/hududlar bo’yicha klasterlash; fazoviy avtokorrelyatsiyani hisobga oling.
Mavsumiylik/ritm: haftaning/kunlarning/bayramlarning reprezentativ qoplamasi.

9) Off-policy/logik ma’lumotlar va kauzallik

IPS (inverse propensity): (w_i=1/\pi(a_ix_i)) log-sampllarni yangi siyosatga tuzatish uchun.
DR-baholar: Doubly Robust siljish va dispersiyani kamaytirish uchun.
Tashish qobiliyati: natijalarni bozorlar/kanallar o’rtasida ko’chirish - kovariatning (covariate shift) mos kelishini tekshiring.
Label shift: (P (y)) barqaror (P (xy)); EM/qayta kalibrlashdan foydalaning.

10) Reprezentativlik tashxisi

Marginallarni qiyoslash: jadvallar populyatsiyasi va asosiy belgilar boʻyicha tanlash.
Balans kovariati: SMD (standardized mean difference), Love plots.
Zichligi/kvantili: KS-testlar, quantile-plots, PSI.
Modelni attestatsiyadan o’tkazish: metriklarni out-of-time va out-of-domain kesimlarida barqarorlashtirish.
ESS va og’irlik: past ESS yuqori baholar dispersiyasini ko’rsatadi.

11) Anti-patternlar

«Samplim faqat faol kecha» → sovuq/uxlayotgan yo’qotish.
Foizlarni «segmentlar bo’yicha o’rtacha» vaznsiz o’rtacha qilish.
Bitta namunada agregatsiya darajalarini (hodisalar va foydalanuvchilar) aralashtirish.
Targetga bogʻliq filtrlardan keyin tasodifiy tanlash (selection on the outcome).
Bog’liq ma’lumotlarda guruh/vaqt splitlarisiz cross-val.
SMOTEni train/val ga boʻlgunga qadar qoʻllash.

12) Xususiy ssenariylar (keyslar)

Futbolchilar so’rovi: mamlakat/platforma/yosh bo’yicha tabaqalanish; MAU ulushlariga post-stratifikatsiya; siljishni nazorat qilish.
EDA uchun loglar: hodisalar jadvalini tizimli 1:N + noyob turlarni toʻliq qoplash.
Frod-detekt: target-stratifikatsiya, cost-sensitive losslar, PR-AUC va Recall bo’yicha baholash @FPR ≤ x%.
A/B cheklangan trafik: MDE hisoblash, power-qoidalar bo’yicha uzaytirish, CUPED.
Off-policy promo baholash: IPS/DR cheklangan og’irlik (trimming), qo’llab-quvvatlashni tekshirish.

13) Artefaktlar shablonlari

Semplash rejasi (template)

Maqsad/populyatsiya:...

Tanlov doirasi: manbalar, qoplamalar/teshiklar

Tanlash birligi: foydalanuvchi/sessiya/tadbir

Dizayn: stratlar (country, platform), ulushlar, tanlash usuli

Oʻlchami (n): hisoblash, farazlar (α, power, MDE), Deff

Og’irlik sxemasi: dizayn-og’irlik, post-stratifikatsiya (nazorat totallari)

Kalendar: kunlar/soatlar/bayramlar

Sifat: qoplama testlari, nonresponse-reja, aloqa tartib-taomillari

Xavflar: seleksiya, interferensiya, privacy/PII

Egalari va nazorati: kim sanaydi/saqlaydi/versiyalaydi

Tortish pasporti (template)

Asosiy vazn: (w_i=1/\pi_i)

Kalibrlash: maqsadlar (country, platform, age), usul (raking), chegaralar

Cheklovlar: trimming w ∈ [w_min, w_max]

Diagnostika: ESS, CV (w), SMD dan oldin/keyin

Foydalanish: qanday hisobotlar/modellar og’irlikni qo’llaydi

Versiyalar: v1 → v2, sana, egalari

14) Maxfiylik va axloq

Privacy by Design: maydonlarni, agregatsiyalarni, taxallusni minimallashtirish.
Differensial maxfiylik: maxfiylikni kuchaytirish sifatida randomizatsiya/subsempirlash (privacy amplification).
Adolat: nozik atributlar bo’yicha xato/og’irlik farqini tekshiring; guruhlarning «koʻrinmasligiga» yoʻl qoʻymang.

15) Ishga tushirishdan oldin chek-varaq

  • Tanlov ramkasi tavsiflangan; qoplamaning «teshiklari» aniqlandi va hujjatlashtirildi
  • Tanlangan dizayn (stratlar/klasterlar), hisoblab chiqilgan (n), Deff, MDE
  • Dizayn vazni va kalibrlash rejasi sozlandi (nazorat totallari kelishilgan)
  • Vaqtinchalik oynalar/mavsumiylik aniqlandi; nonresponse rejasi mavjud
  • Validatsiya splitlari vaqt/guruhni hisobga oladi; hech qanday oqish
  • Sifat metrikasi: ESS, SMD, PSI, butstrep oraliqlari
  • Hujjatlar va versiyalar; kirish huquqi va privacy-konturlar tekshirildi

Mini-lugʻat

Deff: dizayn tufayli baholar dispersini oshiruvchi koʻpaytirgich.
ESS: tarozidan keyin samarali tanlash hajmi.
IPS/DR: off-policy/log uchun tortish usullari.
SMD: o’rtacha standartlashtirilgan farq (kovariat balansi).
Reservoir sampling: Tasodifiy samplni oqimda saqlash.

Jami

Reprezentativlik - bu «sampl bilan omadli» emas, balki loyihalashtirilgan jarayon: toʻgʻri ramka, puxta oʻylangan tanlov dizayni, yetarli oʻlcham, tortish va kalibrlash, halol splitlar va qatʼiy diagnostika. Ta’riflangan amaliyotlarga amal qilib, siz o’zgarishlarni kamaytirasiz, xulosalarning chidamliligini oshirasiz va mahsulot, marketing, xavf va ML uchun ishonchli echimlarga ega bo’lasiz.

Contact

Biz bilan bog‘laning

Har qanday savol yoki yordam bo‘yicha bizga murojaat qiling.Doimo yordam berishga tayyormiz.

Telegram
@Gamble_GC
Integratsiyani boshlash

Email — majburiy. Telegram yoki WhatsApp — ixtiyoriy.

Ismingiz ixtiyoriy
Email ixtiyoriy
Mavzu ixtiyoriy
Xabar ixtiyoriy
Telegram ixtiyoriy
@
Agar Telegram qoldirilgan bo‘lsa — javob Email bilan birga o‘sha yerga ham yuboriladi.
WhatsApp ixtiyoriy
Format: mamlakat kodi va raqam (masalan, +998XXXXXXXX).

Yuborish orqali ma'lumotlaringiz qayta ishlanishiga rozilik bildirasiz.