Eșantionarea și reprezentativitatea
Eșantionare și reprezentativitate
Eșantionarea este selecția unui subset de observații pentru măsurători, experimente și antrenamente de model. Reprezentativitatea înseamnă că concluziile eșantionului sunt scalate către populația țintă fără părtinire. Mai jos este cum să proiectați un eșantion, să evaluați calitatea acestuia și să corectați compensările.
1) Concepte de bază
Populație: set țintă de obiecte (toți utilizatorii/sesiuni/tranzacții).
Cadru de eșantionare: listă/mecanism din care selectăm de fapt (este important să identificăm acoperiri și „găuri”).
Unitatea de selecție: utilizator, sesiune, eveniment, tranzacție, dispozitiv.
Reprezentativitate: potrivirea distribuțiilor de atribute cheie în eșantion și populație (cu toleranță aleatorie la erori).
Aleatoriu vs părtinire: variația estimărilor față de părtinire (părtinire).
2) Tipuri de eșantionare
2. 1 Probabilistic (preferat)
SRS (simplu aleatoriu): probabilitate egală de selecție.
Stratificat: populație stratificată (țară/canal/platformă), apoi SRS în straturi → variație mai mică și o acoperire mai bună.
Cluster: selectarea grupurilor (zile/servere/magazine); corelație intracluster ieftin, dar mai mare.
Sistematic: fiecare element kth după o pornire aleatorie (date „asincrone” necesare).
PPS (probabilitate proporțională cu dimensiunea) - probabilitatea ∝ mărimea unității (de exemplu, volumul traficului partener).
2. 2 Incredibil (cu prudență)
Dotări/voluntari: sondaje rapide, jurnale „clic” → riscul de părtinire a selecției.
Cota/bulgăre de zăpadă: util în grupuri de nișă, dar calibrarea ulterioară este necesară.
3) Surse de deplasare
Acoperire: o parte din populație nu este în cadru (de exemplu, datele iOS atunci când urmărirea este interzisă).
Selecție: mecanismul de selecție este asociat cu variabila țintă (activă mai des se încadrează).
Nonresponse: Cei care nu răspund sunt sistematic diferiți.
Supravieţuitori: Ignorarea celor plecaţi/blocaţi.
Etichetă offset: etichete zgomotoase, etichete proxy, ajustări „manuale”.
Fețe: utilizarea informațiilor viitoare în formarea eșantionului/caracteristicii.
4) Dimensiunea și puterea eșantionului
4. 1 Aproximări
Pentru fracție (p) cu precizie (e) și încredere (1-\alfa):[
n\approx\frac {z _ {\alpha/2} ^ 2, p (1-p)} {e ^ 2}
]
Luăm conservativ (p = 0 {.} 5). Ajustaţi pentru populaţia finală, dacă este necesar.
Pentru mediu cu cunoscut (\sigma):[
n\approx\left (\frac {z _ {\alpha/2} ,\sigma} {e }\right) ^ 2
]
4. 2 Efect de proiectare și dimensiune eficientă
Efect de proiectare: (\mathrm {Deff} = 1 + (m-1 )\rho), unde (m) este dimensiunea clusterului, (\rho) este corelația intra-cluster.
Dimensiune efectivă: (n_\text{eff}=n/\mathrm{Deff}). Desenele cu cluster/ponderate necesită adesea mai mult (n).
4. 3 A/B și MDE
Pentru o metrică binară cu grupuri simetrice:[
n_{\text{на группу }\approx\frac {2 (z_{1-\alpha/2}+z_{1-\beta}) ^ 2 ,\bar {p} (1-\bar {p})} {\mathrm {MDE} ^ 2}
]
unde (\bar {p}) este nivelul de bază, MDE este efectul minim detectabil.
Luați în considerare sezonalitatea și interferențele (spillover), aplicați CUPED/covariate pentru a reduce varianța.
5) Greutăți și calibrare (eșantionăm „similar” cu populația)
Greutăți de proiectare: (w_i=1/\pi_i) (probabilitatea inversă de selecție).
Post-stratificare și greblare: ajustăm marginalul ponderat (țara/platforma/vârsta de gen etc.) la fracțiile cunoscute.
Ponderarea calibrării: minimizați abaterea greutăților atunci când coincideți exact cu totalurile de control.
Bootstrap/replicare: estimarea corectă a varianțelor la greutăți.
Diagnostic: SSE (dimensiunea efectivă a eșantionului), răspândirea greutății (CV, p95/p5), înainte/după compararea prin caracteristici cheie.
6) Dezechilibru de clasă și evenimente rare
Selectarea stratificată după țintă: overspample este o clasă rară, dar utilizați întotdeauna ajustarea pragului/greutății în formare.
Învățarea sensibilă la costuri: pierderi ponderate în loc de sintetice.
SMOTE/ADASYN: prudență - risc de scurgeri/artefacte; păstra strict timp/divizare grup.
Rating: PR-ASC, Recall@FPR≤x%; probabilitatea de calibrare.
7) Streaming și Big Data
Eșantionarea rezervorului: Țineți un subset reprezentativ dintr-un flux de lungime necunoscută.
Eșantionarea evenimentelor: proporțională cu frecvența/importanța; pentru rare - tampoane de declanșare.
Contoare și schițe: Bloom/Count-Min pentru frecvențe/unicitate; pentru analiză - combinați cu numărarea periodică precisă.
De-dup și idempotency - chei de evenimente, ferestre de eliminare a duplicatelor.
8) Aspecte temporale și spațiale
Eșantionare pe bază de timp: ferestre fixe (rulare), corectitudine punctuală.
Cluster/geo-eșantionare: clustering pe nod/regiune; ia în considerare autocorelarea spațială.
Sezonalitate/ritm: acoperire reprezentativă a orelor/zilelor săptămânii/sărbătorilor.
9) Off-policy/log date și cauzalitate
10) Diagnosticarea reprezentativității
Comparație marginală: populația tabelelor vs eșantion după atribute cheie.
Balanța covariatelor: SMD (diferență medie standardizată), parcele de dragoste.
Densități/cantități: teste KS, cantități-parcele, PSI.
Model de calificare: stabilizarea metricii pe felii out-of-time și out-of-domain.
ESS și greutăți: SSE scăzut semnalează o variație ridicată a scorurilor.
11) Anti-modele
„Eșantion activ numai ieri” → pierderea de frig/somnifere.
Procentele medii „segment mediu” fără greutăți.
Se amestecă nivelurile de agregare (evenimente și utilizatori) într-un singur eșantion.
Selecție aleatorie după filtre dependente de țintă (selecție pe rezultat).
Cross-val fără grupă/timp se împarte cu date dependente.
Se aplică SMOTE înainte de tren/val (scurgere).
12) Scenarii private (cazuri)
Sondaj jucător: stratificat după țară/platformă/vârstă; post-stratificare la acțiunile MAU; nonresponse offset control.
Jurnale pentru EDA: eșantion sistematic de evenimente 1:N + acoperire completă de tipuri rare.
Detectarea fraudei: stratificare țintă, pierdere sensibilă la costuri, scor PR-ASC și Recall@FPR≤x%.
A/B cu trafic restricționat: calcul MDE, reînnoire a regulilor de putere, CUPED.
Evaluarea off-policy promo: IPS/DR cu limitarea greutății (tunderea), verificarea suprapunerii suportului.
13) Modele artefact
Plan de eșantionare (șablon)
Țintă/Populație:...
Caseta de eșantionare: surse, huse/găuri
Unitatea de selecție: utilizator/sesiune/eveniment
Design: straturi (tara, platforma), actiuni, metoda de selectie
Dimensiune (n): calcule, ipoteze (α, putere, MDE), Deff
Schema de greutate: greutăți de proiectare, post-stratificare (totaluri de control)
Calendar: acoperire zi/oră/vacanță
Calitate: teste de acoperire, plan de nonresponse, proceduri de contact
Riscuri: selecție, interferență, confidențialitate/PII
Proprietari și control: cine numără/stochează/versiuni
Pașaport de cântărire (șablon)
Greutăți de bază: (w_i=1/\pi_i)
Calibrare: obiective (țară, platformă, vârstă), metodă (greblare), toleranțe
Restricții: tăierea w ∈ [w_min, w_max]
Diagnostic: SSE, CV (w), SMD înainte/după
Utilizare: ce rapoarte/modele se aplică greutăți
Versiuni: v1→v2, data, proprietarii
14) Confidențialitate și etică
Confidențialitate prin Design: minimizarea câmpului, agregare, pseudonimizare.
Confidențialitate diferențială: randomizare/subsamplificare ca amplificare a confidențialității.
Corectitudine: Verificați diferența de eroare/greutate față de atributele sensibile; nu permite grupurilor să fie „invizibile”.
15) Lista de verificare înainte de începere
- Caseta de eșantionare este descrisă; găuri de acoperire identificate și documentate
- Design selectat (straturi/clustere), calculat (n), Deff, MDE
- Configurați greutăți de proiectare și planul de calibrare (totalurile de control convenite)
- Ferestre de timp/sezonalitate definite; există un plan de nonresponse
- Împărțirile de validare iau în considerare timpul/grupurile; fără scurgeri
- Valori de calitate: ESS, SMD, PSI, intervale de bootstrap
- Documentație și versiuni; drepturile de acces și contururile de confidențialitate verificate
Mini Glosar
Deff: multiplicator variație în creștere a scorurilor datorită designului.
ESS: dimensiunea efectivă a eșantionului după cântărire.
IPS/DR: metode de ponderare pentru datele off-policy/log.
SMD: diferență medie standardizată (echilibru covariabil).
Eșantionarea rezervorului: menținerea unei probe aleatorii din flux.
Total
Reprezentativitatea nu este „norocoasă cu eșantionul”, ci un proces proiectat: un cadru corect, un design de selecție atent, o dimensiune suficientă, cântărire și calibrare, scindări oneste și diagnostic riguros. Urmând practicile descrise, reduceți prejudecățile, creșteți portabilitatea concluziilor și obțineți soluții fiabile pentru produs, marketing, risc și ML.