Sampling e rappresentatività
Approssimazione e rappresentatività
Il sampling è la scelta di un sottoinsieme di osservazioni per misurare, sperimentare e imparare modelli. La rappresentatività significa che le conclusioni del campione vengono ridimensionate sulla popolazione di destinazione senza un errore sistematico. Di seguito, come progettare un campione, valutarne la qualità e modificare gli spostamenti.
1) Concetti di base
Popolazione: set di oggetti target (tutti gli utenti/sessioni/transazioni).
Cornice di campionamento (sampling frame) - L'elenco/meccanismo da cui si seleziona effettivamente (è importante individuare le coperture e i buchi).
Unità di selezione: utente, sessione, evento, transazione, dispositivo.
Rappresentatività: corrispondenza tra le distribuzioni dei segni chiave nel campione e nella popolazione (con un errore casuale).
Errore casuale vs sistematico: dispersione delle valutazioni contro l'offset (bias).
2) Tipi di sampling
2. 1 Probabili (preferiti)
SRS (semplice casuale): pari probabilità di selezione.
Stratificato: suddivisa la popolazione in strati (paese/canale/piattaforma), quindi SRS all'interno dello strato sotto la dispersione e migliore copertura.
Cluster: selezione dei gruppi (giorni/server/negozi) Economica, ma superiore alla correlazione intracamera.
Sistematico: ogni elemento K dopo una partenza accidentale (sono necessari dati «non incroni»).
PPS (probability proportional to size) - Possibilità di soddisfare le dimensioni delle unità (ad esempio, la quantità di traffico del partner).
2. 2 Incredibili (con cautela)
Convenienza/volontariato: sondaggi rapidi, loghi cliccati, rischio di spostamento selettivo.
Quota/neve: utile in gruppi di nicchia, ma serve una calibrazione successiva.
3) Sorgenti di offset
Rivestimento (coverage) - Parte della popolazione non è presente nella cornice (ad esempio, dati iOS in caso di interruzione del tracking).
Selezione - Il meccanismo di selezione è associato alla variabile di destinazione (quelli attivi sono più frequenti).
Non selettivo (nonresponse) - I non eletti sono sistematicamente diversi.
Sopravvissuti - Ignora i superstiti/bloccati.
Etichette rumorose, etichette proxy, regolazioni manuali.
Leek: utilizzo di informazioni future per la formazione del campione/fich.
4) Dimensione e potenza del campione
4. 1 Avvicinamenti
Per la quota (p) con precisione (e) e fiducia (1-\alpha):[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
Conservativo (p = 0 {.} 5). Regolate la popolazione finale se necessario.
Per media con nota (\sigma):[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4. 2 Effetto design e dimensioni efficienti
Design Effect: (\mathrm {Deff} = 1 + (m-1 )\rho), dove (m) è la dimensione del cluster e (\rho) la correlazione interna.
Quota effettiva: (n _\text {ff} = n/\mathrm {Deff}). Il design cluster/ponderato richiede spesso più (n).
4. 3 A/B e MDE
Per le metriche binarie in gruppi simmetrici:[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
dove (\bar {p}) è il livello di base, MDE è l'effetto minimo da rilevare.
Prendere in considerazione la stagionalità e l'interferenza (spillover), utilizzare CUPED/covariati per ridurre la dispersione.
5) Peso e calibrazione (facciamo un campione «simile» alla popolazione)
Peso di progettazione: (w _ i = 1/\pi _ i) (probabilità di selezione inversa).
Post-stratificazione e raking: adattiamo le marginali ponderate (paese/piattaforma/mezza età, ecc.) alle quote note.
Calibrazione (calibration weighting) - Consente di ridurre al minimo la deviazione dei pesi in corrispondenza esatta dei totali di controllo.
Bootstrap/replica: valutazione corretta della dispersione nella bilancia.
Diagnostica: ESS (effettiva sample size), bilanci (CV, p95/p5), confronto prima/dopo per i segni chiave.
6) Classe imbalanza e eventi rari
Selezione stratificata in base al target: oversample è una classe rara, ma usa sempre l'impostazione della soglia/bilancia durante l'apprendimento.
Cost-sensitive learning - Losse ponderate al posto della sintetica.
SMOTE/ADASYN: attenzione - rischio di fuoriuscite/manufatti; tenete stretti gli split temporali/di gruppo.
Valutazione PR-AUC, Recall@FPR≤x%; calibrare le probabilità.
7) Streaming e grandi dati
Reservoir sampling - Tratteniamo un sottoinsieme rappresentativo di un flusso di lunghezza sconosciuta.
Eventi di sampling: proporzionale alla frequenza/importanza; Per i rari, buffer a trigger.
Contatori e sketch: Bloom/Count-Min per frequenze/unicità; Per gli analisti, combinare con un calcolo di precisione periodico.
De-dup e idempotenza sono le chiavi degli eventi, le finestre di deduplicazione.
8) Aspetti temporali e spaziali
Time-based sampling - Le finestre fisse (rolling), point-in-time sono corrette.
Cluster/geo-sampling: clustering su nodi/regioni; tieni conto della correttura spaziale.
Stagionalità/ritmo - copertura rappresentativa ore/giorni della settimana/festività.
9) Off-policy/dati tana e causalità
10) Diagnostica di rappresentatività
Confronto tra marginalità: tabelle di popolazione vs campionamento secondo i segni chiave.
Bilanciamento covario: SMD (standardized mean difference), Love plots.
Densità/Quantili: test KS, quantile-plots, PSI.
Convalida modello - Stabilizza le metriche in taglio out-of-time e out-of-domain.
ESS e peso: il basso ESS indica un'elevata dispersione di voti.
11) Anti-pattern
«Samplim è attivo solo ieri».
Mediare le percentuali di «media dei segmenti» senza pesi.
Mescolare i livelli di aggregazione (eventi e utenti) in un singolo campione.
Selezione casuale dopo i filtri che dipendono dal target (selection on the outcome).
Cross-val senza split di gruppo/temporali per i dati dipendenti.
Applica SMOTE prima di dividere in treno/val (perdita).
12) Script privati (valigette)
Sondaggio dei giocatori: stratificazione per paese/piattaforma/età; post-strazione alle quote MAU; Controllo di offset nonresponse.
Loghi per EDA: sistematico 1: N sample eventi + copertura completa di tipi rari.
From-Dett: target-stratificazione, losse cost-sensitive, valutazione per PR-AUC e Recall@FPR≤x%.
A/B con traffico limitato: calcolo MDE, estensione con regole power, CUPED.
Off-policy valutazione promo: IPS/DR con vincolo di bilancia (trimming), controllo sovrapposizione dei supporti.
13) Modelli di manufatti
Piano di programmazione (template)
Obiettivo/popolazione:...
Cornice di campionamento: sorgenti, rivestimenti/buchi
Unità di selezione utente/sessione/evento
Design: strati (country, platform), quote, metodo di selezione
Dimensione (n) - Calcolo, presupposti (©, power, MDE), Deff
Schema di peso: peso, post-stratificazione (totali di controllo)
Calendario: copertura giorni/ore/festività
Qualità: test di copertura, piano nonresponse, procedure di contatto
Rischi: selezione, interferenza, privacy/PII
Proprietari e controllo: chi conta/conserva/versiona
Passaporto di pesatura (template)
Peso base: (w _ i = 1/\pi _ i)
Taratura: obiettivi (country, platform, age), metodo (raking), tolleranze
Vincoli: trimming w ∈ [w _ min, w _ max]
Diagnostica: ESS, CV (w), SMD prima/dopo
Utilizzo: quali report/modelli applicano il peso
Versioni: v1→v2, data, proprietari
14) Privacy ed etica
Privacy by Design: minimizza campi, aggregazioni, alias.
Privacy differenziale: randomizzazione/subassemblazione come aumento della privacy (privacy amplificazione).
Equità: verificare la differenza tra errori/pesi per attributi sensibili; Non permettere l'invisibilità dei gruppi.
15) Foglio di assegno prima dell'avvio
- La cornice di campionamento è descritta. rilevati e documentati «buchi» della copertura
- Design selezionato (strati/cluster), calcolato (n), Deff, MDE
- Personalizzato il peso del design e il piano di calibrazione (totali di controllo concordati)
- Definite le finestre temporali/stagionalità; c'è un piano per nonresponse
- Gli split di validazione contano il tempo/gruppo; Nessuna fuoriuscita
- Metriche di qualità: ESS, SMD, PSI, spaziatura di bottiglia
- Documentazione e versioni diritti di accesso e tracciati privati convalidati
Miniglossario
Deff è un moltiplicatore che aumenta la dispersione dei voti a causa del design.
ESS: dimensione efficiente del campione dopo la pesatura.
IPS/DR - Metodi di pesatura per i dati off-policy/tana.
SMD: differenza di media standardizzata (saldo covario).
Reservoir sampling - Mantenere un sample casuale dal flusso.
Totale
La rappresentatività non è «un buon sample», ma un processo progettato: cornice corretta, design di selezione elaborato, dimensioni sufficienti, pesatura e calibrazione, slit onesti e diagnosi rigorose. Seguendo le pratiche descritte, si riduce lo spostamento, si migliora la tollerabilità delle conclusioni e si ottengono soluzioni affidabili per il prodotto, il marketing, i rischi e ML.