Logo GH

Sampling e rappresentatività

Approssimazione e rappresentatività

Il sampling è la scelta di un sottoinsieme di osservazioni per misurare, sperimentare e imparare modelli. La rappresentatività significa che le conclusioni del campione vengono ridimensionate sulla popolazione di destinazione senza un errore sistematico. Di seguito, come progettare un campione, valutarne la qualità e modificare gli spostamenti.

1) Concetti di base

Popolazione: set di oggetti target (tutti gli utenti/sessioni/transazioni).
Cornice di campionamento (sampling frame) - L'elenco/meccanismo da cui si seleziona effettivamente (è importante individuare le coperture e i buchi).
Unità di selezione: utente, sessione, evento, transazione, dispositivo.
Rappresentatività: corrispondenza tra le distribuzioni dei segni chiave nel campione e nella popolazione (con un errore casuale).
Errore casuale vs sistematico: dispersione delle valutazioni contro l'offset (bias).

2) Tipi di sampling

2. 1 Probabili (preferiti)

SRS (semplice casuale): pari probabilità di selezione.
Stratificato: suddivisa la popolazione in strati (paese/canale/piattaforma), quindi SRS all'interno dello strato sotto la dispersione e migliore copertura.
Cluster: selezione dei gruppi (giorni/server/negozi) Economica, ma superiore alla correlazione intracamera.
Sistematico: ogni elemento K dopo una partenza accidentale (sono necessari dati «non incroni»).
PPS (probability proportional to size) - Possibilità di soddisfare le dimensioni delle unità (ad esempio, la quantità di traffico del partner).

2. 2 Incredibili (con cautela)

Convenienza/volontariato: sondaggi rapidi, loghi cliccati, rischio di spostamento selettivo.
Quota/neve: utile in gruppi di nicchia, ma serve una calibrazione successiva.

3) Sorgenti di offset

Rivestimento (coverage) - Parte della popolazione non è presente nella cornice (ad esempio, dati iOS in caso di interruzione del tracking).
Selezione - Il meccanismo di selezione è associato alla variabile di destinazione (quelli attivi sono più frequenti).
Non selettivo (nonresponse) - I non eletti sono sistematicamente diversi.
Sopravvissuti - Ignora i superstiti/bloccati.
Etichette rumorose, etichette proxy, regolazioni manuali.
Leek: utilizzo di informazioni future per la formazione del campione/fich.

4) Dimensione e potenza del campione

4. 1 Avvicinamenti

Per la quota (p) con precisione (e) e fiducia (1-\alpha):
[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]

Conservativo (p = 0 {.} 5). Regolate la popolazione finale se necessario.

Per media con nota (\sigma):
[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]

4. 2 Effetto design e dimensioni efficienti

Design Effect: (\mathrm {Deff} = 1 + (m-1 )\rho), dove (m) è la dimensione del cluster e (\rho) la correlazione interna.
Quota effettiva: (n _\text {ff} = n/\mathrm {Deff}). Il design cluster/ponderato richiede spesso più (n).

4. 3 A/B e MDE

Per le metriche binarie in gruppi simmetrici:
[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]

dove (\bar {p}) è il livello di base, MDE è l'effetto minimo da rilevare.
Prendere in considerazione la stagionalità e l'interferenza (spillover), utilizzare CUPED/covariati per ridurre la dispersione.

5) Peso e calibrazione (facciamo un campione «simile» alla popolazione)

Peso di progettazione: (w _ i = 1/\pi _ i) (probabilità di selezione inversa).
Post-stratificazione e raking: adattiamo le marginali ponderate (paese/piattaforma/mezza età, ecc.) alle quote note.
Calibrazione (calibration weighting) - Consente di ridurre al minimo la deviazione dei pesi in corrispondenza esatta dei totali di controllo.
Bootstrap/replica: valutazione corretta della dispersione nella bilancia.
Diagnostica: ESS (effettiva sample size), bilanci (CV, p95/p5), confronto prima/dopo per i segni chiave.

6) Classe imbalanza e eventi rari

Selezione stratificata in base al target: oversample è una classe rara, ma usa sempre l'impostazione della soglia/bilancia durante l'apprendimento.
Cost-sensitive learning - Losse ponderate al posto della sintetica.
SMOTE/ADASYN: attenzione - rischio di fuoriuscite/manufatti; tenete stretti gli split temporali/di gruppo.
Valutazione PR-AUC, Recall@FPR≤x%; calibrare le probabilità.

7) Streaming e grandi dati

Reservoir sampling - Tratteniamo un sottoinsieme rappresentativo di un flusso di lunghezza sconosciuta.
Eventi di sampling: proporzionale alla frequenza/importanza; Per i rari, buffer a trigger.
Contatori e sketch: Bloom/Count-Min per frequenze/unicità; Per gli analisti, combinare con un calcolo di precisione periodico.
De-dup e idempotenza sono le chiavi degli eventi, le finestre di deduplicazione.

8) Aspetti temporali e spaziali

Time-based sampling - Le finestre fisse (rolling), point-in-time sono corrette.
Cluster/geo-sampling: clustering su nodi/regioni; tieni conto della correttura spaziale.
Stagionalità/ritmo - copertura rappresentativa ore/giorni della settimana/festività.

9) Off-policy/dati tana e causalità

IPS (inverse propensity): (w_i=1/\pi(a_ix _ i)) per correggere i logg-sample con un nuovo criterio.
Valutazioni DR: Doppiy Robust per ridurre lo spostamento e la dispersione.
Trasportabilità: migrazione dei risultati tra i mercati/canali - Controlla la corrispondenza dei covariati (covariate shift).
Label maiusc: (P (y)) cambia quando stabile (P (x)y)); Usa l'EM/ricalibrazione.

10) Diagnostica di rappresentatività

Confronto tra marginalità: tabelle di popolazione vs campionamento secondo i segni chiave.
Bilanciamento covario: SMD (standardized mean difference), Love plots.
Densità/Quantili: test KS, quantile-plots, PSI.
Convalida modello - Stabilizza le metriche in taglio out-of-time e out-of-domain.
ESS e peso: il basso ESS indica un'elevata dispersione di voti.

11) Anti-pattern

«Samplim è attivo solo ieri».
Mediare le percentuali di «media dei segmenti» senza pesi.
Mescolare i livelli di aggregazione (eventi e utenti) in un singolo campione.
Selezione casuale dopo i filtri che dipendono dal target (selection on the outcome).
Cross-val senza split di gruppo/temporali per i dati dipendenti.
Applica SMOTE prima di dividere in treno/val (perdita).

12) Script privati (valigette)

Sondaggio dei giocatori: stratificazione per paese/piattaforma/età; post-strazione alle quote MAU; Controllo di offset nonresponse.
Loghi per EDA: sistematico 1: N sample eventi + copertura completa di tipi rari.
From-Dett: target-stratificazione, losse cost-sensitive, valutazione per PR-AUC e Recall@FPR≤x%.
A/B con traffico limitato: calcolo MDE, estensione con regole power, CUPED.
Off-policy valutazione promo: IPS/DR con vincolo di bilancia (trimming), controllo sovrapposizione dei supporti.

13) Modelli di manufatti

Piano di programmazione (template)

Obiettivo/popolazione:...

Cornice di campionamento: sorgenti, rivestimenti/buchi

Unità di selezione utente/sessione/evento

Design: strati (country, platform), quote, metodo di selezione

Dimensione (n) - Calcolo, presupposti (©, power, MDE), Deff

Schema di peso: peso, post-stratificazione (totali di controllo)

Calendario: copertura giorni/ore/festività

Qualità: test di copertura, piano nonresponse, procedure di contatto

Rischi: selezione, interferenza, privacy/PII

Proprietari e controllo: chi conta/conserva/versiona

Passaporto di pesatura (template)

Peso base: (w _ i = 1/\pi _ i)

Taratura: obiettivi (country, platform, age), metodo (raking), tolleranze

Vincoli: trimming w ∈ [w _ min, w _ max]

Diagnostica: ESS, CV (w), SMD prima/dopo

Utilizzo: quali report/modelli applicano il peso

Versioni: v1→v2, data, proprietari

14) Privacy ed etica

Privacy by Design: minimizza campi, aggregazioni, alias.
Privacy differenziale: randomizzazione/subassemblazione come aumento della privacy (privacy amplificazione).
Equità: verificare la differenza tra errori/pesi per attributi sensibili; Non permettere l'invisibilità dei gruppi.

15) Foglio di assegno prima dell'avvio

  • La cornice di campionamento è descritta. rilevati e documentati «buchi» della copertura
  • Design selezionato (strati/cluster), calcolato (n), Deff, MDE
  • Personalizzato il peso del design e il piano di calibrazione (totali di controllo concordati)
  • Definite le finestre temporali/stagionalità; c'è un piano per nonresponse
  • Gli split di validazione contano il tempo/gruppo; Nessuna fuoriuscita
  • Metriche di qualità: ESS, SMD, PSI, spaziatura di bottiglia
  • Documentazione e versioni diritti di accesso e tracciati privati convalidati

Miniglossario

Deff è un moltiplicatore che aumenta la dispersione dei voti a causa del design.
ESS: dimensione efficiente del campione dopo la pesatura.
IPS/DR - Metodi di pesatura per i dati off-policy/tana.
SMD: differenza di media standardizzata (saldo covario).
Reservoir sampling - Mantenere un sample casuale dal flusso.

Totale

La rappresentatività non è «un buon sample», ma un processo progettato: cornice corretta, design di selezione elaborato, dimensioni sufficienti, pesatura e calibrazione, slit onesti e diagnosi rigorose. Seguendo le pratiche descritte, si riduce lo spostamento, si migliora la tollerabilità delle conclusioni e si ottengono soluzioni affidabili per il prodotto, il marketing, i rischi e ML.

Contact

Mettiti in contatto

Scrivici per qualsiasi domanda o richiesta di supporto.Siamo sempre pronti ad aiutarti!

Telegram
@Gamble_GC
Avvia integrazione

L’Email è obbligatoria. Telegram o WhatsApp — opzionali.

Il tuo nome opzionale
Email opzionale
Oggetto opzionale
Messaggio opzionale
Telegram opzionale
@
Se indichi Telegram — ti risponderemo anche lì, oltre che via Email.
WhatsApp opzionale
Formato: +prefisso internazionale e numero (ad es. +39XXXXXXXXX).

Cliccando sul pulsante, acconsenti al trattamento dei dati.