Samplage et représentativité
Samplage et représentativité
Le samplage est le choix d'un sous-ensemble d'observations pour les mesures, les expériences et l'apprentissage des modèles. La représentativité signifie que les conclusions de l'échantillon sont mises à l'échelle de la population cible sans erreur systématique. Ci-dessous - comment concevoir un échantillon, évaluer sa qualité et corriger les décalages.
1) Concepts de base
Population : ensemble cible d'objets (tous les utilisateurs/sessions/transactions).
Cadre d'échantillonnage (sampling frame) : liste/mécanisme à partir duquel nous prélevons réellement (il est important d'identifier les revêtements et les « trous »).
Unité de sélection : utilisateur, session, événement, transaction, appareil.
Représentativité : coïncidence des distributions de caractères clés dans l'échantillon et dans la population (avec la tolérance d'erreur aléatoire).
Erreur systématique vs aléatoire : variance des estimations par rapport au biais (bias).
2) Types de sablage
2. 1 Probabilistes (préférés)
SRS (simple aléatoire) : probabilité égale de sélection.
Stratifié : Répartition de la population en strates (pays/canal/plate-forme), puis SRS à l'intérieur des strates → inférieure à la variance et meilleure couverture.
Cluster : sélection des groupes (jours/serveurs/magasins) ; bon marché, mais au-dessus de la corrélation intraclaster.
Systématique : chaque élément K après un démarrage aléatoire (des données « non synchronisées » sont requises).
PPS (probability provisional to size) : probabilité ∝ taille de l'unité (par exemple, volume de trafic du partenaire).
2. 2 Incroyable (avec prudence)
Commodités/bénévoles : des sondages rapides, des logs « cliquant » → le risque de biais de sélection.
Quota/boule de neige : utile dans les groupes de niche, mais un étalonnage ultérieur est nécessaire.
3) Sources de décalage
Couverture (coverage) : une partie de la population n'est pas dans le cadre (par exemple, les données iOS lorsque le suivi est interdit).
Sélection : le mécanisme de sélection est associé à la variable cible (les actifs sont plus susceptibles d'être pris).
Non-assemblage (nonresponse) : les survivants sont systématiquement différents.
Survivants (survivorship) : ignorer les survivants/bloqués.
Décalage de label : étiquettes bruyantes, étiquettes proxy, ajustements « manuels ».
Visage : utilisation de l'information future dans la formation de l'échantillon/fiche.
4) Taille et puissance de l'échantillon
4. 1 Approchements
Pour la fraction (p) avec précision (e) et confiance (1-\alpha) :[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
Nous prenons prudemment (p = 0 {.} 5). Ajuster la population finale si nécessaire.
Pour la moyenne connue (\sigma) :[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4. 2 Effet de conception et taille efficace
Design Effect : (\mathrm {Deff} = 1 + (m-1 )\rho), où (m) est la taille du cluster, (\rho) est la corrélation intracrânienne.
Taille effective : (n_\text{eff}=n/\mathrm{Deff}). Les modèles en grappe/pondérés nécessitent souvent plus (n).
4. 3 A/B et MDE
Pour la métrique binaire dans les groupes symétriques :[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
où (\bar {p}) est le niveau de base, MDE est l'effet détectable minimum.
Tenez compte de la saisonnalité et de l'interférence (spillover), appliquez CUPED/covariables pour réduire la dispersion.
5) Poids et étalonnage (nous faisons un échantillon « similaire » à la population)
Poids de conception : (w_i=1/\pi_i) (probabilité de sélection inverse).
Post-stratification et raking : ajuster les marginaux pondérés (pays/plateforme/sexe, etc.) aux parts connues.
Calibrage (calibration weighting) : minimisez l'écart des échelles en coïncidant exactement avec les totaux de contrôle.
Butstrap/réplication : estimation correcte des variances aux poids.
Diagnostic : ESS (effectif sample size), répartition des poids (CV, p95/p5), comparaison avant/après sur des caractéristiques clés.
6) Imbalance des classes et événements rares
Sélection stratifiée par ciblage : la classe oversample est rare, mais toujours utiliser un ajustement seuil/poids lors de l'apprentissage.
Cost-sensible learning : loss pondérés au lieu de synthétiques.
SMOTE/ADASYN : attention au risque de fuites/artefacts ; garder des séparations de temps/groupe strictes.
Estimation : PR-ASC, Recall@FPR≤x %; étalonnage des probabilités.
7) Streaming et Big Data
Sampling de réserve : nous tenons un sous-ensemble représentatif d'un flux de longueur inconnue.
Sampling d'événements : proportionnel à la fréquence/importance ; pour les rares, les tampons de déclenchement.
Compteurs et croquis : Bloom/Count-Min pour fréquences/unicité ; pour l'analyse - combiner avec un calcul périodique précis.
De-dup et idempotence : clés d'événements, fenêtres de déduplication.
8) Aspects temporels et spatiaux
Sampling basé sur le temps : fenêtres fixes (rolling), correct point-in-time.
Cluster/geo-sampling : clustering par nœud/région ; prendre en compte l'autocorrélation spatiale.
Saisonnalité/rythme : couverture représentative des heures/jours de la semaine/jours fériés.
9) Non-politique/données logiques et causalité
10) Diagnostic de représentativité
Comparaison des marginaux : tableau population vs échantillon par caractéristiques clés.
Équilibre covariable : SMD (standard mean difference), Love plots.
Densité/quantifié : KS-tests, quantile-plots, PSI.
Évaluation du modèle : stabilisation des métriques sur les tranches out-of-time et out-of-domain.
ESS et poids : un ESS bas signale une forte variance des estimations.
11) Anti-modèles
« Samplim seulement actif hier » → la perte de froid/dormant.
Calculer la moyenne des pourcentages « moyenne par segment » sans pondération.
Mélanger les niveaux d'agrégation (événements et utilisateurs) dans une seule sélection.
Sélection aléatoire après filtres dépendant du ciblage (sélection sur l'outcome).
Cross-val sans split de groupe/temps dans les données dépendantes.
Appliquez SMOTE jusqu'à ce qu'il soit divisé en train/val (fuite).
12) Scénarios privés (cas)
Sondage auprès des joueurs : stratification par pays/plateforme/âge ; Post-stratification aux parts du MAU ; contrôle du déplacement nonresponse.
Logs pour EDA : 1:N systématique des événements sample + couverture complète des types rares.
Frod detect : ciblage-stratification, cost-sensible loss, évaluation par PR-AUC et Recall@FPR≤x %.
A/B avec trafic limité : calcul MDE, extension selon les règles de puissance, CUPED.
Évaluation de la promo hors politique : IPS/DR avec limitation de poids (trimming), vérification du recouvrement des supports.
13) Modèles d'artefacts
Plan de samplage (template)
Objectif/population :...
Cadre d'échantillonnage : sources, couvertures/trous
Unité de sélection : utilisateur/session/événement
Design : strats (country, platform), parts, méthode de sélection
Taille (n) : calcul, hypothèses (α, puissance, MDE), Deff
Schéma de poids : poids de conception, post-stratification (totaux de contrôle)
Calendrier : couverture des jours/heures/jours fériés
Qualité : tests de revêtement, plan nonresponse, procédures de contact
Risques : sélection, interférence, privacy/PII
Propriétaires et contrôles : qui compte/stocke/versionne
Passeport de pesée (template)
Poids de base : (w_i=1/\pi_i)
Étalonnage : cibles (country, platform, age), méthode (raking), tolérances
Restrictions : trimming w ∈ [w_min, w_max]
Diagnostic : ESS, CV (w), SMD avant/après
Utilisation : quels rapports/modèles appliquent les poids
Versions : v1→v2, date, propriétaires
14) Vie privée et éthique
Privacy by Design : minimisation des champs, agrégation, pseudonyme.
Vie privée différentielle : randomisation/sous-amplification comme renforcement de la vie privée (amplification de la vie privée).
Équité : vérifier la différence entre les erreurs et les poids selon les attributs sensibles ; ne tolérez pas l'invisibilité des groupes.
15) Chèque avant le lancement
- Le cadre d'échantillonnage est décrit ; les « trous » du revêtement identifiés et documentés
- Conception sélectionnée (strates/clusters), calculée par (n), Deff, MDE
- Les poids de conception et le plan d'étalonnage sont personnalisés (total de contrôle convenu)
- Les fenêtres temporelles/saisonnières ont été définies ; il y a un plan par nonresponse
- Les split de validation tiennent compte du temps/des groupes ; pas de fuites
- Métriques de qualité : ESS, SMD, PSI, intervalles de butstrap
- Documentation et versions ; droits d'accès et contours de confidentialité vérifiés
Mini-glossaire
Deff : multiplicateur qui augmente la variance des notes en raison de la conception.
SSE : taille effective de l'échantillon après pondération.
IPS/DR : méthodes de pondération pour les données off-policy/logiques.
SMD : différence normalisée des moyennes (bilan covariable).
Reservoir sampling : maintenir un sample aléatoire hors du flux.
Résultat
La représentativité n'est pas une « chance avec un sample », mais un processus conçu : un cadre correct, une conception de sélection réfléchie, une taille suffisante, un pesage et un calibrage, un split honnête et un diagnostic strict. En suivant les pratiques décrites, vous réduisez le décalage, augmentez la portabilité des résultats et obtenez des solutions fiables pour le produit, le marketing, les risques et le ML.