Sampling y representatividad
Sampling y representatividad
El sampling es la elección de un subconjunto de observaciones para medir, experimentar y enseñar modelos. La representatividad significa que los hallazgos de la muestra se escalan en la población objetivo sin un error sistemático. A continuación, cómo diseñar una muestra, evaluar su calidad y ajustar los desplazamientos.
1) Conceptos básicos
Población: conjunto de objetos de destino (todos los usuarios/sesiones/transacciones).
Marco de muestreo (sampling frame): lista/mecanismo del que realmente seleccionamos (es importante identificar los recubrimientos y «agujeros»).
Unidad de selección: usuario, sesión, evento, transacción, dispositivo.
Representatividad: coincidencia de distribuciones de rasgos clave en la muestra y la población (con error aleatorio).
Error sistemático aleatorio vs: varianza de las puntuaciones contra desplazamiento (bias).
2) Tipos de sampling
2. 1 Probabilística (preferida)
SRS (simple aleatorio): igual probabilidad de selección.
Estratificado: desglose de la población en estratos (país/canal/plataforma), luego SRS dentro de los estratos → menor dispersión y mejor cobertura.
Cluster: selección de grupos (días/servidores/tiendas); barato, pero por encima de la correlación intraclúcida.
Sistemático: cada k-elemento después de un inicio aleatorio (se requieren datos «no sincrónicos»).
PPS (probability proportional to size): probabilidad de ∝ el tamaño de la unidad (por ejemplo, el volumen de tráfico del socio).
2. 2 Increíbles (con precaución)
Comodidades/voluntarios: encuestas rápidas, registros de «clicks» → riesgo de desplazamiento reproductivo.
Cupo/bola de nieve: útil en grupos de nichos, pero necesita calibración posterior.
3) Fuentes de desplazamiento
Cobertura (coverage): parte de la población no se encuentra en el marco (por ejemplo, datos iOS cuando se prohíbe el seguimiento).
Selección: el mecanismo de selección está asociado a la variable objetivo (los activos son más propensos a caer).
Nonresponse: Los no iluminados son sistemáticamente diferentes.
Supervivientes (survivorship): ignorar a los difuntos/bloqueados.
Desplazamientos de etiquetas: etiquetas ruidosas, etiquetas proxy, ajustes «manuales».
Looks: uso de la futura infa en la formación de la muestra/fich.
4) Tamaño de muestra y potencia
4. 1 Aproximaciones
Para una fracción (p) con precisión (e) y confianza (1-\alpha):[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]
Tomamos conservativamente (p = 0 {.} 5). Ajuste a la población final si es necesario.
Para media con conocida (\sigma):[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]
4. 2 Efecto de diseño y tamaño eficiente
Efecto de diseño: (\mathrm {Deff} = 1 + (m-1 )\rho), donde (m) es el tamaño del clúster, (\rho) es una correlación intra-clúster.
Tamaño efectivo: (n_\text{eff}=n/\mathrm{Deff}). Los diseños en clúster/ponderados a menudo requieren más (n).
4. 3 A/B y MDE
Para métricas binarias en grupos simétricos:[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]
donde (\bar {p}) es el nivel base, MDE es el efecto mínimamente detectable.
Tenga en cuenta la estacionalidad y la interferencia (spillover), aplique CUPED/covariables para reducir la dispersión.
5) Peso y calibración (hacemos una muestra «similar» a la población)
Peso de diseño: (w_i=1/\pi_i) (probabilidad de selección inversa).
Post-estratificación y raking: personalizar los marginales ponderados (país/plataforma/mitad-edad, etc.) a las partes conocidas.
Calibración (calibration weighting): minimizamos la desviación de las escalas cuando coincidimos exactamente con los totales de control.
Butstrap/replicación: estimación correcta de las variaciones en las escalas.
Diagnóstico: ESS (tamaño de muestra efectiva), dispersión de la balanza (CV, p95/p5), comparación antes/después de los signos clave.
6) Imbalance de clases y eventos raros
Selección estratificada por objetivo: por ejemplo, una clase rara, pero siempre utilice el ajuste de umbral/escala al aprender.
Aprendizaje costoso-sensitivo: losas ponderadas en lugar de sintéticas.
SMOTE/ADASYN: precaución: riesgo de fugas/artefactos; mantenga las divisiones temporales/de grupo estrictas.
Estimación: PR-AUC, Recall@FPR≤x%; calibración de probabilidades.
7) Streaming y Big Data
Reservoir sampling: Sostenemos un subconjunto representativo de un flujo de longitud desconocida.
Sempling de eventos: proporcional a la frecuencia/importancia; para los raros - buffers desencadenantes.
Contadores y bocetos: Bloom/Count-Min para frecuencias/singularidad; para análisis: combine con un recuento preciso periódico.
De-dup e idempotencia: claves de eventos, ventanas de deduplicación.
8) Aspectos temporales y espaciales
Sampling basado en tiempo: ventanas fijas (rolling), punto en tiempo correcto.
Cluster/geo-sampling: clustering por nodo/región; tenga en cuenta la autocorrelación espacial.
Estacionalidad/ritmo: cobertura representativa de horas/días de la semana/días festivos.
9) Off-policy/login y causalidad
10) Diagnóstico de representatividad
Comparación de marginales: tablas población vs muestra por rasgos clave.
Balance covariable: SMD (standardized mean difference), Love plots.
Densidades/cuantiles: pruebas KS, quantile-plots, PSI.
Certificación del modelo: estabilización de métricas en cortes fuera de tiempo y fuera de dominio.
ESS y pesos: un ESS bajo indica una alta dispersión de las puntuaciones.
11) Anti-patrones
«Samplim sólo activo ayer» → pérdida de frío/sueño.
Promediar los porcentajes «promedio por segmentos» sin escalas.
Mezclar niveles de agregación (eventos y usuarios) en una sola muestra.
Selección aleatoria después de los filtros dependientes del objetivo (selección en el exterior).
Cross-val sin divididos de grupo/tiempo con datos dependientes.
Aplicar SMOTE antes de la partición en tren/val (fugas).
12) Escenarios privados (casos)
Encuesta de jugadores: estratificación por país/plataforma/edad; post-estratificación de las cuotas de la UMA; control de desplazamiento nonresponse.
Registros para EDA: 1:N sistemática de sample de eventos + cobertura completa de tipos raros.
Frod Detect: estratificación de target, losas sensitivas de costo, estimación de PR-AUC y Recall@FPR≤x%.
A/B con tráfico limitado: cálculo de MDE, renovación por reglas de poder, CUPED.
Evaluación off-policy de la promoción: IPS/DR con limitación de pesos (trimming), verificación de superposición de soportes.
13) Patrones de artefactos
Plan de sampling (template)
Objetivo/población:...
Marco de muestreo: fuentes, recubrimientos/agujeros
Unidad de selección: usuario/sesión/evento
Diseño: strats (país, plataforma), share, método de selección
Tamaño (n): cálculo, hipótesis (α, poder, MDE), Deff
Esquema de peso: peso de diseño, post-estratificación (total de control)
Calendario: cobertura de días/horas/días festivos
Calidad: pruebas de la capa, nonresponse-plan, procedimientos del contacto
Riesgos: selección, interferencia, privacidad/PII
Propietarios y control: quién cuenta/almacena/versiona
Pasaporte de pesaje (template)
Pesos base: (w_i=1/\pi_i)
Calibración: objetivos (país, plataforma, edad), método (raking), tolerancias
Restricciones: trimming w ∈ [w_min, w_max]
Diagnóstico: ESS, CV (w), SMD antes/después
Uso: qué informes/modelos aplican pesos
Versiones: v1→v2, fecha, propietarios
14) Privacidad y ética
Privacidad por Diseño: minimización de campos, agregaciones, pseudonimización.
Privacidad diferencial: aleatorización/subsempulación como refuerzo de la privacidad (privacy amplification).
Equidad: compruebe la diferencia de errores/pesos por atributos sensibles; no permita la «invisibilidad» de los grupos.
15) Lista de comprobación antes del inicio
- Se describe el marco de muestreo; identificados y documentados los «agujeros» de cobertura
- Diseño seleccionado (Pasta/Clusters), calculado (n), Deff, MDE
- Peso de diseño personalizado y plan de calibración (total de control acordado)
- Se definen las ventanas temporales/estacionalidad; hay un plan por nonresponse
- Las divisiones de validación tienen en cuenta el tiempo/grupos; no hay fugas
- Métricas de calidad: ESS, SMD, PSI, intervalos de bootstrap
- Documentación y versiones; derechos de acceso y trazados de privacidad verificados
Mini glosario
Deff: multiplicador que aumenta la varianza de las puntuaciones debido al diseño.
ESS: tamaño de muestra eficaz después del pesaje.
IPS/DR: Métodos de pesaje para la política de desactivación/inicio de sesión.
SMD: diferencia estandarizada de la media (equilibrio covariable).
Reservoir sampling: mantener un sample aleatorio fuera del flujo.
Resultado
La representatividad no es «suerte con sample», sino un proceso diseñado: marco correcto, diseño de selección bien pensado, tamaño suficiente, pesaje y calibración, divisiones honestas y diagnósticos rigurosos. Al seguir las prácticas descritas, reduce el desplazamiento, aumenta la portabilidad de los pines y obtiene soluciones confiables para productos, marketing, riesgos y ML.