Logo GH

Sampling y representatividad

Sampling y representatividad

El sampling es la elección de un subconjunto de observaciones para medir, experimentar y enseñar modelos. La representatividad significa que los hallazgos de la muestra se escalan en la población objetivo sin un error sistemático. A continuación, cómo diseñar una muestra, evaluar su calidad y ajustar los desplazamientos.

1) Conceptos básicos

Población: conjunto de objetos de destino (todos los usuarios/sesiones/transacciones).
Marco de muestreo (sampling frame): lista/mecanismo del que realmente seleccionamos (es importante identificar los recubrimientos y «agujeros»).
Unidad de selección: usuario, sesión, evento, transacción, dispositivo.
Representatividad: coincidencia de distribuciones de rasgos clave en la muestra y la población (con error aleatorio).
Error sistemático aleatorio vs: varianza de las puntuaciones contra desplazamiento (bias).

2) Tipos de sampling

2. 1 Probabilística (preferida)

SRS (simple aleatorio): igual probabilidad de selección.
Estratificado: desglose de la población en estratos (país/canal/plataforma), luego SRS dentro de los estratos → menor dispersión y mejor cobertura.
Cluster: selección de grupos (días/servidores/tiendas); barato, pero por encima de la correlación intraclúcida.
Sistemático: cada k-elemento después de un inicio aleatorio (se requieren datos «no sincrónicos»).
PPS (probability proportional to size): probabilidad de ∝ el tamaño de la unidad (por ejemplo, el volumen de tráfico del socio).

2. 2 Increíbles (con precaución)

Comodidades/voluntarios: encuestas rápidas, registros de «clicks» → riesgo de desplazamiento reproductivo.
Cupo/bola de nieve: útil en grupos de nichos, pero necesita calibración posterior.

3) Fuentes de desplazamiento

Cobertura (coverage): parte de la población no se encuentra en el marco (por ejemplo, datos iOS cuando se prohíbe el seguimiento).
Selección: el mecanismo de selección está asociado a la variable objetivo (los activos son más propensos a caer).
Nonresponse: Los no iluminados son sistemáticamente diferentes.
Supervivientes (survivorship): ignorar a los difuntos/bloqueados.
Desplazamientos de etiquetas: etiquetas ruidosas, etiquetas proxy, ajustes «manuales».
Looks: uso de la futura infa en la formación de la muestra/fich.

4) Tamaño de muestra y potencia

4. 1 Aproximaciones

Para una fracción (p) con precisión (e) y confianza (1-\alpha):
[
n \approx \frac{z_{\alpha/2}^2, p(1-p)}{e^2}
]

Tomamos conservativamente (p = 0 {.} 5). Ajuste a la población final si es necesario.

Para media con conocida (\sigma):
[
n \approx \left(\frac{z_{\alpha/2},\sigma}{e}\right)^2
]

4. 2 Efecto de diseño y tamaño eficiente

Efecto de diseño: (\mathrm {Deff} = 1 + (m-1 )\rho), donde (m) es el tamaño del clúster, (\rho) es una correlación intra-clúster.
Tamaño efectivo: (n_\text{eff}=n/\mathrm{Deff}). Los diseños en clúster/ponderados a menudo requieren más (n).

4. 3 A/B y MDE

Para métricas binarias en grupos simétricos:
[
n_{\text{на группу}} \approx \frac{2(z_{1-\alpha/2}+z_{1-\beta})^2, \bar{p}(1-\bar{p})}{\mathrm{MDE}^2}
]

donde (\bar {p}) es el nivel base, MDE es el efecto mínimamente detectable.
Tenga en cuenta la estacionalidad y la interferencia (spillover), aplique CUPED/covariables para reducir la dispersión.

5) Peso y calibración (hacemos una muestra «similar» a la población)

Peso de diseño: (w_i=1/\pi_i) (probabilidad de selección inversa).
Post-estratificación y raking: personalizar los marginales ponderados (país/plataforma/mitad-edad, etc.) a las partes conocidas.
Calibración (calibration weighting): minimizamos la desviación de las escalas cuando coincidimos exactamente con los totales de control.
Butstrap/replicación: estimación correcta de las variaciones en las escalas.
Diagnóstico: ESS (tamaño de muestra efectiva), dispersión de la balanza (CV, p95/p5), comparación antes/después de los signos clave.

6) Imbalance de clases y eventos raros

Selección estratificada por objetivo: por ejemplo, una clase rara, pero siempre utilice el ajuste de umbral/escala al aprender.
Aprendizaje costoso-sensitivo: losas ponderadas en lugar de sintéticas.
SMOTE/ADASYN: precaución: riesgo de fugas/artefactos; mantenga las divisiones temporales/de grupo estrictas.
Estimación: PR-AUC, Recall@FPR≤x%; calibración de probabilidades.

7) Streaming y Big Data

Reservoir sampling: Sostenemos un subconjunto representativo de un flujo de longitud desconocida.
Sempling de eventos: proporcional a la frecuencia/importancia; para los raros - buffers desencadenantes.
Contadores y bocetos: Bloom/Count-Min para frecuencias/singularidad; para análisis: combine con un recuento preciso periódico.
De-dup e idempotencia: claves de eventos, ventanas de deduplicación.

8) Aspectos temporales y espaciales

Sampling basado en tiempo: ventanas fijas (rolling), punto en tiempo correcto.
Cluster/geo-sampling: clustering por nodo/región; tenga en cuenta la autocorrelación espacial.
Estacionalidad/ritmo: cobertura representativa de horas/días de la semana/días festivos.

9) Off-policy/login y causalidad

IPS (inverse propensity): (w_i=1/\pi(a_ix_i)) para corregir los logs samples bajo la nueva política.
Evaluaciones DR: Doble Robust para reducir el desplazamiento y la dispersión.
Transportabilidad: transferencia de resultados entre mercados/canales: compruebe la coincidencia de covariables (covariate shift).
Mayús de etiqueta: (P (y)) cambia cuando es estable (P (x)y)); use EM/recalibración.

10) Diagnóstico de representatividad

Comparación de marginales: tablas población vs muestra por rasgos clave.
Balance covariable: SMD (standardized mean difference), Love plots.
Densidades/cuantiles: pruebas KS, quantile-plots, PSI.
Certificación del modelo: estabilización de métricas en cortes fuera de tiempo y fuera de dominio.
ESS y pesos: un ESS bajo indica una alta dispersión de las puntuaciones.

11) Anti-patrones

«Samplim sólo activo ayer» → pérdida de frío/sueño.
Promediar los porcentajes «promedio por segmentos» sin escalas.
Mezclar niveles de agregación (eventos y usuarios) en una sola muestra.
Selección aleatoria después de los filtros dependientes del objetivo (selección en el exterior).
Cross-val sin divididos de grupo/tiempo con datos dependientes.
Aplicar SMOTE antes de la partición en tren/val (fugas).

12) Escenarios privados (casos)

Encuesta de jugadores: estratificación por país/plataforma/edad; post-estratificación de las cuotas de la UMA; control de desplazamiento nonresponse.
Registros para EDA: 1:N sistemática de sample de eventos + cobertura completa de tipos raros.
Frod Detect: estratificación de target, losas sensitivas de costo, estimación de PR-AUC y Recall@FPR≤x%.
A/B con tráfico limitado: cálculo de MDE, renovación por reglas de poder, CUPED.
Evaluación off-policy de la promoción: IPS/DR con limitación de pesos (trimming), verificación de superposición de soportes.

13) Patrones de artefactos

Plan de sampling (template)

Objetivo/población:...

Marco de muestreo: fuentes, recubrimientos/agujeros

Unidad de selección: usuario/sesión/evento

Diseño: strats (país, plataforma), share, método de selección

Tamaño (n): cálculo, hipótesis (α, poder, MDE), Deff

Esquema de peso: peso de diseño, post-estratificación (total de control)

Calendario: cobertura de días/horas/días festivos

Calidad: pruebas de la capa, nonresponse-plan, procedimientos del contacto

Riesgos: selección, interferencia, privacidad/PII

Propietarios y control: quién cuenta/almacena/versiona

Pasaporte de pesaje (template)

Pesos base: (w_i=1/\pi_i)

Calibración: objetivos (país, plataforma, edad), método (raking), tolerancias

Restricciones: trimming w ∈ [w_min, w_max]

Diagnóstico: ESS, CV (w), SMD antes/después

Uso: qué informes/modelos aplican pesos

Versiones: v1→v2, fecha, propietarios

14) Privacidad y ética

Privacidad por Diseño: minimización de campos, agregaciones, pseudonimización.
Privacidad diferencial: aleatorización/subsempulación como refuerzo de la privacidad (privacy amplification).
Equidad: compruebe la diferencia de errores/pesos por atributos sensibles; no permita la «invisibilidad» de los grupos.

15) Lista de comprobación antes del inicio

  • Se describe el marco de muestreo; identificados y documentados los «agujeros» de cobertura
  • Diseño seleccionado (Pasta/Clusters), calculado (n), Deff, MDE
  • Peso de diseño personalizado y plan de calibración (total de control acordado)
  • Se definen las ventanas temporales/estacionalidad; hay un plan por nonresponse
  • Las divisiones de validación tienen en cuenta el tiempo/grupos; no hay fugas
  • Métricas de calidad: ESS, SMD, PSI, intervalos de bootstrap
  • Documentación y versiones; derechos de acceso y trazados de privacidad verificados

Mini glosario

Deff: multiplicador que aumenta la varianza de las puntuaciones debido al diseño.
ESS: tamaño de muestra eficaz después del pesaje.
IPS/DR: Métodos de pesaje para la política de desactivación/inicio de sesión.
SMD: diferencia estandarizada de la media (equilibrio covariable).
Reservoir sampling: mantener un sample aleatorio fuera del flujo.

Resultado

La representatividad no es «suerte con sample», sino un proceso diseñado: marco correcto, diseño de selección bien pensado, tamaño suficiente, pesaje y calibración, divisiones honestas y diagnósticos rigurosos. Al seguir las prácticas descritas, reduce el desplazamiento, aumenta la portabilidad de los pines y obtiene soluciones confiables para productos, marketing, riesgos y ML.

Contact

Póngase en contacto

Escríbanos ante cualquier duda o necesidad de soporte.¡Siempre estamos listos para ayudarle!

Telegram
@Gamble_GC
Iniciar integración

El Email es obligatorio. Telegram o WhatsApp — opcionales.

Su nombre opcional
Email opcional
Asunto opcional
Mensaje opcional
Telegram opcional
@
Si indica Telegram, también le responderemos allí además del Email.
WhatsApp opcional
Formato: +código de país y número (por ejemplo, +34XXXXXXXXX).

Al hacer clic en el botón, usted acepta el tratamiento de sus datos.