Previsión de salida de jugadores
Pronóstico de salida de jugadores
El objetivo del pronóstico de salida es identificar de antemano a los jugadores con riesgo de no regresar y ejecutar acciones guiadas (re-activación, limitadores RG, offers personales), maximizando el valor y minimizando el daño. A continuación se muestra el marco de extremo a extremo desde los datos hasta la operación.
1) Definiciones y marcos
Unidad de contabilidad: usuario (user/master_id) - predeterminado.
Regla de salida (churn rule): falta de actividad objetivo ≥ días T (por ejemplo, 14/30). Actividad fija: ≥1 sesión/apuesta/depósito.
Horizonte de pronóstico: H días (riesgo de salida en los siguientes 7/14/30 días).
Cutoff fecha: el día de la formación del fich; las etiquetas no deben utilizar información más tarde que cutoff.
2) Etiquetado sin fugas (Punto en tiempo)
Target (clasificación): 'churn _ next _ H = 1' si el jugador no está activo en ningún momento en la ventana (t, t + H) y luego ejecuta la regla T.
Time-to-event (supervivencia): tiempo antes de la salida o la censura; bueno para la planificación de caps/colas.
Cortes deslizantes: genera ejemplos de entrenamiento en diferentes fechas con lags para que el futuro no se filtre.
Ventanas de verdad: espere la confirmación de salida de T antes de fijar la etiqueta (delayed truth).
3) Fichas y ventanas
Recency/Frequency/Monetary: días con la última actividad/depósito, intensidad por ventanas 7/ 14/30/90, ARPPU/frecuencia.
Comportamiento y contenido: categorías de juegos, variedad, «serialidad» (run-length), hora del día/semana.
Marketing: descubrimiento de pistolas/cartas, reacciones a offers, cancelaciones.
Riesgos/RG/Frod: banderas y medidores, suavemente - como guardrails.
Calendario: días festivos/partidos/días salariales, fichas de temporada (dow, dom, wom).
Identidades/dispositivos: plataforma/OS/cambio de dispositivo, estabilidad IP/ASN.
Paridad online/offline: un fichastor con las mismas recetas y tiempo de corte.
4) Simulación
4. 1 Clasificación (riesgo de salida a la ventana H)
Regresión logística (interpretable), GBM/Random Forest (beislines fuertes), Amb/Seq-NN.
Umbrales por valor de error, no por «ROC hermoso».
4. 2 Supervivencia/Hazard (tiempo antes de la salida)
Kaplan-Meier (forma de curva), Cox PH/AFT, discrete-time hazard (logit por día con calendario).
Dan la probabilidad de salida en el tiempo, permiten planificar la frecuencia de los contactos y la capa.
4. 3 Secuenciales e híbridos
RNN/TFT/Transformer con señales de tiempo y máscaras de pase.
Híbrido: riesgo binario y tiempo antes del evento → mejor toma de decisiones.
4. 4 modelos Uplift
Pronostican un aumento en la retención de contacto; aplicar si hay un registro de acciones/experimentos.
5) Evaluación y calibración
Desequilibrio de clases: las principales son PR-AUC, Recall@FPR≤x%, Precision @ k.
Calibración de probabilidad: Brier, reliability plots; Platt/Isotonic.
Tiempo: backtesting con folios espaciados por calendario (rolling origin).
Estabilidad: dispersión de métricas por segmentos (país/canal/plataforma).
Supervivencia: error integral en la curva de riesgo, calibración S (t).
6) Umbrales, histéresis y políticas de decisión
Dividir las zonas:- 'score ≥ τ_block' → fuerte intervención (personal offer/timbre)
- 'τ _ review ≤ score <τ_block' → contacto suave (push/e-mail)
- 'score <τ_review' → sin acción
Histéresis: el umbral de entrada está por encima del de salida para no «parpadear».
Couldowns: intervalos mínimos de repetición de toques per user/channel.
Guardrails: ROMI≥0, zhaloby≤Kh, restricciones RG, frecuencia de contacto.
Tabla de decisión de ejemplo
7) Solución de economía
Valor esperado:[
EV = p_{\text{uderzhaniya } }\cdot LTV_{\text{future}}
p_{\text{vred} }\cdot Harm - Costo
]
Optimice los umbrales y la alocación de los canales por EV, no por CR desnudo.
8) Experimentación y causalidad
A/B: estrategias de contactos/offer; la métrica principal es retention uplift (D7/D30), guardrails - quejas/RG.
Cuasiexperimentos: DiD/control sintético en escaparates regionales.
Evaluación uplift: Qini/AUUC, uplift @ k.
9) Deploy y circuito en línea
Puntuación: p95 ≤ 100-300 ms; la idempotencia de las consultas, 'correlation _ id'.
Orquestador: entrega garantizada, retry/backoff, DLQ, rate-limit per channel/user.
Registro de soluciones: 'signal→score→decision→action→outcome' con versiones del modelo/política.
Feature parity: los mismos fichajes online/offline; cortes temporales - estrictamente a cutoff.
10) Monitoreo y deriva
Calidad: PR-AUC/Recall @ FPR por ventana deslizante, calibración; la proporción en las zonas 'block/review'.
Deriva: PSI/KL por fichas clave, shift de la cuota objetivo, «nuevos» patrones.
Operaciones: latency, timeouts,% folbacks, cola de contactos, quejas.
Fairness: diferenciación de errores/umbrales por segmentos; Auditoría de la explicabilidad.
11) Pseudo-SQL/recetas
A. Formación de la etiqueta churn_next_14 (clasificación)
sql
WITH activity AS (
SELECT user_id, DATE_TRUNC('day', ts) AS d
FROM event_activity
),
snap AS (-- cut-off date
SELECT DISTINCT DATE_TRUNC('day', ts) AS cut
FROM event_activity
WHERE ts BETWEEN:train_from AND:train_to
),
label AS (
SELECT s. cut, a. user_id,
CASE WHEN NOT EXISTS (
SELECT 1 FROM activity a2
WHERE a2. user_id = a. user_id
AND a2. d > s. cut AND a2. d <= s. cut + INTERVAL '14 day'
) THEN 1 ELSE 0 END AS churn_next_14
FROM snap s
JOIN (SELECT DISTINCT user_id FROM activity) a ON 1=1
)
SELECT FROM label;
B. Rolling-fiches (7/30/90) con punto en tiempo
sql
SELECT u. user_id, s. cut AS cut_day,
SUM(CASE WHEN a. d > s. cut - INTERVAL '7 day' AND a. d <= s. cut THEN 1 END) AS act_7d,
SUM(CASE WHEN a. d > s. cut - INTERVAL '30 day' AND a. d <= s. cut THEN 1 END) AS act_30d,
SUM(CASE WHEN p. d > s. cut - INTERVAL '30 day' AND p. d <= s. cut THEN p. amount ELSE 0 END) AS rev_30d,
DATE_PART('day', s. cut - MAX(a. d)) AS recency_last_act
FROM snap s
JOIN users u ON 1=1
LEFT JOIN activity a ON a. user_id = u. user_id AND a. d <= s. cut
LEFT JOIN payments p ON p. user_id = u. user_id AND p. d <= s. cut
GROUP BY 1,2;
12) Patrones de artefactos
Pasaporte del modelo de salida (template)
ID/versión: 'CHURN _ 14D _ GBM _ v4'
Target/ventana: 'churn _ next _ 14', cortes PIT por día
Fichi: RFM, contenido, marketing, calendario, dispositivo
Métricas: PR- AUC≥0. 45, Recall@FPR≤1% ≥ 0. 30, Brier≤X
Calibración: isotonic
Umbrales: 'τ _ block/ τ _ review' con histéresis
SLO: puntuación ≤ 150 ms p95; generación de informe fuera de línea ≤ 06:00
Propietarios, fecha de revisión, degradación runbook
Informe de decisión (esqueleto)
«Churn 14d: riesgo por segmentos, causa superior, conversión por re-activación»
Riesgos: la proporción de alto riesgo aumentó en las plataformas X/Y (+ Δ p.p.)
Recomendaciones: aumentar el presupuesto de contactos en el segmento A, cambiar el canal B, restricciones RG en el segmento C
13) Seguridad, privacidad, ética
Minimización PII: tokenización de ID, RLS/CLS.
Transparencia: las razones de la decisión/contacto (top-features/reglas) están disponibles para el sapport.
Ética/RG: No dirija a grupos vulnerables a ofertantes agresivos; cap frecuencia de contactos.
14) Errores frecuentes
La etiqueta utiliza el futuro (etiqueta leakage), mezcla de TZ/ventanas.
Evaluación por ROC-AUC con 1% de objetivo sin PR-AUC/Recall @ FPR.
No hay calibración - los umbrales están configurados «ciegamente».
La falta de histéresis/couldowns → el «parpadeo» de contactos y quejas.
No se asoció el riesgo con EV/LTV - «tratamos» a aquellos a quienes no es rentable tratar.
En línea/fuera de línea rassinhron fich - en la venta la calidad cae.
15) Lista de verificación antes del lanzamiento del esquema
- Se han definido T/H/TZ, actividad, excepciones; Procedimientos PIT formalizados
- Datacets sin fugas; validación de rodillos, referencias y calibración
- Política de umbral, histéresis, capas y guardrails documentados
- Orquestador de acciones, idempotencia, auditoría «signal→decision→action»
- Monitoreo de calidad/deriva/fairness, alertas y runbooks
- La evaluación uplift y/o A/B está lista; informe decision-ready (con EV)
- Versiones del modelo/fich/métricas, propietarios, SLO prescritos
Resultado
El pronóstico de salida solo funciona como un sistema: marcaje claro sin fugas → fiches informativos → modelo adecuado (clasificación y/o supervivencia) → métricas, calibración y umbrales del costo de error → orquestación segura de acciones → monitoreo de deriva y fairness. Este circuito da soluciones, no solo «riesgos»: quién, cuándo y cómo contactar para aumentar la retención y LTV.