Previsão de saída de jogadores
Previsão de saída de jogadores
O objetivo da previsão de fuga é identificar os jogadores com o risco de não retornar e iniciar ações controladas (RG limitadores, offs pessoais), maximizando o valor e minimizando os danos. Abaixo, um esqueleto end-to-end, desde dados até uso.
1) Definições e marcos
Unidade de contabilidade: usuário (user/master _ id) - padrão.
Regra de saída (churn rule): falta de atividade alvo ≥ T dias (por exemplo, 14/30). Atividade fixe: ≥1 sessão/taxa/depósito.
Horizonte de previsão: H dias (risco de fuga nos próximos dias 7/14/30).
A data de Cutoff é o dia da formação do fique; os rótulos não devem usar as informações mais tarde.
2) Sinalização de marcas sem vazamentos (Point-in-Time)
Target (classificação): 'churn _ next _ H = 1', se o jogador não estiver ativo uma vez na janela (t, t + H] e continuar cumprindo a regra T.
Time-to-event (sobrevivência): tempo antes da fuga ou censura; bom para planejar caps/filas.
Cortes deslizantes: Gere exemplos de aprendizagem em datas diferentes com as lajes para evitar que o futuro se arraste.
Janelas da verdade: espere a confirmação da saída do T antes da fixação do rótulo (delayed truth).
3) Fichas e janelas
Recency/Frequency/Monetary: dias com última atividade/depósito, intensidade por janelas 7/ 14/30/90, ARPU/frequência.
Comportamento e conteúdo: categorias de jogos, variedade, «série» (run-length), hora do dia/semana.
Marketing: abertura de canhões/cartas, reações a offs, dispensas.
Riscos/RG/frod: bandeiras e contadores, com cuidado - como guardas.
Calendário: feriados/jogos/dias salariais, fiques sazonais (dow, dom, wom).
Identidades/dispositivos: plataforma/OS/alterações de definição, estabilidade IP/ASN.
Paridade online/offline: Fichestor com receitas idênticas e tempo de corte.
4) Modelagem
4. 1 Classificação (risco de fuga na janela H)
Regressão logística (interpretada), GBM/Random Forest (bazlins fortes), Tab/Seq-NN.
Liminares para o custo dos erros, não para o'ROC bonito ".
4. 2 Sobrevivência/Hazard (tempo anterior à saída)
Kaplan-Méier (forma da curva), Cox PH/AFT, discrete-time hazard (logit por dia com calendário).
Oferecem probabilidade de fuga de tempo, permitem programar a frequência de contatos e capas.
4. 3 Sequenciais e híbridos
RNN/TNT/Transformer com sinais temporários e máscaras de passe.
Híbrido: risco binário e tempo até o evento → melhor tomada de decisões.
4. 4 modelos Uplift
Prevê aumento da retenção do contato; aplique se houver um logotipo de ação/experimentação.
5) Avaliação e calibragem
Desequilíbrio de classes: essenciais - PR-AUC, Recall@FPR≤x%, Precision @ k.
Calibragem de probabilidades: Brier, reliability plots; Platt/Isotonic.
Hora: backtesting com folds (rolling origin).
Estabilidade: separação de métricas por segmento (país/canal/plataforma).
Sobrevivência: erro integral por curva de risco, calibração S (t).
6) Liminares, histerese e políticas de decisão
Divida as zonas:- 'score _ block' é uma intervenção forte (off/chamada pessoal)
- '\_ review ≤ score <£ _ block '→ contato suave (pool/e-mail)
- 'score <_ review' → sem efeito
Histeresis, a porta de entrada está acima da saída para não «piscar».
Kuldown: intervalos mínimos de toque repetido per usuário/channel.
Guardrails: ROMI≥0, zhaloby≤Kh, restrições RG, frequência de contatos.
Exemplo de definição de tabela
7) Economia de solução
Valor esperado:[
EV = p _\\text\retenção promoção de 03 03\cdot LTV _ se\\text <future 03
p _\\text por causa de um dano por causa de 350\cdot Harm por
]
Otimize as liminares e alocação de canais em EV, em vez de CR nu.
8) Experimentos e causalidade
A/B: estratégias de contato/off; A métrica principal é retention uplift (D7/D30), guard - queixas/RG.
Quasiexportadores: Controle diD/sintético em escoamentos regionais.
Avaliação Uplift: Qini/AUUC, uplift @ k.
9) Deploy e circuito online
Compilação: p95 ≤ 100-300 ms; idimpotência das solicitações, 'correlation _ id'.
Orquestrador: entrega garantida, retry/backoff, DLQ, rate-limit per channel/user.
Diário de soluções «signal→score→decision→action→outcome» com versões de modelo/política.
Função parity: fici online/offline idênticos; cortes temporários são estritamente até cutoff.
10) Monitoramento e deriva
Qualidade: PR-AUC/Recall @ FPR na janela deslizante, calibrada; participação nas zonas 'block/review'.
À deriva: PSI/KL em fichas-chave, shift participação alvo, «novos» patters.
Operações: latency, timeouts,% dos folbacks, fila de contatos, queixas.
Fairness: Diferência de erros/liminares por segmento; uma auditoria da explicabilidade.
11) Pseudo-SQL/receitas
A. Formação da marca churn _ next _ 14 (classificação)
sql
WITH activity AS (
SELECT user_id, DATE_TRUNC('day', ts) AS d
FROM event_activity
),
snap AS (-- cut-off date
SELECT DISTINCT DATE_TRUNC('day', ts) AS cut
FROM event_activity
WHERE ts BETWEEN:train_from AND:train_to
),
label AS (
SELECT s. cut, a. user_id,
CASE WHEN NOT EXISTS (
SELECT 1 FROM activity a2
WHERE a2. user_id = a. user_id
AND a2. d > s. cut AND a2. d <= s. cut + INTERVAL '14 day'
) THEN 1 ELSE 0 END AS churn_next_14
FROM snap s
JOIN (SELECT DISTINCT user_id FROM activity) a ON 1=1
)
SELECT FROM label;
Fici rolling (7/30/90) com point-in-time
sql
SELECT u. user_id, s. cut AS cut_day,
SUM(CASE WHEN a. d > s. cut - INTERVAL '7 day' AND a. d <= s. cut THEN 1 END) AS act_7d,
SUM(CASE WHEN a. d > s. cut - INTERVAL '30 day' AND a. d <= s. cut THEN 1 END) AS act_30d,
SUM(CASE WHEN p. d > s. cut - INTERVAL '30 day' AND p. d <= s. cut THEN p. amount ELSE 0 END) AS rev_30d,
DATE_PART('day', s. cut - MAX(a. d)) AS recency_last_act
FROM snap s
JOIN users u ON 1=1
LEFT JOIN activity a ON a. user_id = u. user_id AND a. d <= s. cut
LEFT JOIN payments p ON p. user_id = u. user_id AND p. d <= s. cut
GROUP BY 1,2;
12) Modelos de artefatos
Passaporte modelo de saída (template)
ID/versão: 'CHURN _ 14D _ GBM _ v4'
Target/janela: 'churn _ next _ 14', corte PIT por dia
Fichos: RFM, conteúdo, marketing, calendário, dispositivo
Métricas PR- AUC≥0. 45, Recall@FPR≤1% ≥ 0. 30, Brier≤X
Calibragem: isotonic
Liminares: 'se _ block/se _ review' com histerese
SLO: compilação ≤ 150 ms p95; geração de relatório off-line ≤ 06:00
Proprietários, data de revisão, runbook degradação
Relatório de resolução-ready (esqueleto)
«Churn 14d: risco por segmentos, causa top, forecast conversão r-ativação»
Riscos: a participação de high-risk aumentou em plataformas X/Y (+ D.P.)
Recomendações: aumentar o orçamento de contatos no segmento A, mudar de canal B, limitadores RG no segmento C
13) Segurança, privacidade, ética
Minimização PII: Tocinização de ID, RLS/CLS.
Transparência: os motivos da solução/contato (top-featuras/regras) estão disponíveis para a saforta.
Ética/RG: Não meta grupos vulneráveis com offers agressivos; cap frequência de contatos.
14) Erros frequentes
O rótulo usa o futuro (label leakage), mistura TZ/janelas.
Avaliação de ROC-AUC a 1% de meta sem PR-AUC/Recall @ FPR.
Não há calibragem. As liminares estão definidas à cega.
Falta de histerese/cooldowns → «piscar» contatos e queixas.
Não associaram o risco a EV/LTV - «tratamos» aqueles que não são bem tratados.
Online/offline Rashhron Fich - em venda a qualidade está caindo.
15) Folha de cheque antes do lançamento do circuito
- Definidos T/H/TZ, atividade, exceções; Procedimentos PIT formalizados
- Datasets sem vazamentos; rolling-validação, benchmark e calibragem
- Política liminar, histerese, caps e guardrais documentados
- Orquestrador de ação, idempotação, auditoria «signal→decision→action»
- Monitoramento de qualidade/deriva/fairness, alertas e runbooks
- A avaliação Uplift e/ou A/B está pronta; relatório de resolução-ready (com EV)
- Versões do modelo/fic/métrico, proprietários, SLO especificados
Resultado
A previsão de saída funciona apenas como um sistema de sinalização nítida sem vazamentos → fios informativos → um modelo adequado (classificação e/ou sobrevivência) → métricas, calibragem e liminares de erro → orquestração segura → monitoramento da deriva e fairness. Esse caminho oferece soluções, não apenas «riscos»: quem, quando e como entrar em contato para aumentar a retenção e LTV.