Prévisions de sortie des joueurs
Prévision des sorties des joueurs
L'objectif de la prévision de sortie est d'identifier à l'avance les joueurs qui risquent de ne pas revenir et de lancer des actions gérables (ré-activation, limiteurs RG, offers personnels), en maximisant la valeur et en minimisant les dommages. Ci-dessous, un cadre de bout en bout, des données à l'exploitation.
1) Définitions et cadres
Unité de compte : Utilisateur (user/master_id) - par défaut.
Règle de sortie (churn role) : absence d'activité cible ≥ T jours (par exemple 14/30). Enregistrer l'activité : ≥1 session/pari/dépôt.
Horizon des prévisions : H jours (risque de fuite dans les 7/14/30 jours suivants).
Date Cutoff : le jour de la formation de la fiche ; les étiquettes ne doivent pas utiliser les informations plus tard.
2) Marquage des étiquettes sans fuites (Point-in-Time)
Target (classification) : 'churn _ next _ H = 1' si le joueur n'est pas actif une seule fois dans la fenêtre (t, t + H] et exécute ensuite la règle T.
Time-to-event (survie) : temps avant la sortie ou la censure ; bon pour la planification des kaps/files d'attente.
Tranches glissantes : Générez des exemples d'apprentissage à différentes dates avec des lagons pour éviter que l'avenir ne s'évanouisse.
Fenêtres de vérité : Attendez la confirmation de la sortie T avant de fixer la marque (vérité supprimée).
3) Fiches et fenêtres
Recency/Frequency/Monetary : jours avec la dernière activité/dépôt, intensité par fenêtre 7/ 14/30/90, ARPPU/fréquence.
Comportement et contenu : catégories de jeux, diversité, « serial » (run-length), heure de la journée/semaine.
Marketing : ouverture des puces/lettres, réactions aux offers, désistements.
Risques/RG/frod : drapeaux et compteurs, soigneusement - comme les guardrails.
Calendrier : jours fériés/match/salaire, fiches saisonnières (dow, dom, wom).
Identités/appareils : plate-forme/OS/changements de device, stabilité IP/ASN.
Parité en ligne/hors ligne : fichestor avec les mêmes recettes et temps de coupe.
4) Modélisation
4. 1 Classification (risque de fuite vers la fenêtre H)
Régression logistique (interprétable), GBM/Random Forest (baseball fort), Tab/Seq-NN.
Seuils sur le coût des erreurs, pas sur le « beau ROC ».
4. 2 Survie/Hazard (temps avant la sortie)
Kaplan-Meier (forme de courbe), Cox PH/AFT, discrete-time hazard (logit par jour avec calendrier).
Ils donnent une probabilité de sortie dans le temps, permettent de planifier la fréquence des contacts et des caps.
4. 3 Série et hybrides
RNN/TFT/Transformer avec des caractères temporels et des masques de passe.
Hybride : le risque binaire et le temps avant l'événement → une meilleure prise de décision.
4. 4 modèles Uplift
Prédire une augmentation de la rétention de contact ; appliquer s'il y a un journal d'action/d'expérimentation.
5) Évaluation et étalonnage
Déséquilibre des classes : les principales sont PR-AUC, Recall@FPR≤x %, Precision @ k.
Étalonnage des probabilités : Brier, reliability plots ; Platt/Isotonic.
Temps : backtesting avec folds espacés selon le calendrier (rolling origin).
Stabilité : étalonnage des métriques par segment (pays/canal/plateforme).
Survie : erreur intégrale sur la courbe de risque, étalonnage S (t).
6) Seuils, hystérésis et politiques de solutions
Séparez les zones :- 'Score ≥ τ_block' → intervention forte (offer personnel/appel)
- 'τ _ review ≤ score <τ_block' → contact doux (push/e-mail)
- 'Score <τ_review' → sans action
L'hysteresis : le seuil d'entrée est plus haut que le jour férié pour ne pas "scintiller".
Couldowns : intervalles minimaux des touches répétées per user/channel.
Guardrails : ROMI≥0, zhaloby≤Kh, restrictions RG, fréquence des contacts.
Exemple de table de décision
7) L'économie de la solution
Valeur escomptée :[
EV = p_{\text{uderzhaniya action} }\cdot LTV_{\text{future}}
p_{\text{vred} }\cdot Harm - Cost
]
Optimiser les seuils et l'allocation des canaux par EV plutôt que par CR nu.
8) Expérimentation et causalité
A/B : stratégies de contact/offer ; la métrique de base est retentation uplift (D7/D30), guardrails - plaintes/RG.
Quasi-expériences : DiD/contrôle synthétique dans les retraits régionaux.
Évaluation uplift : Qini/AUUC, uplift @ k.
9) Contour dépliant et en ligne
Scoring : p95 ≤ 100-300 ms ; idempotence des requêtes, 'correlation _ id'.
Orchestrateur : livraison garantie, retry/backoff, DLQ, rate-limit per channel/user.
Journal des décisions : 'signal→score→decision→action→outcome' avec les versions modèle/politique.
Feature parity : les mêmes fiches en ligne/hors ligne ; tranches temporaires - strictement jusqu'à cutoff.
10) Surveillance et dérive
Qualité : PR-AUC/Recall @ FPR par fenêtre glissante, étalonnage ; part dans les zones « block/review ».
Dérive : PSI/KL sur les fiches clés, shift part cible, « nouveaux » schémas.
Opérations : latency, timeouts, % folback, file de contact, plaintes.
Fairness : compensation des erreurs/seuils par segment ; vérification de l'explication.
11) Pseudo-SQL/recettes
A. Formation de la marque de churn_next_14 (classification)
sql
WITH activity AS (
SELECT user_id, DATE_TRUNC('day', ts) AS d
FROM event_activity
),
snap AS (-- cut-off date
SELECT DISTINCT DATE_TRUNC('day', ts) AS cut
FROM event_activity
WHERE ts BETWEEN:train_from AND:train_to
),
label AS (
SELECT s. cut, a. user_id,
CASE WHEN NOT EXISTS (
SELECT 1 FROM activity a2
WHERE a2. user_id = a. user_id
AND a2. d > s. cut AND a2. d <= s. cut + INTERVAL '14 day'
) THEN 1 ELSE 0 END AS churn_next_14
FROM snap s
JOIN (SELECT DISTINCT user_id FROM activity) a ON 1=1
)
SELECT FROM label;
B. Rolling-fiches (7/30/90) avec point-in-time
sql
SELECT u. user_id, s. cut AS cut_day,
SUM(CASE WHEN a. d > s. cut - INTERVAL '7 day' AND a. d <= s. cut THEN 1 END) AS act_7d,
SUM(CASE WHEN a. d > s. cut - INTERVAL '30 day' AND a. d <= s. cut THEN 1 END) AS act_30d,
SUM(CASE WHEN p. d > s. cut - INTERVAL '30 day' AND p. d <= s. cut THEN p. amount ELSE 0 END) AS rev_30d,
DATE_PART('day', s. cut - MAX(a. d)) AS recency_last_act
FROM snap s
JOIN users u ON 1=1
LEFT JOIN activity a ON a. user_id = u. user_id AND a. d <= s. cut
LEFT JOIN payments p ON p. user_id = u. user_id AND p. d <= s. cut
GROUP BY 1,2;
12) Modèles d'artefacts
Passeport du modèle de sortie (template)
ID/version : 'CHURN _ 14D _ GBM _ v4'
Target/fenêtre : 'churn _ next _ 14', tranches PIT par jour
Fichi : RFM, contenu, marketing, calendrier, appareil
Métriques : PR- AUC≥0. 45, Recall@FPR≤1% ≥ 0. 30, Brier≤X
Étalonnage : isotonic
Seuils : 'τ _ block/ τ _ review' avec hystérésis
SLO : scoring ≤ 150 ms p95 ; génération d'un rapport hors ligne ≤ 06:00
Propriétaires, date de révision, runbook de dégradation
Rapport de décision-lecture (squelette)
« Churn 14d : risque par segments, cause principale, conversion de re-activation forecast »
Risques : la part du risque élevé a augmenté dans les plates-formes X/Y (+ Δ p.p.)
Recommandations : augmenter le budget des contacts dans le segment A, changer de canal B, limiteurs RG dans le segment C
13) Sécurité, vie privée, éthique
Minimisation des PII : Tokénisation des identifiants, RLS/CLS.
Transparence : les raisons de la décision/contact (top-features/regles) sont disponibles pour Sapport.
Éthique/RG : Ne ciblez pas les groupes vulnérables avec des offers agressifs ; cap fréquence des contacts.
14) Erreurs fréquentes
L'étiquette utilise le futur (label leakage), le mélange TZ/fenêtres.
Score ROC-AUC à 1 % de ciblage sans PR-AUC/Recall @ FPR.
Pas de calibrage - les seuils sont « aveuglés ».
L'absence d'hystérésis/couldaunes → le « clignotement » des contacts et des plaintes.
Le risque n'a pas été associé à l'EV/LTV - « traiter » ceux qui ne sont pas utiles pour le traitement.
En ligne/hors ligne dissynchrone fich - dans la vente la qualité diminue.
15) Chèque avant la sortie du circuit
- T/H/TZ, activité, exceptions définies ; Procédures PIT formalisées
- Datacets sans fuites ; rolling-validation, repères et étalonnage
- Politique de seuil, hystérésis, caps et guardrails documentés
- Orchestre d'action, idempotence, audit « signal→decision→action »
- Surveillance de la qualité/dérive/fairness, alertes et runbooks
- L'évaluation uplift et/ou A/B est prête ; rapport decision-ready (avec EV)
- Modèles/fich/métriques, propriétaires, SLO prescrits
Résultat
La prévision des sorties ne fonctionne que comme un système : marquage clair sans fuites → fiches informatives → modèle approprié (classification et/ou survie) → métriques, étalonnage et seuils du coût des erreurs → orchestration sécurisée des actions → surveillance de la dérive et de l'équité. Une telle boucle fournit des solutions, et pas seulement des « risques » : qui, quand et comment contacter pour augmenter la rétention et le LTV.