Prognose des Spielerabflusses
Prognose des Spielerabflusses
Der Zweck der Abflussprognose besteht darin, Spieler mit dem Risiko, nicht zurückzukehren, im Voraus zu identifizieren und kontrollierte Aktionen (Re-Aktivierung, RG-Limiter, Personal Offers) zu starten, um den Wert zu maximieren und den Schaden zu minimieren. Unten ist das End-to-End-Framework von den Daten bis zum Betrieb.
1) Definitionen und Rahmen
Rechnungseinheit: Benutzer (user/master_id) - Standard.
Churn-Regel: Keine Zielaktivität ≥ T-Tage (z. B. 14/30). Aktivität: ≥1 Sitzung/Wette/Einzahlung.
Prognosehorizont: H Tage (Abflussrisiko in den nächsten 7/14/30 Tagen).
Cutoff-Datum: Tag der Bildung des Fitch; Labels dürfen die Informationen nicht später als cutoff verwenden.
2) Markierung von Etiketten ohne Lecks (Point-in-Time)
Ziel (Klassifizierung): 'churn _ next _ H = 1', wenn der Spieler nicht einmal im Fenster (t, t + H) aktiv ist und dann die Regel T ausführt.
Zeit-zu-Ereignis (Überleben): Zeit bis zum Abfluss oder zur Zensur; gut für die Planung von Mundschutz/Warteschlangen.
Slicing Slices: Generieren Sie Trainingsbeispiele an verschiedenen Terminen mit Verzögerungen, damit die Zukunft nicht abfließt.
Wahrheitsfenster: Warten Sie auf die Bestätigung des Abflusses von T, bevor die Markierung fixiert wird (verzögerte Wahrheit).
3) Fichi und Fenster
Recency/Frequency/Monetary: Tage mit der letzten Aktivität/Einzahlung, Intensität pro Fenster 7/ 14/30/90, ARPPU/Frequenz.
Verhalten und Inhalte: Spielkategorien, Diversität, „Serialität“ (Run-Length), Tages-/Wochenzeit.
Marketing: Öffnen von Pelzen/Briefen, Reaktionen auf Angebote, Abmeldungen.
Risiken/RG/Betrug: Fahnen und Zähler, ordentlich - wie guardrails.
Kalender: Feiertage/Spiele/Zahltage, Saisonspiele (dow, dom, wom).
Identitäten/Geräte: Plattform/OS/Geräteänderungen, IP/ASN-Stabilität.
Online-/Offline-Parität: Fichester mit den gleichen Rezepten und Schnittzeiten.
4) Modellierung
4. 1 Klassifizierung (Abflussrisiko Fenster H)
Logistische Regression (interpretierbar), GBM/Random Forest (starke Baselines), Tab/Seq-NN.
Schwellenwerte für Fehlerkosten, nicht für einen „schönen ROC“.
4. 2 Überleben/Hazard (Zeit bis zum Abfluss)
Kaplan-Meier (Kurvenform), Cox PH/AFT, discrete-time hazard (Logit nach Tagen mit Kalender).
Sie geben die Wahrscheinlichkeit eines Abflusses nach der Zeit an, ermöglichen die Planung der Häufigkeit von Kontakten und Mundschutz.
4. 3 Serielle und Hybride
RNN/TFT/Transformator mit Zeitzeichen und Passmasken.
Hybrid: Binäres Risiko und die Zeit bis zum Ereignis → eine bessere Entscheidungsfindung.
4. 4 Uplift-Modelle
Prognostizieren Sie eine Zunahme der Kontakterhaltung; Bewerben Sie sich, wenn es ein Protokoll von Aktionen/Experimenten gibt.
5) Bewertung und Kalibrierung
Ungleichgewicht der Klassen: grundlegend - PR-AUC, Recall@FPR≤x%, Precision @ k.
Kalibrierung der Wahrscheinlichkeiten: Brier, reliability plots; Platt/Isotonic.
Zeit: Backtesting mit im Kalender verteilten Folds (Rolling Origin).
Stabilität: Streuung der Metriken nach Segmenten (Land/Kanal/Plattform).
Überleben: Integralfehler durch Risikokurve, S (t) -Kalibrierung.
6) Schwellenwerte, Hysterese und Entscheidungspolitik
Trennen Sie die Zonen:- 'score ≥ τ_block' → starke Intervention (persönliches Angebot/Anruf)
- 'τ _ review ≤ score <τ_block' → soft contact (push/e-mail)
- 'score <τ_review' → ohne Aktion
Hysterese: Die Eingangsschwelle ist höher als die Ausgangsschwelle, um nicht zu „blinken“.
Kuldowns: Mindestintervalle für wiederholte Berührungen pro Benutzer/Kanal.
Guardrails: ROMI≥0, zhaloby≤Kh, RG-Beschränkungen, Kontakthäufigkeit.
Beispiel für Entscheidungstabelle
7) Die Ökonomie der Lösung
Erwarteter Wert:[
EV = p_{\text{uderzhaniya Aktion }\cdot LTV_{\text{future}}
p_{\text{vred} }\cdot Harm - Kosten
]
Optimieren Sie die Schwellen und Allokation von Kanälen über EVs und nicht über nackten CRs.
8) Experimente und Kausalität
A/B: Kontakt-/Offerierungsstrategien; Hauptmetrik ist Retention Uplift (D7/D30), Guardrails sind Reklamationen/RG.
Quasi-Experimente: DiD/Synthetische Kontrolle bei regionalen Ausfällen.
Uplift-Score: Qini/AUUC, uplift @ k.
9) Deploy und Online-Schaltung
Scoring: p95 ≤ 100-300 ms; die Idempotenz der Abfragen, „correlation _ id“.
Orchestrator: garantierte Lieferung, Retry/Backoff, DLQ, Rate-Limit pro Kanal/Benutzer.
Entscheidungsprotokoll: 'signal→score→decision→action→outcome' mit Modell-/Richtlinienversionen.
Feature parity: identische Fiches online/offline; Zeitscheiben - streng vor cutoff.
10) Überwachung und Drift
Qualität: PR-AUC/Recall @ FPR durch Schiebefenster, Kalibrierung; Anteil in den „Block/Review“ -Zonen.
Drift: PSI/KL nach Key Fics, Shift des Zielanteils, „neue“ Muster.
Operationen: Latenz, Timeouts,% Folbacks, Kontaktwarteschlange, Beschwerden.
Fairness: Differenzierung von Fehlern/Schwellenwerten nach Segmenten; Prüfung der Erklärbarkeit.
11) Pseudo-SQL/Rezepte
A. Bildung der churn_next_14 (Klassifizierung)
sql
WITH activity AS (
SELECT user_id, DATE_TRUNC('day', ts) AS d
FROM event_activity
),
snap AS (-- cut-off date
SELECT DISTINCT DATE_TRUNC('day', ts) AS cut
FROM event_activity
WHERE ts BETWEEN:train_from AND:train_to
),
label AS (
SELECT s. cut, a. user_id,
CASE WHEN NOT EXISTS (
SELECT 1 FROM activity a2
WHERE a2. user_id = a. user_id
AND a2. d > s. cut AND a2. d <= s. cut + INTERVAL '14 day'
) THEN 1 ELSE 0 END AS churn_next_14
FROM snap s
JOIN (SELECT DISTINCT user_id FROM activity) a ON 1=1
)
SELECT FROM label;
B. Rolling-fichy (7/30/90) mit Point-in-Time
sql
SELECT u. user_id, s. cut AS cut_day,
SUM(CASE WHEN a. d > s. cut - INTERVAL '7 day' AND a. d <= s. cut THEN 1 END) AS act_7d,
SUM(CASE WHEN a. d > s. cut - INTERVAL '30 day' AND a. d <= s. cut THEN 1 END) AS act_30d,
SUM(CASE WHEN p. d > s. cut - INTERVAL '30 day' AND p. d <= s. cut THEN p. amount ELSE 0 END) AS rev_30d,
DATE_PART('day', s. cut - MAX(a. d)) AS recency_last_act
FROM snap s
JOIN users u ON 1=1
LEFT JOIN activity a ON a. user_id = u. user_id AND a. d <= s. cut
LEFT JOIN payments p ON p. user_id = u. user_id AND p. d <= s. cut
GROUP BY 1,2;
12) Artefaktmuster
Datenblatt Abflussmodell (Vorlage)
ID/Version: 'CHURN _ 14D _ GBM _ v4'
Ziel/Fenster: 'churn _ next _ 14', PIT-Schnitte nach Tagen
Fichy: RFM, Inhalt, Marketing, Kalender, Gerät
Metrik: PR- AUC≥0. 45, Recall@FPR≤1% ≥ 0. 30, Brier≤X
Kalibrierung: isotonic
Schwellenwerte: „τ _ block/ τ _ review“ mit Hysterese
SLO: Scoring ≤ 150 ms p95; Erstellen eines Offline-Berichts ≤ 06:00 Uhr
Besitzer, Revisionsdatum, Runbook Degradation
Entscheidungsfertiger Bericht (Skelett)
„Churn 14d: Risiko nach Segmenten, Top-Ursachen, Prognose der Re-Activation Conversion“
Risiken: High-Risk-Anteil in X/Y-Plattformen gestiegen (+ Δ Prozentpunkte)
Empfehlungen: Kontaktbudget im Segment A erhöhen, Kanal B wechseln, RG-Limiter im Segment C
13) Sicherheit, Privatsphäre, Ethik
PII-Minimierung: Tokenisierung von IDs, RLS/CLS.
Transparenz: Die Gründe für die Entscheidung/den Kontakt (Top-Features/Regeln) stehen dem Sapport zur Verfügung.
Ethik/RG: gefährdete Gruppen nicht mit aggressiven Offizieren ansprechen; cap die Häufigkeit der Kontakte.
14) Häufige Fehler
Das Label nutzt die Zukunft (Label Leakage), die TZ/Fenster-Mischung.
ROC-AUC-Score bei 1% Target ohne PR-AUC/Recall @ FPR.
Keine Kalibrierung - die Schwellen sind „blind“ eingestellt.
Mangel an Hysterese/Couldowns → „blinkende“ Kontakte und Beschwerden.
Das Risiko wurde nicht mit EV/LTV in Verbindung gebracht - wir „behandeln“ diejenigen, die für die Behandlung unrentabel sind.
Online-/Offline-Rassynchron fich - in der Produktion sinkt die Qualität.
15) Checkliste vor Freigabe der Gliederung
- Definiert T/H/TZ, Aktivität, Ausnahmen; PIT-Verfahren gestaltet
- Datasets ohne Lecks; Rolling-Validierung, Benchmarks und Kalibrierung
- Schwellenwertpolitik, Hysterese, Mundschutz und Guardrails dokumentiert
- Aktionsorchester, Idempotenz, Audit „signal→decision→action“
- Überwachung von Qualität/Drift/Fairness, Alerts und Runbooks
- Die Uplift-Bewertung und/oder A/B sind fertig; decision-ready report (mit EV)
- Modell-/Fich/Metrikversionen, Besitzer, SLOs vorgeschrieben
Summe
Die Abflussprognose funktioniert nur als System: klare, leckagefreie Markierungen → informative Daten → ein geeignetes Modell (Klassifizierung und/oder Überleben) → Metriken, Kalibrierung und Schwellenwerte für die Fehlerkosten → sichere Orchestrierung von Aktionen → Überwachung von Drift und Fairness. Eine solche Kontur gibt Lösungen, nicht nur „Risiken“: wer, wann und wie zu kontaktieren, um die Retention und LTV zu erhöhen.