Machine learning churn prediction: labels, leakage und der falsche test
Die meisten churn-Modelle in der Produktion scheitern an der Definition der Labels, an feature leakage oder an einer Evaluierung, die AUC anstelle von Entscheidungen belohnt. Die drei Korrekturen, in dieser Reihenfolge.
Marc Sanchez·
#Churn
#data science
#Playbooks
Machine learning churn prediction nutzt Kundenverhalten, Abrechnungs- und Support-Historie, um abzuschätzen, wer in einem zukünftigen Zeitfenster kündigen wird, sodass ein Team handeln kann, bevor es passiert. Die Modelle, die den Umsatz verändern, teilen drei Merkmale: eine ehrliche Label-Definition, Features, die nicht in die Zukunft sehen können, und eine Evaluierung, die Entscheidungen misst, nicht AUC.
Die meisten churn-Modelle in der Produktion scheitern an mindestens einer dieser drei Anforderungen. Dieser Artikel ist die technische Ergänzung zu unserer Leitfaden zur customer churn prediction, fokussiert auf die Modellierungsentscheidungen und nicht auf das Betriebsmodell.
Definiere das Label, bevor du eine Funktion berührst
Das Label ist die Entscheidung. Drei Auswahlmöglichkeiten steuern alles downstream:
1The outcome. Freiwillige Kündigung, Zahlungsfehler, Inaktivität oder Downgrade sind unterschiedliche Verhaltensweisen mit verschiedenen Treibern. Ein Modell, das auf alle zusammengefassten churn-Arten trainiert wird, prognostiziert die häufigste Art, die normalerweise unfreiwillig ist, und wird gegen freiwillige Abwanderung eingesetzt, wo es am schwächsten ist.
2The window. Dreißigtägige Fenster erfassen panikartigen churn und sind nützlich für Echtzeit-Interventionen. Neunzigtägige Fenster erfassen langsames Desengagement und lassen Raum zum Handeln. Beides zu betreiben ist besser als ein Kompromiss bei sechzig.
3The observation gap. Features müssen enden, bevor das Aktionsfenster beginnt. Wenn du zwei Wochen benötigst, um einen Kunden zu erreichen, sind bis Tag null berechnete Features nutzlos; das Modell benötigt eine Lücke zwischen dem Zeitstempel des letzten Features und dem Vorhersagefenster.
Features, die das Signal tragen
Über Abonnementbasen hinweg erledigen vier Feature-Familien fast die gesamte Arbeit:
1Engagement decay. Nicht die Rohaktivität, sondern der Trend: Sessions diese Woche im Vergleich zum gleitenden Durchschnitt des Kunden, Tage seit der letzten bedeutsamen Aktion, Breite der genutzten Features. Individuelle Baselines sind besser als Populationsdurchschnitte, denn ein Power-User, der 40 Prozent weniger nutzt, ist gefährdet, während ein Light-User auf dem gleichen absoluten Niveau es nicht ist.
2Billing events. Fehlgeschlagene Zahlungen, Planänderungen, Rabattablauf, Rechnungsüberraschungen. Abrechnungsmerkmale sind der stärkste einzelne Prädiktor für kurzfristigen churn in fast jedem Datensatz, den wir sehen, auch bei freiwilligen Abgängen.
3Support friction. Die Anzahl der Tickets ist weniger wichtig als Aktualität und Lösung. Ein ungelöstes Ticket in den letzten 14 Tagen ist einer der zuverlässigsten churn-Vorläufer; ein gelöstes Ticket ist oft schützend.
4Value realisation. Ob der Kunde jemals das Verhalten erreicht hat, das deine besten Kunden teilen: der zweite Stream, die erste Integration, der wöchentlich geöffnete Bericht. Kunden, die ein Kernverhalten nie aktiviert haben, churnen um ein Vielfaches der Basisrate, unabhängig von allem anderen.
Leakage: wie Modelle schummeln
Der Test ist mechanisch. Für jedes Feature frage: War dieser Wert zum Zeitpunkt der Vorhersage bekannt, für einen Kunden, der noch keine Absicht gezeigt hatte? Wenn die ehrliche Antwort nein ist, ist das Feature "geleakt". Teams, die auf diese Weise prüfen, sehen typischerweise, wie ihr Offline-AUC um mehrere Punkte sinkt und ihre eingesetzte Präzision steigt, weil das Modell sich nicht mehr auf Informationen verlässt, die es nie haben wird.
Warum AUC der falsche Test ist
AUC misst die ranking quality über die gesamte Population. churn intervention findet an der Spitze der Liste statt, bei den wenigen Prozent der Kunden, die ein Team tatsächlich kontaktieren kann. Ein Modell kann eine hervorragende AUC aufweisen, während es im top decile nutzlos ist, und ein Modell mit schlechterer AUC kann es genau dort übertreffen, wo es darauf ankommt.
Zwei bessere Fragen. Erstens, der uplift im kontaktierbaren Segment: Wie viel mehr churn enthält das oberste Fünf-Prozent-Segment als ein zufälliges Fünf-Prozent-Segment? Zweitens, und wichtiger, der uplift: Hat die Intervention bei kontaktierten Kunden das Ergebnis verändert? Ein Propensity-Modell kann die zweite Frage überhaupt nicht beantworten, da es rangiert, wer churnen wird, und nicht, wessen churn vermeidbar ist. Kunden, die sicher abwandern werden, stehen ganz oben auf jeder Propensity-Rangliste und absorbieren Budgets, die in das überzeugbare Mittelfeld fließen sollten. Dies ist dasselbe Argument, das wir machen bezüglich next best action models: Die Einheit der Optimierung ist die Entscheidung, nicht der Score.
Ein 30-Tage-Implementierungsplan
1Freeze the label and the gap. Schreibe das Ergebnis, das Fenster und die Beobachtungslücke auf. Lehne jedes Feature ab, das die Lücke verletzt.
2Audit for leakage. Verfolge jedes Feature bis zu seinem Zeitstempel. Entferne alles, was nach dem Auftreten eines cancellation Signal aufgezeichnet wurde.
3Am Betriebspunkt bewerten. Berichte Präzision und lift in den oberen Dezilen, bei denen du tatsächlich handeln kannst, und führe jede Intervention gegen einen holdout durch, sodass die Messung die der decision und nicht die des Modells ist.
Markin liefert churn-Modelle mit integriertem Label, Gap und holdout und bewertet diese anhand inkrementeller Einsparungen statt Offline-Scores. Siehe Retention decisioning.
Häufig gestellte Fragen
Fragen, die Leser dazu haben.
Welcher Algorithmus ist der beste für churn prediction?
Gradient-boosted trees sind der praktische Standard für tabellarische Abonnementdaten und selten der Engpass. Label definition, leakage control und evaluation tragen weitaus mehr zur bereitgestellten Leistung bei als die Wahl des Algorithmus.
Welche Features sagen churn am besten voraus?
Vier Familien leisten den größten Teil der Arbeit: Engagement-Rückgang, gemessen am eigenen Basiswert des Kunden, Abrechnungsereignisse wie fehlgeschlagene Zahlungen und Rabattablauf, ungelöste Support-Reibung in den letzten 14 Tagen und ob der Kunde jemals das Kernwertverhalten erreicht hat.
Was ist Datenlecks in einem churn-Modell?
Leakage ist jede Eigenschaft, die zum Zeitpunkt der Vorhersage für einen Kunden, der noch keine Absicht gezeigt hat, nicht bekannt sein konnte, wie z. B. Kontakte zum Speichern des Desktops, Aufrufe der Stornierungsseite oder Engagement-Fenster, die sich mit dem Vorhersagefenster überschneiden. Sie bläht Offline-Metriken auf und kollabiert bei der Bereitstellung.
Warum ist AUC eine schlechte Metrik für churn-Modelle?
Die AUC bewertet die Ranking-Qualität über die gesamte Basis, aber Interventionen erreichen nur die oberen wenigen Prozent der Kunden. Ein Modell kann eine starke AUC aufweisen und dennoch in der kontaktierbaren Gruppe schlecht ranken. Gib Präzision und lift am Betriebspunkt an und messe den uplift gegenüber einem holdout.
Was ist uplift modelling für churn?
uplift Modelle rangieren Kunden danach, wie sehr eine Intervention ihr Ergebnis verändert, anstatt danach, wie wahrscheinlich sie churnen werden. Das ist wichtig, weil Kunden, die sicher abwandern werden, jede Propensity-Liste anführen und Budgets absorbieren, die in das überzeugbare Mittelfeld fließen sollten.
Die gleichen Schleifen, die dieser Hinweis beschreibt, laufen 24/7 in deiner Kundenbasis. Beobachte, wie der Arbeitsbereich 1:1 entscheidet, Experimente durchführt und ausführt.