Le rapport ROI Markin pour les équipes de Enterprise GrowthLire maintenant
MARKIN
Notes de terrain
Manuels10 min de lecture

Machine learning churn prediction : labels, fuite de données et mauvais test

La plupart des modèles de churn en production échouent sur la définition des labels, la fuite de features ou une évaluation qui récompense l'AUC au lieu des décisions. Les trois correctifs, dans l'ordre.

Marc Sanchez
  • #Résiliation
  • #Data science
  • #Manuels
Machine learning churn prediction: labels, leakage and the wrong test

Machine learning churn prediction utilise le comportement client, l'historique de facturation et de support pour estimer qui annulera dans une fenêtre future, afin qu'une équipe puisse agir avant que cela ne se produise. Les modèles qui modifient les revenus partagent trois traits : une définition d'étiquette honnête, des fonctionnalités qui ne peuvent pas voir l'avenir et une évaluation qui mesure les décisions, pas l'AUC.

La plupart des modèles de churn en production échouent sur au moins l'un de ces trois points. Cet article est le complément technique à notre guide de prédiction du churn client, axée sur les décisions de modélisation plutôt que sur le modèle opérationnel.

Définir l'étiquette avant de toucher à une fonctionnalité

Le label est la décision. Trois choix déterminent tout en aval :

  1. 1The outcome. Une annulation volontaire, un échec de paiement, une inactivité ou un déclassement sont des comportements différents avec des déclencheurs différents. Un modèle entraîné sur l'ensemble du churn, regroupé, prédit le type le plus courant, qui est généralement involontaire, et est déployé contre les saves volontaires où il est le plus faible.
  2. 2The window. Les fenêtres de trente jours détectent le churn de panique et sont utiles pour une intervention en temps réel. Les fenêtres de quatre-vingt-dix jours détectent le désengagement lent et laissent une marge de manœuvre pour agir. Utiliser les deux est mieux que de faire un compromis à soixante.
  3. 3The observation gap. Les fonctionnalités doivent se terminer avant le début de la fenêtre d'action. Si tu as besoin de deux semaines pour atteindre un client, les fonctionnalités calculées jusqu'au jour zéro sont inutiles ; le modèle a besoin d'un écart entre le dernier horodatage de la fonctionnalité et la fenêtre de prédiction.

Fonctionnalités qui portent le signal

Sur les bases d'abonnement, quatre familles de fonctionnalités font presque tout le travail :

  1. 1Engagement decay. Pas l'activité brute, mais la tendance : les sessions de cette semaine par rapport à la moyenne historique du client, les jours depuis la dernière action significative, l'étendue des fonctionnalités utilisées. Les références individuelles sont meilleures que les moyennes de population, car un utilisateur intensif qui chute de 40 % est à risque, tandis qu'un utilisateur occasionnel au même niveau absolu ne l'est pas.
  2. 2Billing events. Paiements échoués, changements de plan, expirations de remises, surprises de facturation. Les fonctionnalités de facturation sont le prédicteur unique le plus fort du churn à court terme dans presque tous les ensembles de données que nous voyons, y compris pour les départs volontaires.
  3. 3Support friction. Le nombre de tickets est moins important que la récence et la résolution. Un ticket non résolu au cours des 14 derniers jours est l'un des précurseurs de churn les plus fiables ; un ticket résolu est souvent protecteur.
  4. 4Value realisation. Si le client a déjà atteint le comportement que partagent tes meilleurs clients : le second flux, la première intégration, le rapport hebdomadaire ouvert. Les clients qui n'ont jamais activé un comportement essentiel churn plusieurs fois plus que le taux de base, indépendamment de tout le reste.

Leakage : comment les modèles trichent

Le test est mécanique. Pour chaque fonctionnalité, demande-toi : cette valeur était-elle connaissable au moment de la prédiction, pour un client qui n'avait pas encore manifesté d'intention ? Si la réponse honnête est non, la fonctionnalité fuit. Les équipes qui auditent de cette manière voient généralement leur AUC offline chuter de plusieurs points et leur précision déployée augmenter, car le modèle cesse de s'appuyer sur des informations qu'il n'aura jamais.

Pourquoi l'AUC est le mauvais test

L'AUC mesure la qualité de classement sur l'ensemble de la population. L'intervention de churn se produit en tête de liste, sur les quelques pour cent de clients qu'une équipe peut réellement contacter. Un modèle peut afficher un excellent AUC tout en étant inutile dans le premier décile, et un modèle avec un AUC moins bon peut le surpasser exactement là où cela compte.

Deux meilleures questions. Premièrement, l'uplift dans la tranche contactable : combien plus de churn les cinq pour cent supérieurs contiennent-ils qu'un échantillon aléatoire de cinq pour cent ? Deuxièmement, et plus important, l'uplift : parmi les clients contactés, l'intervention a-t-elle modifié le résultat ? Un modèle de propension ne peut absolument pas répondre à la deuxième question, car il classe ceux qui vont churn, et non ceux dont le churn est évitable. Les clients certains de partir dominent chaque classement de propension et absorbent un budget qui devrait être alloué à la moyenne persuadable. C'est le même argument que nous avançons pour modèles de next best action : l'unité d'optimisation est la décision, pas le score.

Un plan d'instrumentation de 30 jours

  1. 1Freeze the label and the gap. Écris le résultat, la fenêtre et l'écart d'observation. Rejette toute fonctionnalité qui viole l'écart.
  2. 2Audit for leakage. Trace chaque fonctionnalité à son horodatage. Supprime tout ce qui est enregistré après l'existence d'un signal d'annulation.
  3. 3Évalue au point de fonctionnement. Rapporte la précision et le lift dans les déciles supérieurs sur lesquels tu peux réellement agir, et exécute chaque intervention contre un holdout afin que la mesure soit celle de la decision, et non du modèle.

Markin livre des modèles de churn avec le label, le gap et le holdout intégrés, et les évalue sur les sauvegardes incrémentales plutôt que sur les scores hors ligne. Voir Decisioning de rétention.

Questions fréquentes

Questions que les lecteurs se posent à ce sujet.

Quel algorithme est le meilleur pour la prédiction du churn ?
Les arbres de décision boostés par gradient sont le standard pratique pour les données d'abonnement tabulaires et sont rarement le goulot d'étranglement. La définition des labels, le contrôle des fuites et l'évaluation contribuent bien plus à la performance déployée que le choix de l'algorithme.
Quelles fonctionnalités prédisent le mieux le churn ?
Quatre familles effectuent la majeure partie du travail : le déclin de l'engagement mesuré par rapport à la propre base de référence du client, les événements de facturation tels que les échecs de paiement et les expirations de remises, les frictions de support non résolues au cours des 14 derniers jours, et si le client a déjà atteint le comportement de valeur essentiel.
Qu'est-ce que la data leakage dans un modèle de churn ?
La fuite de données (leakage) est toute caractéristique qui n'était pas connaissable au moment de la prédiction pour un client qui n'avait pas encore manifesté d'intention, comme les contacts de service de rétention, les vues de pages d'annulation ou les fenêtres d'engagement chevauchant la fenêtre de prédiction. Elle gonfle les métriques hors ligne et s'effondre au déploiement.
Pourquoi l'AUC est-elle une mauvaise métrique pour les modèles de churn ?
Les scores AUC évaluent la qualité du classement sur l'ensemble de la base, mais l'intervention n'atteint que les quelques pour cent supérieurs des clients. Un modèle peut afficher un AUC fort et pourtant classer mal la tranche contactable. Rapportez la précision et le lift au point de fonctionnement, et mesure l'uplift par rapport à un holdout.
Qu'est-ce que l'uplift modelling pour le churn ?
Les modèles d'uplift classent les clients en fonction de l'impact d'une intervention sur leur résultat, plutôt que de leur probabilité de churn. C'est important car les clients certains de partir dominent chaque liste de propension et absorbent un budget qui devrait être alloué à la moyenne persuadable.

Le voir dans le produit

Ceci est exécuté dans Markin aujourd'hui.

Les mêmes boucles que cette note décrit fonctionnent 24 heures sur 24, 7 jours sur 7, sur ta base de clients. Observe l'espace de travail décider, expérimenter et exécuter en 1:1.