Machine learning churn prediction: etiquetas, filtración y la prueba errónea
La mayoría de los modelos de churn en producción fallan en la definición de etiquetas, la fuga de características o una evaluación que recompensa el AUC en lugar de las decisiones. Las tres soluciones, en orden.
Marc Sanchez·
#Baja de clientes (Churn)
#Data science
#Playbooks
Machine learning churn prediction utiliza el comportamiento del cliente, el historial de facturación y soporte para estimar quién cancelará en una ventana futura, para que un equipo pueda actuar antes de que ocurra. Los modelos que cambian los ingresos comparten tres rasgos: una definición honesta de la etiqueta, características que no pueden ver el futuro y una evaluación que mide las decisiones, no el AUC.
La mayoría de los modelos de churn en producción fallan en al menos una de esas tres. Este artículo es el complemento técnico de nuestro guía de predicción de churn de clientes, centrado en las decisiones de modelado en lugar del modelo operativo.
Define la etiqueta antes de tocar una característica
La etiqueta es la decisión. Tres opciones impulsan todo el proceso posterior:
1The outcome. La cancelación voluntaria, el fallo de pago, la inactividad o el downgrade son comportamientos diferentes con distintos impulsores. Un modelo entrenado en todo el churn agrupado predice el tipo más común, que suele ser involuntario, y se implementa contra las retenciones voluntarias donde es más débil.
2The window. Las ventanas de treinta días capturan el churn por pánico y son útiles para la intervención en tiempo real. Las ventanas de noventa días capturan el desenganche lento y dejan espacio para actuar. Ejecutar ambas es mejor que comprometerse con sesenta.
3The observation gap. Las características deben terminar antes de que comience la ventana de acción. Si necesitas dos semanas para llegar a un cliente, las características calculadas hasta el día cero son inútiles; el modelo necesita un espacio entre la marca de tiempo de la última característica y la ventana de predicción.
Características que llevan la señal
En las bases de suscripción, cuatro familias de características hacen casi todo el trabajo:
1Engagement decay. No la actividad bruta, sino la tendencia: sesiones esta semana versus el promedio móvil del propio cliente, días desde la última acción significativa, amplitud de características utilizadas. Las líneas de base individuales superan los promedios de población, porque un usuario intensivo que baja un 40 por ciento está en riesgo, mientras que un usuario ligero en el mismo nivel absoluto no lo está.
2Billing events. Pagos fallidos, cambios de plan, vencimientos de descuentos, sorpresas en las facturas. Las características de billing son el predictor individual más fuerte de churn a corto plazo en casi todos los conjuntos de datos que vemos, incluso para salidas voluntarias.
3Support friction. El número de tickets importa menos que la recencia y la resolución. Un ticket sin resolver en los últimos 14 días es uno de los precursores de churn más fiables; uno resuelto a menudo es protector.
4Value realisation. Si el cliente alguna vez alcanzó el comportamiento que comparten tus mejores clientes: el segundo stream, la primera integración, el informe semanal abierto. Los clientes que nunca activaron un comportamiento principal experimentan churn a varias veces la tasa base, independientemente de todo lo demás.
Leakage: cómo los modelos hacen trampa
El test es mecánico. Para cada característica, pregunta: ¿era este valor conocido en el momento de la predicción, para un cliente que aún no había mostrado ninguna intención? Si la respuesta honesta es no, la característica está "filtrada" (leaked). Los equipos que auditan de esta manera suelen ver cómo su AUC offline cae varios puntos y su precisión desplegada aumenta, porque el modelo deja de depender de información que nunca tendrá.
Por qué AUC es la prueba incorrecta
AUC mide la calidad de clasificación en toda la población. La intervención de churn ocurre en la parte superior de la lista, en el pequeño porcentaje de clientes que un equipo puede realmente contactar. Un modelo puede registrar un excelente AUC siendo inútil en el decil superior, y un modelo con un AUC peor puede superarlo exactamente donde importa.
Dos preguntas mejores. Primero, el uplift en el segmento contactable: ¿cuánta más churn contiene el cinco por ciento superior que un cinco por ciento aleatorio? Segundo, y más importante, el uplift: entre los clientes contactados, ¿la intervención cambió el resultado? Un modelo de propensión no puede responder a la segunda pregunta en absoluto, porque clasifica quién hará churn, no cuya churn es prevenible. Los clientes que con certeza se irán encabezan todas las clasificaciones de propensión y absorben presupuesto que debería destinarse al segmento intermedio persuadible. Este es el mismo argumento que usamos sobre next best action models: la unidad de optimización es la decisión, no la puntuación.
Un plan de instrumentación de 30 días
1Freeze the label and the gap. Anota el resultado, la ventana y la brecha de observación. Rechaza cualquier característica que viole la brecha.
2Audit for leakage. Rastrea cada característica hasta su timestamp. Elimina cualquier cosa registrada después de que existiera una señal de cancelación.
3Evalúa en el punto de operación. Informa de la precisión y el lift en los deciles superiores sobre los que realmente puedes actuar, y ejecuta cada intervención contra un holdout para que la medición sea de la decisión, no del modelo.
Markin envía modelos de churn con la etiqueta, la brecha y el holdout incorporados, y los evalúa en saves incrementales en lugar de puntuaciones offline. Ver Toma de decisiones de retención.
Preguntas frecuentes
Preguntas que los lectores hacen sobre esto.
¿Qué algoritmo es mejor para la predicción de churn?
Los árboles con aumento de gradiente son el valor predeterminado práctico para los datos de suscripciones tabulares y rara vez son el cuello de botella. La definición de etiquetas, el control de fugas y la evaluación impulsan mucho más el rendimiento implementado que la elección del algoritmo.
¿Qué features predicen mejor el churn?
Cuatro familias hacen la mayor parte del trabajo: la disminución del engagement medida contra la propia línea base del cliente, los eventos de facturación como pagos fallidos y vencimientos de descuentos, la fricción de soporte no resuelta en los últimos 14 días y si el cliente alguna vez alcanzó el comportamiento de valor principal.
¿Qué es la fuga de datos en un modelo de churn?
Leakage es cualquier característica que no era conocible en el momento de la predicción para un cliente que aún no había mostrado intención, como contactos de "save-desk", vistas de páginas de cancelación o ventanas de engagement que se superponen con la ventana de predicción. Infla las métricas offline y colapsa en el despliegue.
¿Por qué AUC es una métrica mala para los modelos de churn?
La AUC evalúa la calidad de clasificación en toda la base, pero la intervención solo llega al porcentaje superior de clientes. Un modelo puede obtener una AUC sólida y aun así clasificar mal en el segmento contactable. Informa la precisión y el lift en el punto de operación, y mide el uplift contra un holdout.
¿Qué es el uplift modelling para churn?
Los modelos de uplift clasifican a los clientes por cuánto una intervención cambia su resultado, en lugar de por la probabilidad de que hagan churn. Esto es importante porque los clientes que con certeza se irán encabezan todas las listas de propensión y absorben el presupuesto que debería destinarse al segmento intermedio persuadible.
Los mismos bucles que describe esta nota funcionan 24/7 contra tu base de clientes. Observa cómo el espacio de trabajo decide, experimenta y ejecuta 1:1.