El Informe de ROI de Markin para Equipos de Growth en EnterpriseLeer ahora
MARKIN
Notas de campo
GuíasLectura de 11 minutos

Modelo next best action: propensión, uplift y clasificación

Cómo se construye un modelo de Next Best Action: propensión, meta-learners de uplift y una función de clasificación que puntúa el margen incremental esperado por acción.

Marc Sanchez
  • #Next Best Action
  • #Toma de decisiones
  • #Guías
Next best action model: propensity, uplift and ranking

A modelo de Next Best Action es la función de puntuación que decide, para un cliente en un momento dado, qué acción candidata elegible conlleva el mayor valor incremental esperado. No es un algoritmo único. Es una pila: una capa de propensión que estima lo que es probable, una capa de uplift que estima lo que cambia una acción, y una capa de clasificación que convierte ambos en dinero y elige un ganador.

La mayoría de los equipos construyen la primera capa, omiten la segunda y dejan que la tercera se convierta en una hoja de cálculo de reglas de negocio. Por eso tantos programas reportan un AUC impresionante y unos ingresos planos. Esta guía cubre las familias de modelos que funcionan en producción, la función objetivo que debe situarse por encima de ellos y cómo saber que el modelo es correcto en lugar de meramente preciso.

Lo que el modelo debe producir

El resultado no es una puntuación por cliente. Es una matriz: para cada cliente, un valor esperado por acción elegible, incluida la acción nula de no hacer nada. La decisión es el 'argmax' de esa fila, sujeta a restricciones.

Escribir el objetivo de esta manera saca a la luz tres cosas que un modelo de propensión oculta: el conjunto de candidatas tiene que ser enumerado, cada acción necesita un margen, y se debe permitir que el 'no hacer nada' gane. En un programa maduro, la acción nula gana una gran parte de las decisiones, y esa parte es una característica, no un defecto.

Las tres capas del modelo

1. Propensión: árboles potenciados por gradiente

En datos tabulares de clientes, los árboles potenciados por gradiente (XGBoost, LightGBM, CatBoost) siguen siendo el estándar de producción. Manejan tipos mixtos y valores faltantes, se entrenan en minutos y alcanzan la mayor parte de su techo de calidad con poca sintonización. Los modelos de secuencia justifican su costo solo cuando el orden de los eventos conlleva más señal que el recuento de eventos, típicamente en rastros de comportamiento largos en streaming y gaming.

2. Uplift: meta-learners

La propensión responde quién es probable que convierta, genere churn o actualice. No responde si la acción cambia algo. Esa es una pregunta causal, y los valores predeterminados prácticos son meta-learners: T-learner (modelos separados para el grupo de tratamiento y el de control), X-learner (más estable bajo desequilibrio de tratamiento) y R-learner (Neyman-orthogonal, más robusto al error de molestia). Cada uno envuelve la misma máquina de árboles impulsados en un marco causal, por lo que el costo de ingeniería de añadir uplift sobre una pipeline de propensión existente es modesto.

El modo de fallo a observar es la propensión reetiquetada como uplift. Si la parte superior de la lista clasificada está dominada por clientes que iban a convertirse de todos modos, el programa está pagando por un comportamiento que ya tenía.

3. Clasificación bajo restricciones

La capa de clasificación aplica elegibilidad, consentimiento, límites de frecuencia, horas tranquilas, presupuesto y reglas de canibalización, luego toma el 'argmax'. Las restricciones pertenecen aquí en lugar de dentro del modelo: cambian semanalmente, son auditables y nunca deben lavarse en pesos aprendidos.

Contextual bandits y cuándo ayudan

Los contextual bandits asignan tráfico a través de acciones mientras aprenden, lo cual es útil cuando el conjunto de candidatos cambia constantemente y las recompensas llegan rápidamente. Son más débiles cuando el horizonte de recompensa es largo, como ocurre con el margen de suscripción, y cuando necesitas una lectura causal limpia para finanzas. Un compromiso común en producción: bandits para variantes creativas y de oferta dentro de una acción, modelos de uplift para qué acción elegir y un holdout preservado sobre ambos.

Validación del modelo

  1. 1Offline: Qini and uplift curves. AUC valida la propensión, no el decisioning. Utiliza el coeficiente Qini y las curvas uplift-at-k en una muestra aleatorizada hold-out para verificar que los deciles superiores realmente conllevan el efecto del tratamiento.
  2. 2Feature freezing. Calcula cada característica en el momento de la decisión. Cualquier fuga posterior a la decisión infla las métricas offline por un amplio margen y produce un modelo que falla silenciosamente en producción.
  3. 3Online: a preserved holdout. Retén aleatoriamente entre el 5 y el 15 por ciento de los clientes elegibles por decisión y lee el tratado menos el holdout sobre el margen incremental. Este es el único número que sobrevive a una revisión del CFO.
  4. 4Decay monitoring. El uplift decae más rápido que la propensión, porque la base se adapta al tratamiento. Reentrena con una cadencia fija y mantén una porción aleatoria permanente para reestimar los efectos.

Una secuencia de construcción realista

Semanas 1 a 4: enumera el conjunto de acciones candidatas y asigna un margen a cada una, luego lanza una línea base de propensión con un holdout. Semanas 5 a 10: añade un T-learner o X-learner en las dos o tres acciones de mayor volumen, y cambia la clasificación de propensión a margen incremental esperado. Semanas 11 en adelante: amplía el conjunto de candidatas, añade restricciones y permite que la acción nula compita. La mayor parte del lift llega en la segunda fase, cuando el objetivo cambia, y no cuando lo hace el algoritmo.

Para saber cómo encajan los modelos dentro del ciclo operativo más amplio, consulta la guía de Next Best Action, y para la versión específica de retención de la misma pila, consulta predicción de abandono de clientes.


Markin construye y reentrena las capas de propensión, uplift y clasificación contra tu base, y lee cada decisión contra un holdout preservado. Explora Next Best Action para verlo en directo.

Preguntas frecuentes

Preguntas que los lectores hacen sobre esto.

¿Qué es un modelo de next best action?
Un modelo de next best action es la pila de puntuación que estima, para un cliente en un momento dado, el valor incremental esperado de cada acción elegible, incluyendo no hacer nada, y las clasifica. Combina una capa de propensión, una capa de uplift y una capa de clasificación con restricciones.
¿Qué algoritmos se utilizan para next best action?
Árboles con gradiente impulsado (XGBoost, LightGBM, CatBoost) para la propensión en datos tabulares; meta-learners de uplift como T-learner, X-learner y R-learner para el efecto causal; y una capa de clasificación argmax restringida para la decisión final. Los bandits contextuales son útiles para la asignación a nivel de variante dentro de una acción.
¿Cuál es la diferencia entre un modelo de propensión y un modelo de uplift?
La propensión estima la probabilidad de un resultado para un cliente. El uplift estima cuánto una acción específica cambia ese resultado. La clasificación por propensión gasta presupuesto en clientes que habrían convertido de todos modos; la clasificación por uplift lo gasta donde la acción marca la diferencia.
¿Cómo validas un modelo de Next Best Action?
Sin conexión, con coeficientes Qini y curvas de uplift-at-k en una muestra aleatorizada hold-out, con todas las características congeladas en el momento de la decisión. En línea, con un holdout preservado del 5 al 15 por ciento de los clientes elegibles, leyendo el margen incremental tratado-menos-holdout por decisión.
¿Con qué frecuencia deben reentrenarse los modelos de uplift?
Con más frecuencia que los modelos de propensión. Los efectos del tratamiento decaen a medida que la base de clientes se adapta al mismo, por lo que debes mantener una muestra aleatoria permanente para reestimar los efectos y volver a entrenar con una cadencia fija, en lugar de solo cuando la precisión disminuya.

Verlo en el producto

Esto funciona en Markin hoy.

Los mismos bucles que describe esta nota funcionan 24/7 contra tu base de clientes. Observa cómo el espacio de trabajo decide, experimenta y ejecuta 1:1.