O Relatório de ROI da Markin para Equipas de Enterprise GrowthLer agora
MARKIN
Notas de campo
Guiasleitura de 11 min

Next best action model: propensão, uplift e ranking

Como um modelo de next best action é construído: propensão, meta-learners de uplift e uma função de classificação que atribui scores à margem incremental esperada por ação.

Marc Sanchez
  • #Next Best Action
  • #Tomada de decisão
  • #Guias
Next best action model: propensity, uplift and ranking

A modelo de Next Best Action é a função de pontuação que decide, para um cliente num determinado momento, qual ação candidata elegível proporciona o maior valor incremental esperado. Não é um único algoritmo. É uma stack: uma camada de propensão que estima o que é provável, uma camada de uplift que estima o que uma ação muda, e uma camada de ranking que converte ambos em dinheiro e escolhe um vencedor.

A maioria das equipas constrói a primeira camada, salta a segunda e deixa a terceira tornar-se uma folha de cálculo de regras de negócio. É por isso que tantos programas reportam uma AUC impressionante e uma receita estagnada. Este guia cobre as famílias de modelos que funcionam em produção, a função objetivo que deve estar acima delas e como saber que o modelo está correto, em vez de apenas preciso.

O que o modelo tem de gerar

A saída não é uma pontuação por cliente. É uma matriz: para cada cliente, um valor esperado por ação elegível, incluindo a ação nula de não fazer nada. A decisão é o argmax dessa linha, sujeita a restrições.

Escrever o objetivo desta forma força três coisas a virem à tona que um modelo de propensão esconde: o conjunto de candidate actions tem que ser enumerado, cada ação precisa de uma margem, e não fazer nada tem que ser permitido vencer. Num programa maduro, a ação nula vence uma grande parte das decisões, e essa parte é uma característica, não um defeito.

As três camadas do modelo

1. Propensity: árvores gradient-boosted

Em dados tabulares de clientes, as árvores com gradient-boosting (XGBoost, LightGBM, CatBoost) permanecem o padrão de produção. Elas lidam com tipos mistos e dados em falta, treinam em minutos e atingem a maior parte do seu teto de qualidade com pouca otimização. Os modelos de sequência justificam o seu custo apenas onde a ordem dos eventos carrega mais sinal do que a contagem de eventos, tipicamente longos rastos comportamentais em streaming e gaming.

2. Uplift: meta-learners

A propensão responde quem é provável que converta, sofra churn ou faça upgrade. Não responde se a ação muda alguma coisa. Essa é uma questão causal, e os padrões práticos são meta-learners: T-learner (modelos separados em tratado e controlo), X-learner (mais estável sob desequilíbrio de tratamento) e R-learner (Neyman-orthogonal, mais robusto a erros de incômodo). Cada um envolve o mesmo motor de árvore impulsionada num quadro causal, então o custo de engenharia de adicionar uplift em cima de uma pipeline de propensão existente é modesto.

O modo de falha a ser observado é a propensão rotulada incorretamente como uplift. Se o topo da lista classificada for dominado por clientes que iriam converter de qualquer forma, o programa está a pagar por um comportamento que já tinha.

3. Ranking sob restrições

A camada de ranking aplica regras de elegibilidade, consentimento, limites de frequência, horas de silêncio, orçamento e canibalização, e depois aplica o argmax. As restrições pertencem aqui, em vez de dentro do modelo: elas mudam semanalmente, são auditáveis e nunca devem ser mascaradas como pesos aprendidos.

Contextual bandits e quando eles ajudam

Os contextual bandits alocam o tráfego entre ações enquanto aprendem, o que é útil quando o conjunto candidato muda constantemente e as recompensas chegam rapidamente. São mais fracos quando o horizonte de recompensa é longo, como acontece com a margem de subscrição, e quando você precisa de uma leitura causal clara para as finanças. Um compromisso comum em produção: bandits para variantes criativas e de oferta dentro de uma ação, modelos de uplift para qual ação escolher, e um holdout preservado sobre ambos.

Validando o modelo

  1. 1Offline: Qini and uplift curves. AUC valida propensity, não decisioning. Use o coeficiente Qini e as curvas uplift-at-k numa amostra aleatória hold-out para verificar se os principais decis realmente carregam o efeito do tratamento.
  2. 2Feature freezing. Calcule cada recurso no momento da decisão. Qualquer vazamento de informações após a decisão infla as métricas offline por uma ampla margem e produz um modelo que falha silenciosamente em produção.
  3. 3Online: a preserved holdout. Mantenha aleatoriamente 5 a 15 por cento dos clientes elegíveis por decisão e leia o tratado menos o holdout na margem incremental. Este é o único número que sobrevive a uma revisão do CFO.
  4. 4Decay monitoring. O uplift diminui mais rapidamente do que a propensão, porque a base se adapta ao tratamento. Retreine numa cadência fixa e mantenha uma fatia aleatória permanente para reestimar os efeitos.

Uma sequência de construção realista

Semanas 1 a 4: enumere o conjunto de candidate actions e atribua uma margem a cada uma, depois implemente uma linha de base de propensão com um holdout. Semanas 5 a 10: adicione um T-learner ou X-learner nas duas ou três actions de maior volume e altere o ranking da propensão para a margem incremental esperada. Semanas 11 em diante: estenda o conjunto de candidate actions, adicione restrições e deixe a ação nula competir. A maior parte do lift chega na segunda fase, quando o objetivo muda e não quando o algoritmo o faz.

Para saber como os modelos se inserem no ciclo operacional mais amplo, consulte o guia para Next Best Action, e para a versão específica de retenção da mesma stack, consulte previsão de abandono de cliente.


Markin constrói e retreina as camadas de propensão, uplift e ranking contra a sua base, e lê cada decisão contra um holdout preservado. Explore Next best action para ver ao vivo.

Perguntas frequentes

Perguntas que os leitores fazem sobre isto.

O que é um modelo de next best action?
Um modelo next best action é a scoring stack que estima, para um cliente num determinado momento, o valor incremental esperado de cada ação elegível, incluindo não fazer nada, e as classifica. Combina uma camada de propensão, uma camada de uplift e uma camada de ranking restrito.
Que algoritmos são usados para next best action?
Árvores impulsionadas por gradiente (XGBoost, LightGBM, CatBoost) para propensão em dados tabulares; meta-learners de uplift como T-learner, X-learner e R-learner para efeito causal; e uma camada de classificação argmax restrita para a decisão final. Os bandits contextuais são úteis para alocação a nível de variante dentro de uma ação.
Qual é a diferença entre um modelo de propensão e um uplift model?
A propensão estima a probabilidade de um resultado para um cliente. O uplift estima o quanto uma ação específica altera esse resultado. Classificar por propensão gasta o orçamento em clientes que teriam convertido de qualquer forma; classificar por uplift gasta-o onde a ação faz a diferença.
Como você valida um modelo de next best action?
Offline, com coeficientes Qini e curvas uplift-at-k numa amostra randomizada de holdout, com todas as funcionalidades congeladas no momento da decisão. Online, com um holdout preservado de 5 a 15 por cento dos clientes elegíveis, lendo a margem incremental tratada menos holdout por decisão.
Com que frequência os modelos de uplift devem ser retreinados?
Mais frequentemente do que os modelos de propensão. Os efeitos do tratamento diminuem à medida que a base se adapta ao tratamento, por isso, mantenha uma fatia aleatória permanente para reestimar os efeitos e retreinar numa cadência fixa, em vez de apenas quando a precisão diminui.

Ver no produto

Isto funciona em Markin hoje.

Os mesmos loops que esta nota descreve são executados 24 horas por dia, 7 dias por semana, na sua base de clientes. Veja o espaço de trabalho decidir, experimentar e executar 1:1.