Reinforcement learning para marketing
Também chamado: Contextual bandits
Reinforcement learning trata as decisões do cliente como uma sequência, otimizando a recompensa cumulativa de longo prazo em vez do próximo clique. No marketing, geralmente aparece como contextual bandits, que equilibram a exploração da melhor ação atual com a exploração de alternativas que podem ser melhores.
Por que é importante para o ARPU
As sequências importam para o ARPU: a ação que maximiza este mês pode suprimir o próximo trimestre. Otimizar a trajetória é o que separa o lifetime value da conversão de curto prazo.
Termos relacionados
Multi-armed banditUm multi-armed bandit aloca tráfego adaptativamente para variantes que estão a ter um bom desempenho, enquanto continua a amostrar as outras.Next best actionNext best action é a única intervenção que maximiza o valor esperado para um cliente específico num momento específico, escolhida entre todas as opções disponíveis, incluindo não fazer nada.Modelo de upliftUm uplift model estima a alteração no resultado causada pelo tratamento de um cliente, em vez do resultado em si.Lifetime valueLifetime value é a margem descontada que uma empresa espera de um cliente ao longo de todo o relacionamento.