Reinforcement learning para marketing
También llamado: Contextual bandits
El reinforcement learning trata las decisiones del cliente como una secuencia, optimizando la recompensa acumulativa a largo plazo en lugar del siguiente clic. En marketing, generalmente aparece como contextual bandits, que equilibran la explotación de la mejor acción actual con la exploración de alternativas que podrían ser mejores.
Por qué es importante para el ARPU
Las secuencias importan para el ARPU: la acción que maximiza este mes puede suprimir el próximo trimestre. Optimizar la trayectoria es lo que separa el lifetime value de la conversión a corto plazo.
Términos relacionados
Bandido multi-brazoUn multi-armed bandit asigna el tráfico de forma adaptativa hacia las variantes que están funcionando bien mientras continúa muestreando las otras.Next Best ActionEl Next Best Action es la única intervención que maximiza el valor esperado para un cliente específico en un momento específico, elegido entre todas las opciones disponibles, incluyendo no hacer nada.Modelo de upliftUn uplift model estima el cambio en el resultado causado por tratar a un cliente, en lugar del resultado en sí.Lifetime valueLifetime value es el margen descontado que una empresa espera de un cliente durante toda la relación.