Reinforcement learning pour le marketing
Aussi appelé: Contextual bandits
Le reinforcement learning traite les décisions des clients comme une séquence, optimisant la récompense cumulative à long terme plutôt que le prochain clic. En marketing, il apparaît généralement sous forme de bandits contextuels, qui équilibrent l'exploitation de la meilleure action actuelle et l'exploration d'alternatives qui pourraient être meilleures.
Pourquoi c'est important pour l'ARPU
Les séquences sont importantes pour l'ARPU : l'action qui maximise ce mois-ci peut nuire au trimestre suivant. L'optimisation de la trajectoire est ce qui sépare la lifetime value de la conversion à court terme.
Termes associés
Multi-armed banditUn bandit manchot alloue le trafic de manière adaptative aux variantes qui fonctionnent bien tout en continuant à échantillonner les autres.Next Best ActionLa next best action est la seule intervention qui maximise la valeur attendue pour un client spécifique à un moment spécifique, choisie parmi toutes les options disponibles, y compris ne rien faire.Modèle d'upliftUn modèle uplift estime le changement de résultat provoqué par le traitement d'un client, plutôt que le résultat lui-même.Lifetime valueLa lifetime value est la marge actualisée qu'une entreprise attend d'un client sur l'ensemble de la relation.