Reinforcement learning per il marketing
Chiamato anche: Contextual bandits
Il reinforcement learning tratta le decisioni del cliente come una sequenza, ottimizzando la ricompensa cumulativa a lungo termine piuttosto che il clic successivo. Nel marketing appare solitamente come contextual bandits, che bilanciano lo sfruttamento dell'azione migliore attuale con l'esplorazione di alternative che potrebbero essere migliori.
Perché è importante per l'ARPU
Le sequenze contano per l'ARPU: l'azione che massimizza questo mese può sopprimere il prossimo trimestre. Ottimizzare la traiettoria è ciò che separa il lifetime value dalla conversione a breve termine.
Termini correlati
Multi-armed banditUn multi-armed bandit alloca il traffico in modo adattivo verso le varianti che stanno performando bene, continuando a campionare le altre.Next Best ActionLa Next Best Action è il singolo intervento che massimizza il valore atteso per un cliente specifico in un dato momento, scelto tra ogni opzione disponibile, incluso non fare nulla.Modello di upliftUn uplift model stima il cambiamento nel risultato causato dal trattamento di un cliente, piuttosto che il risultato stesso.Lifetime valueIl Lifetime value è il margine scontato che un'azienda si aspetta da un cliente durante l'intera relazione.