Reinforcement learning für marketing
Auch genannt: Contextual bandits
Reinforcement learning behandelt Kundenentscheidungen als eine Sequenz und optimiert die kumulative langfristige Belohnung anstelle des nächsten Klicks. Im marketing erscheint es normalerweise als kontextbezogene Banditen, die das Ausnutzen der derzeit besten Aktion mit dem Erforschen von Alternativen, die besser sein könnten, ausbalancieren.
Warum es für ARPU wichtig ist
Sequenzen sind wichtig für ARPU: Die Aktion, die diesen Monat maximiert, kann das nächste Quartal unterdrücken. Die Optimierung der Trajektorie unterscheidet lifetime value von kurzfristiger Conversion.
Verwandte Begriffe
Multi-armed banditEin multi-armed bandit verteilt den Traffic adaptiv auf gut abschneidende Varianten, während er weiterhin andere Varianten stichprobenartig testet.Next Best ActionNext best action ist die einzelne Intervention, die den erwarteten Wert für einen bestimmten Kunden zu einem bestimmten Zeitpunkt maximiert, ausgewählt aus allen verfügbaren Optionen, einschließlich nichts zu tun.Uplift ModellEin uplift model schätzt die Veränderung des Outcomes, die durch die Behandlung eines Kunden verursacht wird, anstatt des Outcomes selbst.Lifetime valueLifetime value ist die diskontierte Marge, die ein Unternehmen von einem Kunden über die gesamte Geschäftsbeziehung erwartet.