Statistische Power
Statistische Power ist die Wahrscheinlichkeit, dass ein Test einen Effekt einer bestimmten Größe erkennt, wenn dieser Effekt real ist. Sie wird vor dem Launch durch Stichprobengröße, Baseline-Varianz und den minimal erkennbaren Effekt festgelegt, und ein unterpowered Test erzeugt hauptsächlich kostspielige Mehrdeutigkeit.
Wie es berechnet wird
Power = 1 - P(falsch negativ). Konvention: 80 % bei einem Signifikanzniveau von 5 %.
Lege den minimal detektierbaren Effekt zuerst fest. Ihn nach dem Betrachten der Daten zu wählen, invalidiert den Test.
Warum es für ARPU wichtig ist
Die meisten Enterprise growth tests sind underpowered, sodass echte Effekte als nicht schlüssig abgelegt werden und die Organisation langsam aufhört, an Evidenz zu glauben.
Verwandte Begriffe
A/B testEin A/B test weist Kunden zufällig zwei oder mehr Varianten zu und vergleicht eine vorher deklarierte Metrik zwischen ihnen.Sequential testingSequential testing ermöglicht es, Ergebnisse kontinuierlich zu überwachen und frühzeitig zu stoppen, ohne falsche Positive zu erhöhen, indem immer gültige Konfidenzintervalle anstelle einer einzelnen feste-Horizonte-Überprüfung verwendet werden.ExperimentEin Experiment ist die kontrollierte Freigabe einer Kandidatenaktion gegen einen randomisierten holdout, der im Voraus so dimensioniert wurde, dass das Ergebnis einen realen Effekt von Rauschen unterscheiden kann.LeitplankenmetrikEine guardrail metric ist eine Kennzahl, die ein Experiment nicht beschädigen darf, selbst wenn die primäre Kennzahl sich verbessert: unsubscribe rate, Beschwerdevolumen, margin, support-Kontakte, App-Deinstallationen.