Puissance statistique
La puissance statistique est la probabilité qu'un test détecte un effet d'une taille donnée lorsque cet effet est réel. Elle est fixée avant le lancement par la taille de l'échantillon, la variance de base et l'effet minimal détectable, et un test sous-puissant produit principalement une ambiguïté coûteuse.
Comment il est calculé
Puissance = 1 - P(faux négatifs). Convention : 80 % à un niveau de signification de 5 %.
Décide d'abord de l'effet minimal détectable. Le choisir après avoir vu les données invalide le test.
Pourquoi c'est important pour l'ARPU
La plupart des tests de growth en entreprise sont sous-dimensionnés, de sorte que les effets réels sont mis de côté comme non concluants et l'organisation cesse lentement de croire aux preuves.
Termes associés
A/B testUn A/B test attribue aléatoirement des clients à deux variantes ou plus et compare une métrique prédéclarée entre elles.Test séquentielLe test séquentiel permet de surveiller les résultats en continu et d'arrêter tôt sans augmenter les faux positifs, en utilisant des intervalles de confiance toujours valides au lieu d'un seul contrôle à horizon fixe.ExpérimentationUne expérimentation est un déploiement contrôlé d'une action candidate contre un holdout randomisé, dimensionné à l'avance afin que le résultat puisse distinguer un effet réel du bruit.Métrique de garde-fouUne métrique guardrail est une mesure qu'une expérimentation ne doit pas endommager, même si la métrique principale s'améliore : taux de désabonnement, volume de plaintes, marge, contacts support, désinstallations d'applications.