Le rapport ROI Markin pour les équipes de Enterprise GrowthLire maintenant
MARKIN

RESOURCES/Guide

Expérimentations de growth contrôlées : prouver qu'une action a causé le résultat

Une expérimentation de growth contrôlée mesure ce qu'une action a causé plutôt que ce qui l'a suivie. Une population éligible est divisée en traitement et en groupe de contrôle randomisé, une métrique primaire et une fenêtre d'observation sont fixées à l'avance, des métriques de garde-fou protègent contre les dommages, et le résultat aboutit à l'une des trois décisions : échelle, affinement ou arrêt.

Román Via-Dufresne, Co-fondateur, Markin

Mis à jour 7 August 2026 · 9 min de lecture

Demander une démo

La plupart des rapports de croissance ne sont pas des preuves

Un rapport de campagne te dit ce qu'ont fait les clients traités. Il ne peut pas te dire ce qu'ils auraient fait de toute façon, et dans une large base B2C, la plupart d'entre eux auraient de toute façon fait beaucoup. L'écart entre ces deux chiffres est toute la question, et il est généralement laissé non mesuré car le mesurer signifie délibérément refuser l'action à quelqu'un.

  • Le revenu attribué compte les clients qui allaient se convertir de toute façon.
  • Les comparaisons avant et après absorbent la saisonnalité, les changements de prix et la composition du trafic.
  • L'uplift sans contrôle est une description du groupe traité, pas un effet.

Les six choses à corriger avant l'exécution d'une expérimentation

Chacune d'entre elles est consignée avant même que le premier client ne soit traité. Décider de l'une d'entre elles après coup transforme une expérimentation en une histoire.

  1. 01

    Population éligible

    Qui pourrait recevoir cette action. Tout est mesuré au sein de cette population, et non sur l'ensemble de la base.

  2. 02

    Traitement et contrôle

    Affectation aléatoire au sein de la population éligible. Le groupe de contrôle ne reçoit aucune action, pas une action différente, à moins que la question ne soit explicitement une comparaison entre deux actions.

  3. 03

    Métrique primaire

    Une métrique, choisie à l'avance, au niveau qui intéresse réellement l'entreprise : marge incrémentale ou revenu par client éligible, pas le taux d'ouverture.

  4. 04

    Fenêtre d'observation

    Suffisamment long pour capturer le comportement et tout effet d'anticipation. Une fenêtre qui s'arrête au premier bon chiffre mesure le timing, pas la valeur.

  5. 05

    Gardes-fou

    Métriques pouvant arrêter l'expérimentation quel que soit le résultat primaire : planchers de marge, taux de désabonnement, volume de plaintes, charge du support.

  6. 06

    Règle de décision

    Quel résultat mène à la mise à l'échelle, à l'affinage ou à l'arrêt, convenu avant que quiconque ne voie les données.

Le bilan : échelle, affiner ou arrêter

RésultatCe que cela signifieDécision
Effet positif clair sur la métrique principale, garde-fous intactsL'action a plus de valeur que l'inaction pour cette population.Mettre à l'échelle, en maintenant un petit holdout permanent pour détecter la dégradation.
Positif dans un sous-groupe, stable globalementLa population éligible était trop large, l'action n'était pas erronée.Affiner la population et relancer plutôt que de scaler en l'état.
Plat ou non concluant avec une puissance adéquateL'action n'influe pas sur la métrique à ce coût.Arrêter. C'est un résultat normal et peu coûteux, pas un échec.
Sous-alimenté, direction incertaineLa base ou la fenêtre n'ont pas pu prendre en charge la question.Arrêter ou reconcevoir. Ne pas généraliser sur une lecture directionnelle.
Métrique primaire en hausse, un garde-fou franchiLe gain est payé ailleurs.Arrêter, puis retester avec la contrainte prise en compte.

Pourquoi la discipline vaut le coût d'un holdout

Avant de considérer un résultat comme tel

  • Le groupe de contrôle a-t-il été randomisé au sein de la population éligible, ou choisi après coup ?
  • La métrique primaire a-t-elle été choisie avant l'arrivée des données ?
  • La fenêtre d'observation a-t-elle été suffisamment longue pour voir l'effet de report s'inverser ?
  • L'expérimentation aurait-elle détecté un effet suffisamment significatif pour agir, étant donné la taille de la base ?
  • Une garde-fou a-t-elle bougé alors que la métrique primaire s'améliorait ?
  • La règle de décision est-elle celle qui a été convenue au départ ?

Quand une expérimentation contrôlée n'est pas l'instrument approprié

  • Populations trop petites pour atteindre une puissance statistique dans une fenêtre raisonnable. Le jugement et les preuves qualitatives l'emportent sur un test sous-alimenté.
  • Changements qui ne peuvent être éthiquement ou légalement retenus, comme un correctif de sécurité ou un avis réglementaire.
  • Changements structurels ponctuels sans groupe de contrôle comparable, où une méthode de séries temporelles ou de marchés appariés est plus honnête.
  • Des questions sur les raisons pour lesquelles quelque chose se produit. Une expérimentation mesure l'effet, pas le mécanisme.

Markin est une équipe growth-science autonome pour les grandes entreprises B2C. Il investigue pourquoi les revenus par client sont bloqués, formule ses propres hypothèses à travers le marketing, le produit, la tarification et la santé technique, choisit la Next Best Action pour chaque client, la lance via les systèmes que l'entreprise utilise déjà, et prouve chacune d'entre elles par rapport à un holdout randomisé.

Les outils de decisioning choisissent parmi les actions que ton équipe a déjà mises en place. Markin décide ce qu'il faut construire.

Questions que les gens se posent

Qu'est-ce qui rend une expérimentation de growth contrôlée ?
Un groupe de contrôle randomisé issu de la même population éligible, une métrique primaire et une fenêtre d'observation fixées avant l'exécution du test, et des métriques de garde-fou qui peuvent l'arrêter. Sans assignation aléatoire au sein de la population éligible, les différences entre les groupes expliquent le résultat aussi bien que l'action.
Quelle devrait être la taille d'un holdout ?
Suffisamment grand pour détecter le plus petit effet qui mérite d'être pris en compte, et pas plus. Les holdouts surdimensionnés coûtent de réels revenus ; ceux sous-dimensionnés produisent un chiffre sur lequel personne ne peut agir, ce qui coûte plus cher. La taille découle de la base, du taux de conversion de référence et de la taille de l'effet que tu souhaiterais faire évoluer.
Un résultat plat est-il une expérimentation gaspillée ?
Non. Un résultat stable avec une puissance adéquate t'indique de ne pas investir dans cette action, ce qui est une décision de réelle valeur. Le résultat coûteux est la mise à l'échelle de quelque chose qui n'a jamais fonctionné, ce qui est exactement ce qui se passe lorsqu'il n'y a pas de contrôle.