RESOURCES/Guide
Expérimentations de growth contrôlées : prouver qu'une action a causé le résultat
Une expérimentation de growth contrôlée mesure ce qu'une action a causé plutôt que ce qui l'a suivie. Une population éligible est divisée en traitement et en groupe de contrôle randomisé, une métrique primaire et une fenêtre d'observation sont fixées à l'avance, des métriques de garde-fou protègent contre les dommages, et le résultat aboutit à l'une des trois décisions : échelle, affinement ou arrêt.
Román Via-Dufresne, Co-fondateur, Markin
Mis à jour 7 August 2026 · 9 min de lecture
Demander une démoLa plupart des rapports de croissance ne sont pas des preuves
Un rapport de campagne te dit ce qu'ont fait les clients traités. Il ne peut pas te dire ce qu'ils auraient fait de toute façon, et dans une large base B2C, la plupart d'entre eux auraient de toute façon fait beaucoup. L'écart entre ces deux chiffres est toute la question, et il est généralement laissé non mesuré car le mesurer signifie délibérément refuser l'action à quelqu'un.
- Le revenu attribué compte les clients qui allaient se convertir de toute façon.
- Les comparaisons avant et après absorbent la saisonnalité, les changements de prix et la composition du trafic.
- L'uplift sans contrôle est une description du groupe traité, pas un effet.
Les six choses à corriger avant l'exécution d'une expérimentation
Chacune d'entre elles est consignée avant même que le premier client ne soit traité. Décider de l'une d'entre elles après coup transforme une expérimentation en une histoire.
01
Population éligible
Qui pourrait recevoir cette action. Tout est mesuré au sein de cette population, et non sur l'ensemble de la base.
02
Traitement et contrôle
Affectation aléatoire au sein de la population éligible. Le groupe de contrôle ne reçoit aucune action, pas une action différente, à moins que la question ne soit explicitement une comparaison entre deux actions.
03
Métrique primaire
Une métrique, choisie à l'avance, au niveau qui intéresse réellement l'entreprise : marge incrémentale ou revenu par client éligible, pas le taux d'ouverture.
04
Fenêtre d'observation
Suffisamment long pour capturer le comportement et tout effet d'anticipation. Une fenêtre qui s'arrête au premier bon chiffre mesure le timing, pas la valeur.
05
Gardes-fou
Métriques pouvant arrêter l'expérimentation quel que soit le résultat primaire : planchers de marge, taux de désabonnement, volume de plaintes, charge du support.
06
Règle de décision
Quel résultat mène à la mise à l'échelle, à l'affinage ou à l'arrêt, convenu avant que quiconque ne voie les données.
Le bilan : échelle, affiner ou arrêter
| Résultat | Ce que cela signifie | Décision |
|---|---|---|
| Effet positif clair sur la métrique principale, garde-fous intacts | L'action a plus de valeur que l'inaction pour cette population. | Mettre à l'échelle, en maintenant un petit holdout permanent pour détecter la dégradation. |
| Positif dans un sous-groupe, stable globalement | La population éligible était trop large, l'action n'était pas erronée. | Affiner la population et relancer plutôt que de scaler en l'état. |
| Plat ou non concluant avec une puissance adéquate | L'action n'influe pas sur la métrique à ce coût. | Arrêter. C'est un résultat normal et peu coûteux, pas un échec. |
| Sous-alimenté, direction incertaine | La base ou la fenêtre n'ont pas pu prendre en charge la question. | Arrêter ou reconcevoir. Ne pas généraliser sur une lecture directionnelle. |
| Métrique primaire en hausse, un garde-fou franchi | Le gain est payé ailleurs. | Arrêter, puis retester avec la contrainte prise en compte. |
Pourquoi la discipline vaut le coût d'un holdout
BCG rapporte qu'entre 20 % et 40 % de l'uplift mesuré du next best action ne résiste pas à un test d'incrementality. C'est l'ampleur de l'erreur contre laquelle un groupe de contrôle te protège.
Recherche indépendanteBCG, incrementality in personalisation programmes (2026)
Avant de considérer un résultat comme tel
- Le groupe de contrôle a-t-il été randomisé au sein de la population éligible, ou choisi après coup ?
- La métrique primaire a-t-elle été choisie avant l'arrivée des données ?
- La fenêtre d'observation a-t-elle été suffisamment longue pour voir l'effet de report s'inverser ?
- L'expérimentation aurait-elle détecté un effet suffisamment significatif pour agir, étant donné la taille de la base ?
- Une garde-fou a-t-elle bougé alors que la métrique primaire s'améliorait ?
- La règle de décision est-elle celle qui a été convenue au départ ?
Quand une expérimentation contrôlée n'est pas l'instrument approprié
- Populations trop petites pour atteindre une puissance statistique dans une fenêtre raisonnable. Le jugement et les preuves qualitatives l'emportent sur un test sous-alimenté.
- Changements qui ne peuvent être éthiquement ou légalement retenus, comme un correctif de sécurité ou un avis réglementaire.
- Changements structurels ponctuels sans groupe de contrôle comparable, où une méthode de séries temporelles ou de marchés appariés est plus honnête.
- Des questions sur les raisons pour lesquelles quelque chose se produit. Une expérimentation mesure l'effet, pas le mécanisme.
Markin est une équipe growth-science autonome pour les grandes entreprises B2C. Il investigue pourquoi les revenus par client sont bloqués, formule ses propres hypothèses à travers le marketing, le produit, la tarification et la santé technique, choisit la Next Best Action pour chaque client, la lance via les systèmes que l'entreprise utilise déjà, et prouve chacune d'entre elles par rapport à un holdout randomisé.
Les outils de decisioning choisissent parmi les actions que ton équipe a déjà mises en place. Markin décide ce qu'il faut construire.
Questions que les gens se posent
- Qu'est-ce qui rend une expérimentation de growth contrôlée ?
- Un groupe de contrôle randomisé issu de la même population éligible, une métrique primaire et une fenêtre d'observation fixées avant l'exécution du test, et des métriques de garde-fou qui peuvent l'arrêter. Sans assignation aléatoire au sein de la population éligible, les différences entre les groupes expliquent le résultat aussi bien que l'action.
- Quelle devrait être la taille d'un holdout ?
- Suffisamment grand pour détecter le plus petit effet qui mérite d'être pris en compte, et pas plus. Les holdouts surdimensionnés coûtent de réels revenus ; ceux sous-dimensionnés produisent un chiffre sur lequel personne ne peut agir, ce qui coûte plus cher. La taille découle de la base, du taux de conversion de référence et de la taille de l'effet que tu souhaiterais faire évoluer.
- Un résultat plat est-il une expérimentation gaspillée ?
- Non. Un résultat stable avec une puissance adéquate t'indique de ne pas investir dans cette action, ce qui est une décision de réelle valeur. Le résultat coûteux est la mise à l'échelle de quelque chose qui n'a jamais fonctionné, ce qui est exactement ce qui se passe lorsqu'il n'y a pas de contrôle.
Comparer
Comment cela se présente par rapport aux catégories que tu achètes déjà.
Neutral, side by side reads on where the decision layer sits next to the tools in your stack.
Toutes les comparaisons- Markin vs Optimizely : exécuter des tests vs décider quoi testerOptimizely exécute les expérimentations que tu conçois. Markin décide quelles expérimentations valent la peine d'être exécutées, les évalue en revenus, et lit chacune d'entre elles par rapport à un holdout.
- Markin vs le développement interne : ce qu'une équipe peut réellement livrerConstruire une couche de décision en interne est possible et parfois la bonne solution. Une comparaison honnête du débit, du coût, de la propriété et du temps jusqu'à un chiffre vérifié.
- Next-Best Action vs. Next-Best OpportunityNext-Best Opportunity quantifie l'enjeu pour un client. Next-Best Action choisit le traitement. Pourquoi l'ordre est important et comment les deux se connectent.
Continuer la lecture
Comment l'incrémentalité est mesurée
La méthode complète, incluant les choix de fenêtre et de garde-fou.
Arbitrage d'actions client
Qu'est-ce qui est testé lorsque plusieurs actions sont en concurrence ?
Normes de preuve
Ce qu'un résultat doit satisfaire avant que nous le publions.
Expérimentation versus décision continue
Quand un programme de test se termine et qu'un système de décision commence.
Vocabulaire
Les termes sur lesquels ce guide s'appuie.
Each one is defined on its own page, precisely enough to quote.
- ARPUARPU, average revenue per user, is total revenue in a period divided by the average number of active users in that period.
- ARPAARPA, average revenue per account, is revenue divided by the number of accounts rather than individual users.
- ARPPUARPPU, average revenue per paying user, divides revenue only by users who paid in the period.
- Lifetime valueLifetime value is the discounted margin a business expects from a customer over the whole relationship.
- Ratio LTV:CACThe LTV:CAC ratio divides expected customer lifetime value by fully loaded customer acquisition cost.
- Période de recouvrementPayback period is the time taken for the gross margin generated by a customer to repay the cost of acquiring them.
