RESOURCES/Guía
Experimentos de growth controlados: probando que una acción causó el resultado
Un experimento de growth controlado mide lo que una acción causó en lugar de lo que la siguió. Una población elegible se divide en tratamiento y control aleatorizado, se fijan de antemano una métrica primaria y una ventana de observación, las métricas de protección previenen daños y la lectura se resuelve en una de tres decisiones: escalar, refinar o detener.
La mayoría de los informes de crecimiento no son evidencia
Un informe de campaña le dice lo que hicieron los clientes tratados. No puede decirle lo que habrían hecho de todos modos, y en una gran base B2C la mayoría de ellos habrían hecho mucho de todos modos. La brecha entre esos dos números es toda la cuestión, y generalmente se deja sin medir porque medirla significa retener deliberadamente la acción de alguien.
- Los ingresos atribuidos cuentan los clientes que iban a convertir de todos modos.
- Las comparaciones pre y post absorben la estacionalidad, los cambios de precios y la combinación de tráfico.
- El uplift sin un control es una descripción del grupo tratado, no un efecto.
Las seis cosas arregladas antes de que se ejecute un experimento
Cada una de ellas se anota antes de tratar al primer cliente. Decidir cualquiera de ellas después convierte un experiment en una historia.
01
Población elegible
Quién podría recibir esta acción. Todo se mide dentro de esta población, no en toda la base.
02
Tratamiento y control
Asignación aleatoria dentro de la población elegible. El control no recibe ninguna acción, no una acción diferente, a menos que la pregunta sea explícitamente una comparación entre dos acciones.
03
Métrica principal
Una métrica, elegida de antemano, al nivel que realmente le importa al negocio: margen incremental o ingresos por cliente elegible, no tasa de apertura.
04
Ventana de observación
Lo suficientemente largo como para capturar el comportamiento y cualquier efecto de adelanto. Una ventana que se detiene en el primer número bueno mide el momento, no el valor.
05
Guardrails
Métricas que pueden detener el experimento independientemente del resultado principal: márgenes mínimos, tasas de cancelación de suscripción, volumen de quejas, carga de soporte.
06
Regla de decisión
Qué resultado conduce a escalar, refinar o detener, acordado antes de que nadie vea los datos.
La lectura: escalar, refinar o detener
| Resultado | Qué significa | Decisión |
|---|---|---|
| Claro efecto positivo en la métrica principal, con las salvaguardas intactas | La acción vale más que no hacer nada para esta población. | Escalar, manteniendo un holdout permanente más pequeño para detectar el deterioro. |
| Positivo en un subgrupo, plano en general | La población elegible era demasiado amplia, no que la acción fuera incorrecta. | Refinar la población y volver a ejecutar en lugar de escalar tal cual. |
| Plano o no concluyente con potencia adecuada | La acción no mueve la métrica a este coste. | Detener. Este es un resultado barato y normal, no un fracaso. |
| Poco potente, dirección poco clara | La base o la ventana no pudieron soportar la pregunta. | Detener o rediseñar. No escalar con una lectura direccional. |
| Métrica principal al alza, se ha superado un límite (guardrail) | La ganancia se está pagando en otro lugar. | Detener, luego volver a probar con la restricción incluida en el precio. |
Por qué la disciplina vale el coste de un holdout
BCG informa que entre el 20 % y el 40 % del uplift medido de next best action no sobrevive a una prueba de incrementality. Ese es el tamaño del error contra el que te protege un control group.
Investigación independienteBCG, incrementalidad en programas de personalización (2026)
Antes de llamar a un resultado, un resultado
- ¿El control fue aleatorizado dentro de la población elegible, o se seleccionó después?
- ¿Se eligió la métrica principal antes de que llegaran los datos?
- ¿La ventana de observación fue lo suficientemente larga como para ver la reversión del arrastre de la demanda?
- ¿Habría detectado el experimento un efecto digno de acción, dado el tamaño de la base?
- ¿Se movió algún guardrail mientras la métrica principal mejoraba?
- ¿Es la regla de decisión la que se acordó al principio?
Cuándo un Experimento controlado es el instrumento incorrecto
- Poblaciones demasiado pequeñas para alcanzar potencia en una ventana razonable. El juicio y la evidencia cualitativa superan a una prueba con poca potencia.
- Cambios que no pueden ser retenidos ética o legalmente, como una corrección de seguridad o un aviso reglamentario.
- Cambios estructurales puntuales sin un grupo de control comparable, donde un método de series temporales o de mercado emparejado es más honesto.
- Preguntas sobre por qué algo sucede. Un experimento mide el efecto, no el mecanismo.
Markin es un equipo autónomo de growth-science para grandes empresas B2C. Investiga por qué el ingreso por cliente está estancado, forma sus propias hipótesis en marketing, producto, precios y salud técnica, elige la Next Best Action para cada cliente, la lanza a través de los sistemas que la empresa ya gestiona, y prueba cada una frente a un holdout aleatorizado.
Las herramientas de toma de decisiones eligen entre las acciones que tu equipo ya ha desarrollado. Markin decide qué construir.
Preguntas que hace la gente
- ¿Qué hace que un experimento de growth sea controlado?
- Un grupo de control aleatorizado extraído de la misma población elegible, una métrica primaria y una ventana de observación fijadas antes de que se ejecute la prueba, y métricas de seguridad que pueden detenerla. Sin asignación aleatoria dentro de la población elegible, las diferencias entre los grupos explican el resultado tan bien como lo hace la acción.
- ¿Qué tamaño debe tener un holdout?
- Lo suficientemente grande como para detectar el efecto más pequeño que valga la pena actuar, y no más. Los holdout sobredimensionados cuestan ingresos reales; los subdimensionados producen un número sobre el que nadie puede actuar, lo que cuesta más. El tamaño se deriva de la base, la tasa de conversión de referencia y el tamaño del efecto sobre el que se escalaría.
- ¿Un resultado plano es un experimento desperdiciado?
- No. Un resultado plano con suficiente potencia te dice que no inviertas en esa acción, lo cual es una decisión con valor real. El resultado costoso es escalar algo que nunca funcionó, que es exactamente lo que sucede cuando no hay control.
Comparar
Cómo esto se compara con las categorías que ya compras.
Neutral, side by side reads on where the decision layer sits next to the tools in your stack.
Todas las comparaciones- Markin vs. Optimizely: ejecutar pruebas vs. decidir qué probarOptimizely ejecuta los experimentos que tú diseñas. Markin decide qué experimentos vale la pena ejecutar, los dimensiona en ingresos y compara cada uno con un holdout.
- Markin vs. desarrollarlo internamente: lo que un equipo puede lanzar de forma realistaConstruir una capa de decisioning internamente es posible y a veces lo correcto. Una comparación honesta de rendimiento, costo, propiedad y tiempo hasta un número verificado.
- Next-Best Action vs. Next-Best OpportunityNext-Best Opportunity cuantifica lo que está en juego para un cliente. Next-Best Action elige el tratamiento. Por qué el orden importa y cómo se conectan los dos.
Seguir leyendo
Cómo se mide la incrementalidad
El método completo, incluyendo las opciones de ventana y barandilla.
Arbitraje de acción del cliente
Qué se está probando cuando varias acciones compiten.
Estándares de evidencia
Lo que un resultado debe satisfacer antes de que lo publiquemos.
Experimentación vs. toma de decisiones continua
Donde termina un programa de pruebas y comienza un sistema de decisión.
Vocabulario
Los términos en los que se basa esta guía.
Each one is defined on its own page, precisely enough to quote.
- ARPUARPU, average revenue per user, is total revenue in a period divided by the average number of active users in that period.
- ARPAARPA, average revenue per account, is revenue divided by the number of accounts rather than individual users.
- ARPPUARPPU, average revenue per paying user, divides revenue only by users who paid in the period.
- Lifetime valueLifetime value is the discounted margin a business expects from a customer over the whole relationship.
- Ratio LTV:CACThe LTV:CAC ratio divides expected customer lifetime value by fully loaded customer acquisition cost.
- Período de recuperaciónPayback period is the time taken for the gross margin generated by a customer to repay the cost of acquiring them.
