Definición
Experimento controlado aleatorizado que asigna unidades (usuarios, sesiones, mercados) a dos o más variantes de un producto o tratamiento para estimar efectos causales de cambios sobre métricas predefinidas como conversión, retención o ingresos.
Principio
Principio
La asignación aleatoria asegura la intercambioabilidad entre variantes de modo que las diferencias en los resultados puedan atribuirse al tratamiento; predefinir métricas, tamaño de muestra y plan de análisis para controlar errores tipo I/II y evitar el peeking impulsado por los datos.
Demostración
Demostración
Un equipo de producto aleatoriza usuarios para mostrarles el flujo de pago existente (A) o uno simplificado (B) y mide la tasa de conversión durante un periodo preespecificado; el análisis estima el efecto promedio del tratamiento sobre la conversión con intervalos de confianza y reglas de parada preregistradas.
Aplicación incorrecta
Aplicación incorrecta
Inspeccionar resultados repetidamente y detener cuando son significativos (optional stopping), no tener en cuenta comparaciones múltiples al probar muchas variantes o asignar usuarios a variantes de forma no aleatoria (p. ej., por tipo de dispositivo), lo que invalida la inferencia causal.
Consecuencia
Consecuencia
Cuando están adecuadamente aleatorizados y analizados, los tests A/B generan estimaciones causales creíbles del impacto de una característica, permitiendo decisiones de producto basadas en datos, despliegues priorizados y medición del valor incremental frente al statu quo.
Inversión
Inversión
Comparar cohortes que se autoseleccionan en distintas experiencias o usar comparaciones observacionales antes/después sin aleatorización produce evidencia asociacional que puede reflejar confounding, selección o tendencias temporales más que efectos de tratamiento.
Límite
Límite
El A/B testing asume unidades estables y ausencia de interferencia entre unidades (SUTVA) y un tamaño de muestra suficiente; no es apropiado cuando los efectos son raros, cuando los cambios producen externalidades en red, o cuando restricciones éticas/legales impiden la aleatorización.
Tensión semántica
Tensión semántica
A veces se confunde con experimentos multivariantes o factoriales y con pruebas bandit/adaptativas; los A/B tests son contrastes aleatorizados simples, mientras que los bandits optimizan la asignación de forma adaptativa y los diseños factoriales estiman efectos de interacción entre diversos factores.
Síntesis
Síntesis
La prueba A/B es el experimento aleatorizado básico en entornos de producto y negocio: aleatorizar unidades comparables entre variantes, medir outcomes predefinidos y analizar bajo el marco de aleatorización para obtener estimaciones causales que orienten el despliegue y la estrategia.