Définition
Expérience contrôlée randomisée qui assigne des unités (utilisateurs, sessions, marchés) à deux variantes ou plus d'un produit ou traitement pour estimer les effets causaux des changements sur des métriques pré-définies telles que conversion, rétention ou revenus.
Principe
Principe
L'assignation aléatoire garantit l'échangeabilité entre variantes afin que les différences de résultat puissent être attribuées au traitement ; pré-spécifier métriques, taille d'échantillon et plan d'analyse pour contrôler erreurs de type I/II et éviter le peeking dirigé par les données.
Démonstration
Démonstration
Une équipe produit randomise les utilisateurs pour qu'ils voient soit le flux de paiement existant (A) soit un paiement simplifié (B) et mesure le taux de conversion pendant une période pré-spécifiée ; l'analyse estime l'effet moyen du traitement sur la conversion avec intervalles de confiance et règles d'arrêt pré-enregistrées.
Mauvaise application
Mauvaise application
Consulter les résultats de façon répétée et arrêter dès qu'ils sont significatifs (arrêt optionnel), ne pas tenir compte des comparaisons multiples lors de tests de nombreuses variantes, ou assigner les utilisateurs aux variantes de manière non aléatoire (p. ex. par type d'appareil), ce qui invalide l'inférence causale.
Conséquence
Conséquence
Lorsque correctement randomisés et analysés, les tests A/B fournissent des estimations causales crédibles de l'impact des fonctionnalités, permettant des décisions produit fondées sur des données, des déploiements prioritaires et la mesure de la valeur incrémentale par rapport au statu quo.
Inversion
Inversion
Comparer des cohortes qui choisissent elles‑mêmes différentes expériences ou utiliser des comparaisons observationnelles avant/après sans randomisation fournit des preuves associatives qui peuvent refléter de la confusion, de la sélection ou des tendances temporelles plutôt que des effets de traitement.
Limite
Limite
Le test A/B suppose des unités stables et l'absence d'interférence entre unités (SUTVA) et une taille d'échantillon suffisante ; il est inadapté lorsque les effets sont rares, lorsque les changements provoquent des externalités en réseau ou lorsque des contraintes éthiques ou juridiques empêchent la randomisation.
Tension sémantique
Tension sémantique
Souvent confondu avec les tests multivariés ou factoriels et avec les approches bandit/adaptatives ; les tests A/B sont des contrastes randomisés simples, tandis que les bandits adaptent l'allocation pour optimiser et les plans factoriels estiment des interactions entre plusieurs facteurs.
Synthèse
Synthèse
Le test A/B est l'expérience randomisée de base dans les environnements produit et business : randomiser des unités comparables entre variantes, mesurer des résultats pré-spécifiés et analyser dans le cadre de la randomisation pour obtenir des estimations causales guidant le déploiement et la stratégie.