Définition
Procédure statistique qui estime la performance hors-échantillon d'un modèle prédictif en repartissant les données observées en sous-ensembles complémentaires d'entraînement et d'évaluation de manière répétée ; comprend les variantes k-fold, leave-one-out, rolling-origin et stratifiées adaptées aux structures de données différentes.

Principe

Principe
Séparer l'ajustement du modèle de son évaluation pour que la performance mesurée reflète le comportement attendu sur des données non vues ; répéter des partitionnements indépendants pour réduire la variance et détecter le surapprentissage.

Démonstration

Démonstration
En notation de crédit, une validation croisée k-fold stratifiée entraîne un classificateur sur 9 folds et mesure la performance sur le fold retenu, en répétant sur les folds pour estimer l'AUC moyenne et sa variabilité ; pour la prévision du PIB, la validation croisée en origine glissante préserve l'ordre temporel pour évaluer la performance aux horizons de prévision.

Mauvaise application

Mauvaise application
Appliquer une validation croisée k-fold aléatoire à une série temporelle sans préserver l'ordre, laissant fuiter des informations futures dans l'entraînement ; effectuer un prétraitement (sélection de variables, normalisation) sur l'ensemble complet avant le découpage, ce qui induit un biais optimiste.

Conséquence

Conséquence
Fournit des estimations de généralisation plus fiables et moins biaisées que des séparations entraînement/test uniques, et oriente la sélection d'hyperparamètres et la comparaison de modèles avec une incertitude quantifiée.

Inversion

Inversion
Évaluer un modèle uniquement sur l'ajustement intra-échantillon ou sur un seul jeu de validation arbitraire conduit à des estimations de performance optimistes ou instables et augmente le risque de choisir des modèles surajustés.

Limite

Limite
S'applique à l'évaluation de modèles prédictifs, pas à l'identification causale ; exige que les folds de validation soient tirés d'une manière cohérente avec le contexte de déploiement (p. ex. structure temporelle, déséquilibre des classes) ; ne corrige pas en soi les biais de sélection d'échantillon ou les changements de distribution.

Tension sémantique

Tension sémantique
Souvent confondue avec une simple séparation de validation ou avec le bootstrap ; contrairement à une validation externe sur de nouvelles données, la validation croisée réutilise le même échantillon observé et suppose sa représentativité et l'indépendance adaptées à la variante employée.

Synthèse

Synthèse
La validation croisée est un protocole réplicable qui estime la performance prédictive attendue d'un modèle en repartitionnant les données en ensembles d'entraînement et de validation de façon à refléter le contexte d'exploitation visé, réduisant ainsi le risque de surapprentissage et informant la sélection de modèle.