Definición
Procedimiento estadístico para estimar el rendimiento fuera de muestra de un modelo predictivo al particionar los datos observados en subconjuntos complementarios de entrenamiento y evaluación de forma repetida; incluye variantes k-fold, leave-one-out, rolling-origin y estratificadas adaptadas a distintas estructuras de datos.

Principio

Principio
Aislar el ajuste del modelo de su evaluación para que la métrica medida se aproxime al comportamiento en datos no vistos; usar particiones repetidas e independientes para reducir la varianza y detectar sobreajuste.

Demostración

Demostración
En scoring crediticio, una validación cruzada k-fold estratificada entrena un clasificador en 9 folds y evalúa en el fold retenido, repitiendo para estimar el AUC medio y su variabilidad; para previsión del PIB, la validación cruzada con origen rodante preserva el orden temporal para evaluar el rendimiento según horizonte de pronóstico.

Aplicación incorrecta

Aplicación incorrecta
Aplicar k-fold aleatorio a una serie temporal sin preservar el orden temporal, filtrando información futura al entrenamiento; realizar preprocesamiento (selección de variables, normalización) sobre todo el conjunto antes de particionar, lo que produce estimaciones optimistas.

Consecuencia

Consecuencia
Produce estimaciones de generalización más fiables y menos sesgadas que una única partición entrenamiento/prueba, orientando la selección de hiperparámetros y la comparación de modelos con incertidumbre cuantificada.

Inversión

Inversión
Evaluar un modelo solo por su ajuste in-sample o por un único holdout arbitrario conduce a estimaciones de rendimiento optimistas o inestables y aumenta el riesgo de elegir modelos sobreajustados.

Límite

Límite
Se aplica a la evaluación de modelos predictivos, no a la identificación causal; requiere que los folds de validación se construyan de forma coherente con el caso de uso de producción (por ejemplo, estructura temporal, desbalance de clases); no corrige por sí sola sesgos de selección de muestra ni cambios de distribución.

Tensión semántica

Tensión semántica
A menudo se confunde con una única división de validación o con bootstrap; a diferencia de una validación externa en datos nuevos, la validación cruzada reutiliza la misma muestra observada y asume su representatividad y la independencia apropiada a la variante empleada.

Síntesis

Síntesis
La validación cruzada es un protocolo repetible que estima el rendimiento predictivo esperado de un modelo al particionar los datos en conjuntos de entrenamiento y validación de forma que reflejen el contexto de despliegue, reduciendo el riesgo de sobreajuste y orientando la selección de modelo.