IA 360
Glosario Inteligencia Artificial

Validación Cruzada

La validación cruzada es una técnica de remuestreo que estima cómo generalizará un modelo a datos no vistos reutilizando los disponibles. Su método estrella, la validación de k pliegues, sirve para comparar modelos, ajustar hiperparámetros y detectar el sobreajuste.

Admin IA360 Generado con IA Read in English
Validación Cruzada

La validación cruzada (cross-validation) es una técnica de remuestreo que estima cómo de bien generalizará un modelo a datos que no ha visto, reutilizando de forma ordenada los datos disponibles. En vez de evaluarlo con los mismos ejemplos usados para ajustarlo, reserva por turnos una parte para validación y entrena con el resto.

Su ventaja inmediata es reducir la dependencia de un único reparto entrenamiento/prueba: cada observación puede participar en entrenamiento y en validación, pero nunca en ambos papeles dentro del mismo pliegue. Eso no vuelve infalible la estimación. Bengio y Grandvalet demostraron en 2004 que no existe un estimador universal e insesgado de la varianza de la validación de k pliegues; los errores de los pliegues están correlacionados porque sus conjuntos de entrenamiento se solapan. En el recorrido histórico, Stone aplicó en 1974 un criterio generalizado de validación cruzada a la elección y evaluación de predicciones en estimación, regresión y análisis de varianza.

La validación de k pliegues y sus variantes

En la validación cruzada de k pliegues (k-fold), los datos se separan en k bloques; el modelo se ajusta con k−1 y se evalúa en el restante. El turno se repite hasta que cada bloque ha quedado fuera una vez y las k puntuaciones se resumen. El número de pliegues no es una ley natural. En su experimento de 1995, basado en más de medio millón de ejecuciones de C4.5 y Naive Bayes, Ron Kohavi recomendó diez pliegues estratificados para conjuntos de datos semejantes a los que estudió; el propio alcance del paper impide convertir ese resultado en una receta universal.

En dejar uno fuera (leave-one-out, LOO), k coincide con el número de observaciones. Entrena con n−1 observaciones, pero exige un ajuste por observación y no garantiza una estimación más fiable: Kohavi recoge su alta variabilidad. La variante estratificada conserva aproximadamente la proporción de clases en cada pliegue; en los experimentos del mismo estudio redujo ligeramente sesgo y varianza frente al reparto no estratificado.

Para qué sirve: selección de modelo e hiperparámetros

La validación cruzada permite comparar algoritmos, elegir hiperparámetros y estimar error fuera de muestra. Pero esas funciones no deben confundirse. Si se prueban muchas configuraciones y se publica como rendimiento final la mejor puntuación obtenida en esos mismos pliegues, la búsqueda puede sobreajustar el criterio de selección. Cawley y Talbot mostraron que este sesgo puede ser comparable a las diferencias medidas entre algoritmos.

La validación cruzada anidada separa ambos trabajos: el bucle interior elige hiperparámetros y el exterior evalúa el procedimiento completo. En simulaciones con clasificadores de centroides reducidos y máquinas de vectores de soporte, Varma y Simon encontraron que reutilizar la validación para ajustar y evaluar producía estimaciones sesgadas, mientras que el esquema anidado se acercaba al error medido en un conjunto independiente.

Errores a evitar: fuga de datos y series temporales

La fuga de datos aparece cuando el proceso de entrenamiento usa información que no estaría disponible al predecir. Normalizar, imputar o seleccionar variables con el conjunto completo antes de crear los pliegues deja que la parte de validación influya en el modelo. La documentación oficial de scikit-learn muestra la regla operativa: ajustar cada transformación sólo con el subconjunto de entrenamiento; una tubería permite repetir ese ajuste dentro de cada pliegue.

Las series temporales exigen que el reparto represente el uso real y respete las dependencias relevantes. Barajar sin criterio puede mezclar información futura con el pasado, pero tampoco existe un único esquema válido para toda serie. Bergmeir y Benítez compararon seis procedimientos y propusieron una forma bloqueada de validación cruzada para aprovechar los datos sin ignorar el orden y la dependencia. La pregunta correcta no es «¿cuántos pliegues uso?», sino «¿qué observaciones conocerá el modelo cuando deba predecir?».

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar