Validación Cruzada
La validación cruzada es una técnica de remuestreo que estima cómo generalizará un modelo a datos no vistos reutilizando los disponibles. Su método estrella, la validación de k pliegues, sirve para comparar modelos, ajustar hiperparámetros y detectar el sobreajuste.
La validación cruzada (cross-validation) es una técnica de remuestreo que estima cómo de bien generalizará un modelo a datos que no ha visto, reutilizando de forma ordenada los datos disponibles. En vez de evaluarlo con los mismos ejemplos usados para ajustarlo, reserva por turnos una parte para validación y entrena con el resto.
Su ventaja inmediata es reducir la dependencia de un único reparto entrenamiento/prueba: cada observación puede participar en entrenamiento y en validación, pero nunca en ambos papeles dentro del mismo pliegue. Eso no vuelve infalible la estimación. Bengio y Grandvalet demostraron en 2004 que no existe un estimador universal e insesgado de la varianza de la validación de k pliegues; los errores de los pliegues están correlacionados porque sus conjuntos de entrenamiento se solapan. En el recorrido histórico, Stone aplicó en 1974 un criterio generalizado de validación cruzada a la elección y evaluación de predicciones en estimación, regresión y análisis de varianza.
La validación de k pliegues y sus variantes
En la validación cruzada de k pliegues (k-fold), los datos se separan en k bloques; el modelo se ajusta con k−1 y se evalúa en el restante. El turno se repite hasta que cada bloque ha quedado fuera una vez y las k puntuaciones se resumen. El número de pliegues no es una ley natural. En su experimento de 1995, basado en más de medio millón de ejecuciones de C4.5 y Naive Bayes, Ron Kohavi recomendó diez pliegues estratificados para conjuntos de datos semejantes a los que estudió; el propio alcance del paper impide convertir ese resultado en una receta universal.
En dejar uno fuera (leave-one-out, LOO), k coincide con el número de observaciones. Entrena con n−1 observaciones, pero exige un ajuste por observación y no garantiza una estimación más fiable: Kohavi recoge su alta variabilidad. La variante estratificada conserva aproximadamente la proporción de clases en cada pliegue; en los experimentos del mismo estudio redujo ligeramente sesgo y varianza frente al reparto no estratificado.
Para qué sirve: selección de modelo e hiperparámetros
La validación cruzada permite comparar algoritmos, elegir hiperparámetros y estimar error fuera de muestra. Pero esas funciones no deben confundirse. Si se prueban muchas configuraciones y se publica como rendimiento final la mejor puntuación obtenida en esos mismos pliegues, la búsqueda puede sobreajustar el criterio de selección. Cawley y Talbot mostraron que este sesgo puede ser comparable a las diferencias medidas entre algoritmos.
La validación cruzada anidada separa ambos trabajos: el bucle interior elige hiperparámetros y el exterior evalúa el procedimiento completo. En simulaciones con clasificadores de centroides reducidos y máquinas de vectores de soporte, Varma y Simon encontraron que reutilizar la validación para ajustar y evaluar producía estimaciones sesgadas, mientras que el esquema anidado se acercaba al error medido en un conjunto independiente.
Errores a evitar: fuga de datos y series temporales
La fuga de datos aparece cuando el proceso de entrenamiento usa información que no estaría disponible al predecir. Normalizar, imputar o seleccionar variables con el conjunto completo antes de crear los pliegues deja que la parte de validación influya en el modelo. La documentación oficial de scikit-learn muestra la regla operativa: ajustar cada transformación sólo con el subconjunto de entrenamiento; una tubería permite repetir ese ajuste dentro de cada pliegue.
Las series temporales exigen que el reparto represente el uso real y respete las dependencias relevantes. Barajar sin criterio puede mezclar información futura con el pasado, pero tampoco existe un único esquema válido para toda serie. Bergmeir y Benítez compararon seis procedimientos y propusieron una forma bloqueada de validación cruzada para aprovechar los datos sin ignorar el orden y la dependencia. La pregunta correcta no es «¿cuántos pliegues uso?», sino «¿qué observaciones conocerá el modelo cuando deba predecir?».
Piezas que usan este término
- Métricas de aprendizaje automático: elegir el error que importa (2023-05-09)
- Preprocesar sin filtrar el futuro: la regla fit/transform (2023-05-09)
- Validación cruzada: cómo elegir un modelo sin entrenar con el examen (2023-05-09)
- Ingeniería de características: métodos y buenas prácticas (2023-05-09)
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.