Validación cruzada: cómo elegir un modelo sin entrenar con el examen
La partición debe imitar el despliegue. Una guía para separar selección, estimación y prueba final sin fugas.
Reeditado el 30 de julio de 2026, este artículo corrige la imagen de una baraja que se reparte al azar y produce «la precisión real». La validación cruzada estima rendimiento bajo una regla de partición. Si la regla no representa cómo llegarán casos nuevos —otra persona, hospital, máquina o fecha—, un promedio impecable puede medir fuga.
También separa dos usos que suelen confundirse. La validación ayuda a elegir modelo, variables e hiperparámetros. Un conjunto de prueba final estima después el procedimiento elegido. Usar los mismos folds para buscar y anunciar rendimiento hace que la evaluación participe en el entrenamiento, aunque ningún gradiente la toque.
Qué pregunta responde una partición
La unidad de independencia manda. Si hay varias visitas por paciente, ventanas del mismo sensor o documentos del mismo autor, repartir filas mezcla información muy relacionada. La pregunta «¿funciona con otra fila?» no equivale a «¿funciona con otra persona?». El grupo que será nuevo debe mantenerse entero a un lado.
En k-fold se divide el conjunto en k partes; cada una sirve una vez para validar mientras se entrena con las restantes. Se promedian métricas, pero los resultados comparten datos de entrenamiento y no son observaciones independientes simples. El estudio clásico de Kohavi comparó estimación por validación cruzada y bootstrap para selección de clasificadores y mostró compromisos de sesgo y varianza entre diseños.
LOOCV usa una observación por fold de validación. Entrena con casi todos los datos, pero puede ser costoso e inestable para selección, y falla si las filas dependientes quedan separadas. «Datos escasos» no lo convierte automáticamente en mejor. La elección de k, repetición y estratificación responde al tamaño, la estructura y el coste.
La estratificación conserva aproximadamente proporciones de clase, útil cuando una clase es rara, pero no corrige grupos o tiempo. Una partición puede necesitar ambas restricciones. Si una clase tiene tan pocos grupos que no puede aparecer en todos los folds, se declara; no se duplican ejemplos para fabricar estabilidad.
Todo lo que aprende debe vivir dentro del fold
Escalar variables, imputar, seleccionar características, deduplicar, aprender vocabulario, hacer sobremuestreo y ajustar umbrales usan datos. Si se ejecutan antes de dividir, el fold de validación influye en la transformación. La canalización se ajusta únicamente con la porción de entrenamiento y se aplica después a validación.
La fuga puede ser más sutil. Una etiqueta calculada después del evento, una variable que codifica el hospital o un duplicado casi exacto permiten atajos. Se inspecciona cada campo por disponibilidad en el momento de predicción y se buscan parentescos entre filas. La precisión no distingue un patrón legítimo de una pista imposible en producción.
El estudio de validación por sujeto en reconocimiento de actividad analizó cómo ventanas solapadas y particiones que mezclan sujetos inflan resultados. El principio se transfiere: sesiones, dispositivos, hogares, empresas y autores deben agruparse cuando el uso espera entidades nuevas.
El conjunto final de prueba permanece intacto durante esta ingeniería. Si se consulta para decidir imputación o modelo, deja de ser final. Una práctica honesta mantiene un registro de decisiones y limita el número de miradas. Cuando no hay datos suficientes para prueba separada, se usa validación anidada y se declara mayor incertidumbre.
Validación anidada: seleccionar dentro, estimar fuera
En validación anidada, el bucle exterior reserva un fold para estimar; dentro del resto, otro proceso elige variables, hiperparámetros y algoritmo. Después se entrena la configuración elegida con todo el entrenamiento exterior y se evalúa una vez en el fold exterior. Cada fold externo repite la selección desde cero.
Varma y Simon mostraron que usar validación cruzada para seleccionar y luego informar la misma estimación introduce sesgo optimista, y que la validación anidada reduce ese sesgo en sus experimentos. No es un ritual exclusivo de biomedicina: aparece siempre que se escoge el mejor entre muchos intentos.
Cawley y Talbot explicaron que el criterio de selección también puede sobreajustarse y que su varianza importa. Probar más hiperparámetros, semillas, variables y modelos aumenta oportunidades de encontrar ruido favorable. La búsqueda forma parte del procedimiento evaluado y debe quedar dentro.
El resultado exterior no es el modelo final listo para servir, sino una estimación del proceso. Una vez fijado el procedimiento, se ajusta con todos los datos de desarrollo y se prueba en el conjunto final, si existe. Se conservan configuraciones por fold: que el mismo candidato gane siempre aporta información; que cambie mucho revela inestabilidad.
La selección incluye más que el algoritmo. Elegir columnas, tratamiento de ausencias, umbral, calibración, número de épocas o regla de parada son decisiones aprendidas. Incluso redactar una nueva característica después de estudiar los errores de validación adapta el procedimiento. No está prohibido: simplemente debe ocurrir dentro del ciclo de desarrollo y enfrentarse después a datos que no guiaron esa idea.
Grupos, tiempo y dominio cambian la regla
En series temporales no se entrena con el futuro para predecir el pasado. Se usan ventanas expansivas o deslizantes: entrenar hasta una fecha y validar después. El trabajo sobre validación cruzada para series temporales analiza cuándo procedimientos de CV pueden aplicarse a modelos autorregresivos. La hipótesis de uso debe coincidir con el horizonte y la actualización previstos.
En espacio o centros, se reserva región, hospital o tienda. Eso puede producir menos folds y mayor variación, pero responde a la pregunta difícil. Para generalizar a una nueva organización, una partición aleatoria dentro de las organizaciones conocidas estima otra cosa. Se pueden informar ambos experimentos con nombres distintos.
La validación temporal también muestra degradación. Se grafica rendimiento por fecha, no solo promedio. Una caída puede venir de población, política, sensor o etiqueta. Volver a mezclar periodos para elevar la cifra borra el hallazgo que el despliegue necesita.
Repetir una partición aleatoria reduce dependencia de un reparto afortunado bajo la misma población supuesta; no simula cambio de dominio. Cien repeticiones que mezclan hospitales siguen sin contestar cómo funcionará en un hospital nuevo. El número de repeticiones se elige antes y se acompaña de una prueba estructural. Más cómputo no corrige una pregunta equivocada.
La disponibilidad de etiquetas también define el diseño. Si el resultado llega meses después, la validación en producción tendrá retraso. Se establece una métrica temprana de proceso sin confundirla con el desenlace final y se reserva una cohorte para actualizar la estimación. Un modelo puede parecer estable porque todavía no se conocen sus errores recientes.
Predecir precios bursátiles ilustra el peligro de ligereza: autocorrelación, costes, disponibilidad de datos, múltiples pruebas y cambio de régimen pueden convertir una simulación en espejismo. Una estrategia requiere backtest temporal, costes de transacción, comparación contra referencias y periodo futuro retenido. La validación cruzada no convierte una correlación histórica en rentabilidad.
Comparar modelos sin convertir el azar en ganador
El promedio se acompaña de dispersión, resultados por fold y denominadores. Un intervalo ingenuo que trata folds como independientes puede ser demasiado estrecho. Repetir particiones muestra sensibilidad, pero no crea datos nuevos. También se informa coste, latencia, calibración, subgrupos y complejidad de operación.
El bootstrap es otra herramienta de estimación. El trabajo de Efron estudió estimación de la tasa de error y mejoras sobre la tasa aparente. Elegir bootstrap o CV depende del estimando y supuestos; ninguno compensa una unidad mal definida.
Cuando se comparan muchos algoritmos en múltiples conjuntos, la variación entre datos importa. Demšar revisó pruebas estadísticas para comparar clasificadores sobre varios conjuntos. La lección práctica es evitar proclamar superioridad universal por una diferencia pequeña en un solo split; se publican tareas, rangos y relevancia práctica.
AIC y BIC responden a marcos de verosimilitud y penalizan complejidad bajo supuestos; no sustituyen una prueba de transporte a población futura ni son comparables ciegamente entre cualquier canalización. Interpretabilidad tampoco es un número que se suma a accuracy: se especifica quién necesita comprender qué para qué decisión.
La capacidad transferible es diseñar la partición desde la pregunta de despliegue y separar selección, estimación y prueba final. El protocolo se resume en cinco preguntas: ¿qué unidad será nueva?, ¿qué pasos aprenden?, ¿qué se elige dentro?, ¿qué permanece fuera? y ¿qué incertidumbre se informa? Contestarlas vale más que recitar k-fold o LOOCV.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.