Simulador 10 · Regresión LogísticaTrain, Validation, Test y K-Fold Cross-Validation
Machine Learning · Validación y generalización

Train, Validation, Test y K-Fold

Un único train/test split puede dar una impresión demasiado optimista o pesimista. Este laboratorio reserva un test final que nunca participa de la validación, aplica K-fold sobre el conjunto de desarrollo y entrena realmente una regresión logística en cada fold para medir promedio y variabilidad.

Development
320
80% de N
Test final
80
20% reservado
AUC CV
—
media ± sd
Accuracy CV
—
media ± sd
Log-Loss CV
—
media ± sd
Test final AUC
—
modelo reentrenado

Flujo correcto de evaluación

Test protegido
Datos completos
N = 400
Se separan antes de validar o comparar el modelo.
→
Development · 80%
320 casos
Aquí se ejecuta K-fold: entrenamiento y validación repetidos.
→
Test final · 20%
80 casos
Permanece intacto hasta la evaluación final.

Cómo rota la validación

Fold 1 como validación
Test final
RESERVADO · no participa en ningún fold

Variabilidad entre folds

AUC
AUC de cada fold Línea = AUC promedio Fold activo

Resultados por fold

modelo real
FoldTrain nVal nAccuracyAUCLog-Loss

¿Por qué no alcanza una sola partición?

Estabilidad
Variabilidad baja
Estable
Los folds producen resultados parecidos. La estimación del desempeño es menos dependiente de una partición particular.
Variabilidad intermedia
Revisar
El desempeño cambia de manera visible entre folds. Conviene mirar tamaño muestral, ruido y composición de los datos.
Variabilidad alta
Inestable
Una única división podría dar una conclusión engañosa sobre la calidad del modelo.

Interpretación automática

Promedio ± variabilidad

Qué observar

Ideas clave
1 · Train no es evaluaciónEl modelo aprende sobre train. Medir allí mismo produce una estimación optimista de su desempeño futuro.
2 · Cross-validation mide estabilidadRepetir entrenamiento y validación sobre particiones distintas permite observar media y dispersión, no solo un número aislado.
3 · El test final debe quedar intactoSi usamos el test para elegir parámetros o comparar variantes, deja de ser una evaluación verdaderamente fuera de muestra.