Train
Mide ajuste sobre datos que participaron de la estimación.
Cómo medir si un modelo realmente generaliza.
De hold-out a K-Fold, métricas, leakage, tuning y decisión de negocio.
Separar ajuste de generalización cambia la pregunta estadística.
Mide ajuste sobre datos que participaron de la estimación.
El examen real ocurre sobre observaciones no vistas.
Un score optimista puede terminar en pricing, crédito o segmentación incorrectos.
Una sola división puede ser afortunada o desafortunada.
70–80% para ajustar parámetros.
20–30% para evaluar decisiones de modelado.
Produce una única estimación dependiente de la partición.
Cada bloque valida una vez; los restantes entrenan.
K modifica tamaño de train, tamaño de validation y costo computacional.
Validación grande, menor costo y potencial mayor sesgo.
Equilibrio práctico entre costo y estabilidad.
Más datos de train y más fits.
K=n; extremo costoso y no siempre preferible.
La métrica debe corresponder al problema y la distribución entre folds importa.
MAE · RMSE · R²
Precision · Recall · F1 · ROC-AUC · PR-AUC
Costo esperado · margen · capacidad · threshold
Dos modelos pueden promediar casi lo mismo y comportarse de forma muy diferente.
0.80 · 0.81 · 0.79 · 0.82 · 0.80
Poca variación: comportamiento más predecible.
0.91 · 0.66 · 0.86 · 0.70 · 0.93
Alta variación: fuerte dependencia de la muestra.
El train puede mejorar mientras el desempeño fuera de muestra empeora.
Una brecha creciente es señal de memorizar detalles accidentales.
Resultados muy diferentes revelan fragilidad ante la composición de la muestra.
Más variables o hiperparámetros no garantizan mejor generalización.
Todo lo que aprende de los datos debe aprenderse dentro del fold de entrenamiento.
Imputar, escalar, seleccionar features, hacer PCA o target encoding con todo el dataset.
Pipeline: cada transformación ajusta sólo con train y luego transforma validation.
Primero se identifica el riesgo de fuga; luego se elige el esquema.
Observaciones aproximadamente iid.
Clasificación con clases desbalanceadas.
Múltiples filas por cliente, paciente o empresa.
Pasado para entrenar; futuro para validar.
Probar muchas configuraciones puede explotar el ruido de la validación.
Busca hiperparámetros usando CV.
El mejor score entre muchas pruebas puede ser accidentalmente alto.
Inner CV selecciona; outer CV estima generalización del proceso completo.
La versión completa integra narrativa, intuición visual, código, estudio y decisión.
14 láminas.
14 simulaciones.
58 celdas.
10 preguntas.
90 conceptos.
El score debe vivir dentro de un protocolo completo.
Validar es diseñar evidencia que se parezca al futuro.
Unidad de generalización · test reservado · splitter correcto · pipeline sin leakage.
Baseline · métrica de negocio · media y dispersión · segmentos · threshold.
Tuning separado de evaluación; Nested CV cuando corresponde.
Reproducibilidad, drift, monitoreo y condiciones de reentrenamiento.