CLASE COMPLETA · MACHINE LEARNING APLICADO

Validación cruzada

Cómo medir si un modelo realmente generaliza.

De hold-out a K-Fold, métricas, leakage, tuning y decisión de negocio.

VTTTT
Idea central: evaluar no es comprobar cuánto memorizó el modelo, sino estimar cómo funcionará fuera de la muestra que lo entrenó.
Sergio Gevatschnaider · Data Science for Business Decisions01
EL PROBLEMA DE EVALUAR MODELOS

Un buen ajuste no garantiza buenas predicciones

Separar ajuste de generalización cambia la pregunta estadística.

01

Train

Mide ajuste sobre datos que participaron de la estimación.

02

Datos nuevos

El examen real ocurre sobre observaciones no vistas.

03

Riesgo de decisión

Un score optimista puede terminar en pricing, crédito o segmentación incorrectos.

Objetivo: estimar error esperado fuera de muestra, no sólo minimizar error observado.
Módulo 06 · Validación, selección y generalización02
PRIMER ENFOQUE

Hold-out: simple, rápido y sensible al split

Una sola división puede ser afortunada o desafortunada.

Train

70–80% para ajustar parámetros.

Validation

20–30% para evaluar decisiones de modelado.

Limitación

Produce una única estimación dependiente de la partición.

Hold-out es una buena introducción; K-Fold agrega múltiples vistas del rendimiento y de su estabilidad.
Módulo 06 · Validación cruzada03
IDEA CENTRAL

K-Fold Cross-Validation

Cada bloque valida una vez; los restantes entrenan.

Iteración 1VTTTTscore 1
Iteración 2TVTTTscore 2
Iteración 3TTVTTscore 3
Iteración 4TTTVTscore 4
Iteración 5TTTTVscore 5
CV score = promedio de los K scores; la dispersión muestra sensibilidad a la muestra.
Módulo 06 · K-Fold04
ELECCIÓN DE K

Más folds no significa automáticamente mejor

K modifica tamaño de train, tamaño de validation y costo computacional.

K pequeño

Validación grande, menor costo y potencial mayor sesgo.

K intermedio

Equilibrio práctico entre costo y estabilidad.

K grande

Más datos de train y más fits.

LOOCV

K=n; extremo costoso y no siempre preferible.

La elección depende de n, estructura de dependencia, algoritmo, métrica y presupuesto de cómputo.
Módulo 06 · Diseño del resampling05
MÉTRICAS Y ESTABILIDAD

La media sola no alcanza

La métrica debe corresponder al problema y la distribución entre folds importa.

Regresión

MAE · RMSE · R²

Clasificación

Precision · Recall · F1 · ROC-AUC · PR-AUC

Negocio

Costo esperado · margen · capacidad · threshold

Ejemplo: R² CV = 0,812 ± 0,028. Rendimiento y estabilidad deben leerse juntos.
Módulo 06 · Métricas06
LECTURA DE RESULTADOS

Promedio parecido, riesgo distinto

Dos modelos pueden promediar casi lo mismo y comportarse de forma muy diferente.

Modelo A · estable

0.80 · 0.81 · 0.79 · 0.82 · 0.80

Poca variación: comportamiento más predecible.

Modelo B · inestable

0.91 · 0.66 · 0.86 · 0.70 · 0.93

Alta variación: fuerte dependencia de la muestra.

Promedio = nivel de rendimiento. Dispersión = una dimensión de robustez.
Módulo 06 · Estabilidad07
OVERFITTING Y GENERALIZACIÓN

La validación expone el sobreajuste

El train puede mejorar mientras el desempeño fuera de muestra empeora.

Brecha train–CV

Una brecha creciente es señal de memorizar detalles accidentales.

Varianza entre folds

Resultados muy diferentes revelan fragilidad ante la composición de la muestra.

Complejidad

Más variables o hiperparámetros no garantizan mejor generalización.

La complejidad se elige por evidencia fuera de muestra, no por el score de entrenamiento.
Módulo 06 · Overfitting08
RIESGO METODOLÓGICO

Data leakage: un score artificialmente bueno

Todo lo que aprende de los datos debe aprenderse dentro del fold de entrenamiento.

Incorrecto

Imputar, escalar, seleccionar features, hacer PCA o target encoding con todo el dataset.

Correcto

Pipeline: cada transformación ajusta sólo con train y luego transforma validation.

Pipeline(SimpleImputer → StandardScaler → Model) + cross-validation.
Módulo 06 · Leakage09
VARIANTES

El splitter debe respetar la estructura del dato

Primero se identifica el riesgo de fuga; luego se elige el esquema.

KFold

Observaciones aproximadamente iid.

StratifiedKFold

Clasificación con clases desbalanceadas.

GroupKFold

Múltiples filas por cliente, paciente o empresa.

TimeSeriesSplit

Pasado para entrenar; futuro para validar.

Regla docente: el split correcto reproduce cómo llegará el dato nuevo en producción.
Módulo 06 · Splitters10
SELECCIÓN DE MODELOS

Tuning sin confundir selección con evaluación

Probar muchas configuraciones puede explotar el ruido de la validación.

Grid / Random Search

Busca hiperparámetros usando CV.

Optimismo

El mejor score entre muchas pruebas puede ser accidentalmente alto.

Nested CV

Inner CV selecciona; outer CV estima generalización del proceso completo.

Separar model selection de model assessment evita reutilizar la misma evidencia para elegir y certificar.
Módulo 06 · Tuning y Nested CV11
ECOSISTEMA DEL MÓDULO

Cinco capas de aprendizaje conectadas

La versión completa integra narrativa, intuición visual, código, estudio y decisión.

01

Presentación

14 láminas.

02

Laboratorios

14 simulaciones.

03

Colab

58 celdas.

04

Cuestionario

10 preguntas.

05

Glosario

90 conceptos.

Ruta sugerida: ver → experimentar → programar → explicar → decidir.
Módulo 06 · Experiencia docente12
APLICACIÓN

De datos a decisión defendible

El score debe vivir dentro de un protocolo completo.

Datosunidad y disponibilidad→Splitentidad y tiempo→Pipelinesin leakage→CVmedia y dispersión→Decisiónthreshold y costo
Una solución puede ser técnicamente precisa y no estar lista para negocio si es inestable, costosa o usa un umbral inadecuado.
Módulo 06 · Business Lab13
CIERRE OPERATIVO

Checklist para confiar en un score

Validar es diseñar evidencia que se parezca al futuro.

Diseño

Unidad de generalización · test reservado · splitter correcto · pipeline sin leakage.

Lectura

Baseline · métrica de negocio · media y dispersión · segmentos · threshold.

Selección

Tuning separado de evaluación; Nested CV cuando corresponde.

Producción

Reproducibilidad, drift, monitoreo y condiciones de reentrenamiento.

Idea final: validar no es un trámite técnico; es medir si el modelo puede sostener decisiones fuera de la muestra que lo entrenó.
Sergio Gevatschnaider · Data Science for Business Decisions14