Validación · Selección · Generalización

¿Tu modelo realmente generaliza?

Una experiencia docente integral para diseñar particiones honestas, detectar leakage, medir estabilidad, seleccionar modelos sin optimismo y traducir métricas técnicas a decisiones de negocio.

Esquema visual de K-Fold Cross-Validation
3accesos de presentación
37láminas únicas
14laboratorios interactivos
10preguntas desarrolladas
90términos en glosario
Centro de presentaciones

Tres accesos complementarios

La Presentación 01 desarrolla el marco estadístico; la Presentación 02 recorre la teoría y los controles de los 14 laboratorios; la Presentación 03 identifica explícitamente la guía PowerPoint de las simulaciones y la abre en modo de reproducción automática, con descarga PPTX y vista online en Google.

Presentación 01 · Clase conceptual

14 láminas sobre generalización, K-Fold, métricas, leakage, tuning y decisión.

Espacio reproducir o pausar← → navegarF pantalla completaO vista generalPresentación 03 inicia automáticamente
Biblioteca del módulo

Material conectado

Cada recurso cumple una función distinta dentro de la secuencia de aprendizaje.

Ruta didáctica recomendada

La secuencia evita enseñar validación como una receta de API. Primero define qué significa generalizar y después selecciona la técnica.

01 · Fundamento

¿Qué es dato nuevo?

Train, validation, test, hold-out y error fuera de muestra.

02 · Diseño

¿Cómo partir?

K-Fold, estratificación, grupos, tiempo y gap.

03 · Riesgo

¿Qué puede contaminar?

Leakage, preprocessing global, overfitting e inestabilidad.

04 · Selección

¿Cómo elegir?

Tuning, Repeated CV, Nested CV y predicciones OOF.

05 · Decisión

¿Qué significa el score?

Métrica, dispersión, umbral y business readiness.

Experimentación

14 laboratorios interactivos

Los laboratorios forman una progresión desde la mecánica básica hasta una decisión empresarial completa.

Matriz de elección rápida

El splitter se elige por la estructura del dato y por la forma en que el modelo encontrará observaciones nuevas.

SituaciónEsquema orientativoRiesgo principal
Observaciones aproximadamente iidK-Fold / Repeated K-FoldDependencia no detectada o preprocessing global
Clasificación desbalanceadaStratifiedKFoldFolds con pocos positivos y métricas engañosas
Múltiples filas por entidadGroupKFold / StratifiedGroupKFoldIdentidad compartida entre train y validación
Datos ordenados en el tiempoTimeSeriesSplit / ventana móvilFuture leakage y drift
Tuning intenso con muestra limitadaNested Cross-ValidationOptimismo por selección

Protocolo antes de confiar en un resultado

01Definir unidad de observación y unidad de generalización.
02Separar test final antes del tuning cuando corresponde.
03Ajustar imputación, scaling, selección y PCA dentro del fold.
04Reportar media, dispersión y segmentos relevantes.
05Comparar contra un baseline interpretable.
06Elegir la métrica según el costo del error.
07Usar Nested CV cuando selección y evaluación no puedan separarse.
08Registrar acción, población, horizonte y condición de revisión.
Idea de cierre: una validación correcta imita el problema que el modelo resolverá cuando ya no pueda reconocer ejemplos conocidos ni acceder al futuro.