MODEL VALIDATION LAB · GUÍA DE ESTUDIO

10 preguntas que hay que saber explicar

No busca memorizar APIs: cada respuesta conecta generalización, diseño del split, leakage, métricas, selección de modelos y producción.

0 / 10 preguntas revisadas
01Fundamentos · generalización¿Por qué necesitamos validación si ya podemos medir el error de entrenamiento?+

Qué debe aparecer: diferencia entre ajuste in-sample y desempeño esperado sobre datos nuevos.

El error de entrenamiento mide qué tan bien el modelo reproduce datos que participaron del ajuste. Un algoritmo flexible puede reducirlo aprendiendo señal, pero también ruido y particularidades accidentales. Por eso es un estimador optimista de la capacidad predictiva.

La validación intenta aproximar el error de generalización: se entrena sin usar las observaciones que luego evalúan esa iteración. Con cross-validation obtenemos además una distribución de scores que informa nivel y estabilidad.

Objetivo: estimar desempeño sobre datos futuros sin permitir que la información de evaluación intervenga en el ajuste.
02Mecánica · K-Fold¿Cómo funciona K-Fold y qué información aporta que no aporta un hold-out?+

Qué debe aparecer: K bloques, rotación de validación, score por fold, media y dispersión.

K-Fold divide la muestra en K bloques. En cada iteración se entrena con K−1 folds y se evalúa con el restante; al terminar, cada observación habrá validado una vez. El resultado son K métricas, no un único score.

La media aproxima rendimiento esperado y la dispersión muestra cuánto depende el resultado de la partición. Frente a un único hold-out, reduce la dependencia de una división particular, a cambio de mayor costo computacional.

03Diseño · número de folds¿Cómo elegir K sin convertir “5 o 10” en una receta?+

Qué debe aparecer: tamaño de train/validation, costo, sesgo-varianza y estructura de datos.

K controla cuánto dato queda para entrenamiento en cada iteración y cuánto para validación. K pequeño genera validaciones más grandes y menor costo; K grande entrena con más datos pero multiplica ajustes y puede producir estimaciones muy correlacionadas.

La elección debe considerar tamaño de muestra, costo de entrenamiento, métrica, estabilidad y dependencia. LOOCV es el extremo K=n y no es automáticamente superior.

04Clasificación · estratificación¿Cuándo usar StratifiedKFold y qué problema evita?+

Qué debe aparecer: preservación aproximada de prevalencia, clase minoritaria y elección de métrica.

En clasificación desbalanceada, un K-Fold aleatorio puede dejar algunos folds con muy pocos positivos. StratifiedKFold intenta preservar la proporción de clases, haciendo más comparables las iteraciones y evitando métricas degeneradas.

Estratificar no arregla por sí solo el problema de negocio: todavía hay que elegir una métrica coherente —por ejemplo recall, F1, PR-AUC o costos explícitos— y controlar otros tipos de dependencia.

05Grupos · identidad¿Por qué múltiples filas por cliente pueden invalidar un K-Fold común?+

Qué debe aparecer: dependencia intra-entidad y diferencia entre generalizar a registros y a entidades nuevas.

Si transacciones del mismo cliente aparecen en train y validation, el modelo puede explotar patrones específicos de esa identidad. El score entonces responde a “¿predigo otro registro de un cliente conocido?” y no a “¿generalizo a un cliente nuevo?”.

GroupKFold mantiene cada entidad completa en un solo lado de la partición. La unidad de generalización —cliente, paciente, empresa, dispositivo— debe definirse antes de elegir el splitter.

06Series temporales · flecha del tiempo¿Cómo debe cambiar la validación cuando el tiempo importa?+

Qué debe aparecer: entrenar con pasado, validar con futuro, horizonte, gap y drift.

En un problema temporal no es lícito mezclar observaciones como si fueran iid: eso puede entrenar con información posterior a la fecha que se intenta predecir. TimeSeriesSplit, ventanas expansivas o móviles reproducen la secuencia real de disponibilidad.

Además del orden hay que representar el horizonte de decisión y, cuando existe demora de consolidación o solapamiento, introducir un gap. La validación temporal también ayuda a revelar drift.

07Riesgo metodológico · leakage¿Por qué el preprocesamiento debe vivir dentro del pipeline de CV?+

Qué debe aparecer: todo lo aprendido de datos se ajusta sólo con train de cada fold.

Imputar, escalar, seleccionar variables, hacer PCA o target encoding con todo el dataset antes del split permite que estadísticas de validation influyan en la representación usada para entrenar. El score queda contaminado aunque el target nunca se copie explícitamente.

La solución es encapsular transformaciones y modelo en un Pipeline. En cada fold, fit se ejecuta sólo sobre train; validation recibe únicamente transform con parámetros ya aprendidos.

Pipeline(SimpleImputer → StandardScaler → Model) + cross_validate
08Lectura · estabilidadDos modelos tienen la misma media de CV. ¿Son equivalentes?+

Qué debe aparecer: dispersión, segmentos, costo del error y robustez.

No. Una media oculta la forma de la distribución. Un modelo con scores 0.80, 0.81, 0.79, 0.82 y 0.80 es operativamente distinto de otro con 0.91, 0.66, 0.86, 0.70 y 0.93 aunque sus promedios fueran similares.

La decisión debe revisar desvío, mínimos, segmentos y coherencia temporal, además de la métrica que refleja el costo real del error. Estabilidad no reemplaza rendimiento; lo complementa.

09Selección · Nested CV¿Por qué reportar el mejor score del mismo CV usado para tuning puede ser optimista?+

Qué debe aparecer: selección entre muchas alternativas explota ruido; separar selección y evaluación.

Cuando probamos muchas configuraciones, la ganadora no sólo refleja calidad: también puede beneficiarse de fluctuaciones aleatorias de esos folds. Si luego informamos ese mismo máximo como desempeño final, mezclamos selección con evaluación.

Nested CV crea dos niveles: el inner CV elige hiperparámetros usando sólo el training del outer fold; el outer fold, nunca visto por la selección, estima el rendimiento del procedimiento completo. Un test final realmente reservado es otra vía cuando hay datos suficientes.

10Producción · protocolo¿Cómo transformar un score de CV en una decisión defendible de negocio?+

Qué debe aparecer: población, horizonte, baseline, métrica, dispersión, umbral, test final y condición de revisión.

Primero se define quién recibirá predicciones, cuándo y con qué información disponible. Después se diseña un split que replique ese escenario, se construye un baseline, se encapsula el preprocessing, se selecciona una métrica coherente con el costo del error y se reportan media y estabilidad.

La selección de modelo debe quedar separada de la estimación final. Finalmente se fija un threshold operativo, se evalúa el costo de falsos positivos y negativos, se documentan límites y se define monitoreo de drift. Un score alto sin este contexto no implica business readiness.