Machine Learning · Generalización
Regularización, L1/L2 y Overfitting
Este laboratorio entrena una regresión logística real sobre datos sintéticos. Cambia la intensidad de regularización y observa cómo se modifican los coeficientes, la pérdida y el rendimiento fuera de muestra. La pregunta central es: ¿cuándo simplificar el modelo mejora su capacidad de generalizar?
Accuracy train
—
ajuste interno
Accuracy test
—
generalización
Log-Loss train
—
menor es mejor
Log-Loss test
—
fuera de muestra
Coeficientes ≈ 0
—
selección / contracción
Diagnóstico
—
train vs test
Coeficientes estimados
señal vs ruidoCurva de generalización
λ → desempeñoUnderfitting ↔ buen equilibrio ↔ Overfitting
Lectura conceptualRegularización débil
Overfitting
Coeficientes grandes o inestables. Train puede verse muy bien, pero test empeora.
Regularización intermedia
Equilibrio
Se reduce varianza sin destruir demasiada señal útil. Puede mejorar el desempeño fuera de muestra.
Regularización fuerte
Underfitting
El modelo se simplifica demasiado y pierde capacidad para representar la señal real.
Interpretación automática
Modelo entrenadoQué observar
Ideas clave1 · Regularizar introduce sesgo para reducir varianzaEl objetivo no es maximizar el ajuste en train, sino lograr un modelo más estable en observaciones nuevas.
2 · L1 y L2 no hacen exactamente lo mismoL2 suele mantener todos los predictores con coeficientes pequeños; L1 puede producir una solución dispersa con varios β exactamente en cero.
3 · Más regularización no siempre es mejorSi λ es excesivo, incluso las variables verdaderamente informativas se contraen demasiado y aparece underfitting.