Machine Learning · Calidad probabilística
Calibración vs Discriminación
Un modelo puede ordenar correctamente los casos de mayor a menor riesgo y aun así asignar probabilidades incorrectas. Modifica la “temperatura” de las probabilidades y observa cómo cambia la calibración, el Brier score y la log-loss, mientras el ranking —y por tanto el AUC— permanece esencialmente intacto.
ROC-AUC
—
discriminación
Brier score
—
menor es mejor
Log-Loss
—
calidad probabilística
ECE
—
error de calibración
Prob. media
—
riesgo predicho
Frecuencia real
—
evento observado
Calibration plot
predicho vs observado
Modelo actual
Diagonal ideal
ROC: el ranking permanece
discriminaciónPredicción y frecuencia por decil
calibración localDos virtudes distintas
comparaciónDiscriminación
—
Calibración
—
Interpretación automática
AUC ≠ calibraciónQué observar
Ideas clave1 · AUC depende del orden, no de la escala exactaSi una transformación monotónica conserva el ranking, el ROC-AUC permanece igual aunque las probabilidades se vuelvan demasiado extremas o demasiado moderadas.
2 · Calibración exige significado probabilísticoDecir p̂=0.70 debería significar que, en grupos comparables, el evento ocurre aproximadamente 70% de las veces.
3 · Un modelo puede discriminar bien y calibrar malPor eso conviene evaluar ranking y calidad probabilística por separado, especialmente cuando la probabilidad alimenta decisiones o costos.