Simulador 11 · Regresión LogísticaCalibración vs discriminación
Machine Learning · Calidad probabilística

Calibración vs Discriminación

Un modelo puede ordenar correctamente los casos de mayor a menor riesgo y aun así asignar probabilidades incorrectas. Modifica la “temperatura” de las probabilidades y observa cómo cambia la calibración, el Brier score y la log-loss, mientras el ranking —y por tanto el AUC— permanece esencialmente intacto.

ROC-AUC
—
discriminación
Brier score
—
menor es mejor
Log-Loss
—
calidad probabilística
ECE
—
error de calibración
Prob. media
—
riesgo predicho
Frecuencia real
—
evento observado

Calibration plot

predicho vs observado
calibración perfecta
Modelo actual Diagonal ideal

ROC: el ranking permanece

discriminación
ROC

Predicción y frecuencia por decil

calibración local

Dos virtudes distintas

comparación
Discriminación
—
Calibración
—

Interpretación automática

AUC ≠ calibración

Qué observar

Ideas clave
1 · AUC depende del orden, no de la escala exactaSi una transformación monotónica conserva el ranking, el ROC-AUC permanece igual aunque las probabilidades se vuelvan demasiado extremas o demasiado moderadas.
2 · Calibración exige significado probabilísticoDecir p̂=0.70 debería significar que, en grupos comparables, el evento ocurre aproximadamente 70% de las veces.
3 · Un modelo puede discriminar bien y calibrar malPor eso conviene evaluar ranking y calidad probabilística por separado, especialmente cuando la probabilidad alimenta decisiones o costos.