Prediction-model Calibration: Hosmer-Lemeshow Test + Calibration Curve
Assess whether a prediction model's "predicted probabilities match the actual event rate" (calibration): enter predicted probabilities and actual outcomes to get the Hosmer-Lemeshow goodness-of-fit test, the calibration curve, the calibration slope and intercept (CITL), and the Brier score. Discrimination (AUC) describes ranking ability; calibration describes how accurate the probabilities are — the two are complementary. Computed locally in your browser; data are not uploaded.
① Introducir datos
One subject per row: predicted probability (0~1) actual outcome (1=occurred/0=did not), space- or comma-separated. Predicted probabilities usually come from logistic regression or a nomogram.
Cómo usarla y metodología
¿En qué se diferencia la calibración de la discriminación (AUC)?
La discriminación (AUC) mide la capacidad del modelo para «ordenar» a quienes tienen o no el evento; la calibración mide hasta qué punto las probabilidades predichas «coinciden numéricamente» con la tasa real de eventos. Un modelo puede tener un AUC alto pero mala calibración (probabilidades sistemáticamente demasiado altas/bajas). Deben evaluarse ambas.
¿Cómo leer el valor P de Hosmer-Lemeshow?
Contrasta un «desajuste entre predicho y observado». P>0,05: sin evidencia de desajuste, calibración aceptable; P<0,05: calibración mediocre. El sentido es inverso a los tests habituales, y el test es sensible al tamaño muestral: fácilmente significativo con n muy grandes, poco potente con n pequeños — júzguelo también con la curva de calibración.
¿Qué significan la pendiente y el intercepto de calibración?
La pendiente ideal vale 1: <1 es frecuente en sobreajuste/exceso de confianza (predicciones demasiado extremas), >1 significa predicciones demasiado prudentes. El intercepto ideal (CITL) vale 0: positivo = subestimación global del riesgo, negativo = sobrestimación global.
¿De dónde salen las probabilidades predichas?
En general la probabilidad de evento (0~1) calculada para cada sujeto por regresión logística o nomograma. Evalúe la calibración en un conjunto de validación independiente más que solo en el de desarrollo; la validación externa refleja mejor el rendimiento real.
Pegue el enlace en Slack, Teams, X o LinkedIn: la imagen de vista previa sale de la tarjeta Open Graph de esta página.