Prediction-model Calibration: Hosmer-Lemeshow Test + Calibration Curve
Assess whether a prediction model's "predicted probabilities match the actual event rate" (calibration): enter predicted probabilities and actual outcomes to get the Hosmer-Lemeshow goodness-of-fit test, the calibration curve, the calibration slope and intercept (CITL), and the Brier score. Discrimination (AUC) describes ranking ability; calibration describes how accurate the probabilities are — the two are complementary. Calcul local dans le navigateur ; aucune donnée n'est envoyée.
① Saisie data
One subject per row: predicted probability (0~1) actual outcome (1=occurred/0=did not), space- or comma-separated. Predicted probabilities usually come from logistic regression or a nomogram.
Mode d'emploi et méthodologie
En quoi la calibration diffère-t-elle de la discrimination (AUC) ?
La discrimination (AUC) mesure la capacité du modèle à « ranger » ceux qui ont ou non l'événement ; la calibration mesure à quel point les probabilités prédites « correspondent numériquement » au taux d'événements réel. Un modèle peut avoir une AUC élevée mais une mauvaise calibration (probabilités systématiquement trop hautes/basses). Les deux doivent être évaluées.
Comment lire la valeur P de Hosmer-Lemeshow ?
Elle teste un « décalage entre prédit et observé ». P>0,05 : pas de preuve de décalage, calibration acceptable ; P<0,05 : calibration médiocre. Le sens est inverse des tests habituels, et le test est sensible à la taille d'échantillon : facilement significatif sur de très grands n, peu puissant sur de petits — jugez aussi avec la courbe de calibration.
Que signifient la pente et l'intercept de calibration ?
La pente idéale vaut 1 : <1 est fréquent en surapprentissage/surconfiance (prédictions trop extrêmes), >1 signifie des prédictions trop prudentes. L'intercept idéal (CITL) vaut 0 : positif = sous-estimation globale du risque, négatif = surestimation globale.
D'où viennent les probabilités prédites ?
En général la probabilité d'événement (0~1) calculée pour chaque sujet par régression logistique ou nomogramme. Évaluez la calibration sur un jeu de validation indépendant plutôt que seulement sur le développement ; la validation externe reflète mieux la performance réelle.
Collez le lien dans Slack, Teams, X ou LinkedIn — l’aperçu utilise la carte Open Graph de cette page.