Outils de recherchePrediction Model Sample Size (Riley)

Minimum Sample Size for Clinical Prediction Models (Binary)

⚗️ Frontier method: Based on the Riley et al. (2019) prediction-model sample-size criteria — relatively recent and parameter-sensitive. This tool implements the three criteria for a binary outcome; before formal submission, cross-check with the official R package pmsampsize and confirm the source of your R²cs value.

Developing a clinical prediction model (diagnostic/prognostic risk model) requires enough sample to control overfitting. This tool returns the minimum sample size for a binary outcome by Riley's three criteria: ① global shrinkage S=0.9; ② difference between apparent and adjusted Nagelkerke R² ≤0.05; ③ precision of the overall mean risk estimate ±0.05 — taking the largest of the three. Calcul local dans le navigateur ; aucune donnée n'est envoyée.

① Saisie parameters

Number of candidate predictor parameters P
all coefficients to be estimated, including dummies, splines, interactions
Outcome prevalence / incidence
Expected Cox-Snell R² (adjusted)
from a previous model/pilot; if only the C-statistic is available it must be converted first

Mode d'emploi et méthodologie

Pourquoi ne pas simplement utiliser « 10 événements par variable (EPV=10) » ?

EPV=10 est une règle empirique qui ignore la performance attendue du modèle et l'interaction entre le nombre de prédicteurs et la proportion du critère. Riley 2019 a proposé des critères de taille d'échantillon basés sur le shrinkage, l'optimisme et la précision de l'estimation du risque — mieux justifiés, recommandés par TRIPOD et souvent exigés par les relecteurs.

D'où vient R²cs ?

Idéalement du R² de Cox-Snell rapporté par un modèle de prédiction similaire antérieur, ou d'un ajustement sur des données pilotes. Si seul un C-statistic (AUC) attendu est disponible, convertissez-le en R²cs via la méthode Riley (2020)/pmsampsize — conversion approximative : le faire directement dans pmsampsize est recommandé.

Quels paramètres P doit-il compter ?

P est le nombre total de paramètres de prédicteurs à estimer : une variable continue compte pour 1 (ou selon le nombre de termes de spline si splinée), une catégorielle à k niveaux compte pour k−1 indicatrices, et chaque interaction compte pour 1. Ne comptez pas seulement le nombre de variables.

Pourquoi prendre le maximum des trois critères ?

Les trois critères assurent respectivement un faible shrinkage de surapprentissage, une performance apparente vs ajustée proche, et une estimation du risque global suffisamment précise. Si l'un n'est pas rempli, l'échantillon est insuffisant : le minimum est le plus grand des trois effectifs requis.

Partager sur XLinkedInWhatsAppE-mail

Collez le lien dans Slack, Teams, X ou LinkedIn — l’aperçu utilise la carte Open Graph de cette page.