Fleiss Kappa — Multi-Rater Agreement
When 3 or more raters classify multiple objects nominally, this evaluates their agreement. Cohen κ applies only to two raters; with more raters use Fleiss κ. The number of raters per object must be the same. For two raters or ordered grades use Kappa (with weighting).
① Saisir count table
One rated object per line, one category per column, value = how many raters assigned that object to that category. The row sum (total raters m) must be the same on every row. For example "4 0 0" means all 4 raters chose category 1.
Mode d'emploi et méthodologie
Quand utiliser le κ de Fleiss plutôt que celui de Cohen ?
Le κ de Cohen ne traite que « deux évaluateurs fixes ». Avec 3 évaluateurs ou plus (et pas forcément le même jeu de personnes pour chaque objet), utilisez Fleiss κ. Pour seulement deux évaluateurs, ou des catégories ordonnées nécessitant des poids, utilisez l'outil Kappa (avec pondération linéaire/quadratique).
Comment disposer les données ?
Disposez un tableau de comptage « objet × catégorie » : un objet par ligne, une catégorie par colonne, la cellule = nombre d'évaluateurs ayant placé cet objet dans cette catégorie. Chaque somme de ligne égale le nombre total d'évaluateurs m, et m doit être le même sur chaque ligne.
Quel κ est bon ?
Référence courante Landis & Koch : <0,2 léger, 0,2–0,4 passable, 0,4–0,6 modéré, 0,6–0,8 substantiel, >0,8 presque parfait. Les seuils ne sont qu'un guide ; le sens clinique dépend du contexte.
Un κ bas signifie-t-il toujours que les évaluateurs sont mauvais ?
Pas nécessairement. Lorsqu'une catégorie domine (prévalence très déséquilibrée), l'accord attendu Pe est élevé et κ est déflaté (paradoxe du kappa). Lisez-le avec les proportions par catégorie et l'accord observé P̄.
Collez le lien dans Slack, Teams, X ou LinkedIn — l’aperçu utilise la carte Open Graph de cette page.