Fleiss Kappa — Multi-Rater Agreement
When 3 or more raters classify multiple objects nominally, this evaluates their agreement. Cohen κ applies only to two raters; with more raters use Fleiss κ. The number of raters per object must be the same. For two raters or ordered grades use Kappa (with weighting).
① Introducir la tabla de conteos
One rated object per line, one category per column, value = how many raters assigned that object to that category. The row sum (total raters m) must be the same on every row. For example "4 0 0" means all 4 raters chose category 1.
Cómo usarla y metodología
¿Cuándo usar el κ de Fleiss en lugar del de Cohen?
El κ de Cohen solo trata «dos evaluadores fijos». Con 3 o más evaluadores (y no necesariamente el mismo conjunto de personas para cada objeto), use Fleiss κ. Para solo dos evaluadores, o categorías ordenadas que necesiten pesos, use la herramienta Kappa (con ponderación lineal/cuadrática).
¿Cómo disponer los datos?
Disponga una tabla de conteo «objeto × categoría»: un objeto por fila, una categoría por columna, la celda = número de evaluadores que colocaron ese objeto en esa categoría. Cada suma de fila iguala el número total de evaluadores m, y m debe ser el mismo en cada fila.
¿Qué κ se considera bueno?
Referencia habitual Landis & Koch: <0,2 leve, 0,2–0,4 aceptable, 0,4–0,6 moderado, 0,6–0,8 sustancial, >0,8 casi perfecto. Los umbrales solo son una guía; el sentido clínico depende del contexto.
¿Un κ bajo significa siempre que los evaluadores son malos?
No necesariamente. Cuando una categoría domina (prevalencia muy desequilibrada), el acuerdo esperado Pe es alto y κ se deflacta (paradoja del kappa). Léalo junto con las proporciones por categoría y el acuerdo observado P̄.
Pegue el enlace en Slack, Teams, X o LinkedIn: la imagen de vista previa sale de la tarjeta Open Graph de esta página.