Fleiss Kappa — Multi-Rater Agreement

When 3 or more raters classify multiple objects nominally, this evaluates their agreement. Cohen κ applies only to two raters; with more raters use Fleiss κ. The number of raters per object must be the same. For two raters or ordered grades use Kappa (with weighting).

① Introducir la tabla de conteos

One rated object per line, one category per column, value = how many raters assigned that object to that category. The row sum (total raters m) must be the same on every row. For example "4 0 0" means all 4 raters chose category 1.

Cómo usarla y metodología

¿Cuándo usar el κ de Fleiss en lugar del de Cohen?

El κ de Cohen solo trata «dos evaluadores fijos». Con 3 o más evaluadores (y no necesariamente el mismo conjunto de personas para cada objeto), use Fleiss κ. Para solo dos evaluadores, o categorías ordenadas que necesiten pesos, use la herramienta Kappa (con ponderación lineal/cuadrática).

¿Cómo disponer los datos?

Disponga una tabla de conteo «objeto × categoría»: un objeto por fila, una categoría por columna, la celda = número de evaluadores que colocaron ese objeto en esa categoría. Cada suma de fila iguala el número total de evaluadores m, y m debe ser el mismo en cada fila.

¿Qué κ se considera bueno?

Referencia habitual Landis & Koch: <0,2 leve, 0,2–0,4 aceptable, 0,4–0,6 moderado, 0,6–0,8 sustancial, >0,8 casi perfecto. Los umbrales solo son una guía; el sentido clínico depende del contexto.

¿Un κ bajo significa siempre que los evaluadores son malos?

No necesariamente. Cuando una categoría domina (prevalencia muy desequilibrada), el acuerdo esperado Pe es alto y κ se deflacta (paradoja del kappa). Léalo junto con las proporciones por categoría y el acuerdo observado P̄.

Compartir en XLinkedInWhatsAppCorreo

Pegue el enlace en Slack, Teams, X o LinkedIn: la imagen de vista previa sale de la tarjeta Open Graph de esta página.