Gwet's AC1 Inter-Rater Agreement
When two raters classify the same set of objects, Kappa suffers from a paradox when categories are very imbalanced ("high agreement, yet low κ"). Gwet's AC1 avoids this with a more reasonable estimate of expected agreement, giving a more robust result. This tool reports both AC1 and Cohen's κ for comparison (bootstrap 95% CI).
① Pegar valoraciones emparejadas
One object per line, two columns for rater 1 and rater 2's category (text or numbers, separated by space/Tab/comma).
Cómo usarla y metodología
¿Cómo elegir entre AC1 y Kappa?
Ambos miden la concordancia entre evaluadores. Cuando una categoría es muy frecuente (desequilibrio), Kappa se deflacta por su «concordancia esperada», produciendo el paradoja de alta concordancia pero κ bajo; el AC1 de Gwet usa una concordancia esperada más robusta y lo evita, y se recomienda cada vez más. Reportar ambos, y señalar cuán equilibrados están los datos, es lo más seguro.
¿Qué es la paradoja del Kappa?
Cuando casi todos los objetos caen en una categoría, incluso dos evaluadores muy concordantes pueden producir un Cohen κ muy bajo o casi nulo, porque se sobrestima la concordancia esperada. Esto puede hacer creer erróneamente que la concordancia es mala. El AC1 se diseñó para resolver esto.
¿Las categorías pueden ser texto?
Sí. Usa el mismo conjunto de etiquetas en ambas columnas (p. ej. positivo/negativo, 0/1/2, leve/moderado/grave); la herramienta detecta el conjunto de categorías y construye la tabla automáticamente.
¿Y para tres o más evaluadores?
Cohen κ y AC1 (esta herramienta) son para dos evaluadores. Para concordancia nominal entre tres o más, usa la herramienta Fleiss Kappa.
Pegue el enlace en Slack, Teams, X o LinkedIn: la imagen de vista previa sale de la tarjeta Open Graph de esta página.