十件里有九件本来就该过,那么两个审核只要都习惯性地放行, 不看内容也能一致 八成以上。所以真正的问题从来不是「他们一致了多少」, 而是「比瞎猜多出了多少」。
这一页把两个人的评分读进来,算出碰巧就能一致的那一截, 扣掉它,再告诉你剩下的那点一致到底站不站得住 —— 以及分歧具体落在哪几件上。
先看前提
两个人碰巧一致的概率本来就有 85.3% —— 因为要判的东西太一边倒了。扣掉这一截,κ 只有 0.32(一般)。也就是说:这 90.0% 里绝大部分是「这批东西大多长一个样」,不是「这两个人看法相同」。想知道他们真的合不合得上,得找一批分布没这么一边倒的东西再看一次。
κ 是怎么来的
κ = 4.7% ÷ (4.7% + 10.0%) = 0.32
分母不是 100%,是碰巧那一截之上还剩的空间。 这就是为什么一边倒的数据算出来的 κ 会那么难看:碰巧那一截把可争取的空间挤没了, 剩下的一点点里哪怕全拿到,也不够好看。
档位名(「中等」「相当一致」)用的是 Landis & Koch 1977 那一组 —— 放在这里是因为大家都在引用它,而那篇论文自己就说这组界限是随意定的。 真要看的是上面那个区间有多宽,以及 κ 离它自己的上限还有多远。
谁判了什么
两排长度对不上,就说明有一个人系统性地更严或更松。 这种不一致跟「逐件看走眼」是两回事,也不能靠更仔细地看每一件来解决 —— 它决定了上面那个 κ 上限。
交叉表
| 甲 \ 乙 | 打回 | 通过 | 合计 |
|---|---|---|---|
| 打回 | 6 | 9 | 15 |
| 通过 | 11 | 174 | 185 |
| 合计 | 17 | 183 | 200 |
对角线是一致的,其余都是分歧。κ 看的就是对角线比 「按两边各自的习惯随机配对」能落在对角线上的多出多少。
值得注意的
要判的东西里有一类占了绝大多数,所以两个人闭着眼睛按各自的习惯乱判,也能撞上 85.3%。κ 扣掉的正是这一截。PABAK 是 0.80,它假装两类一样多 —— 看着好看,但它就是 2×一致率−1,一点新信息都没有。
95% 区间是 0.08 – 0.54,跨了好几档。也就是说这批数据分不清「中等」和「相当一致」。再多的解读都是在读噪声 —— 要么加件数,要么就只说「大概在这一段」。
分歧在哪
PR-001、PR-010、PR-059、PR-109、PR-142、PR-155、PR-164、PR-166、PR-174、PR-185、PR-186
PR-007、PR-030、PR-032、PR-049、PR-052、PR-055、PR-130、PR-173、PR-179
这一段比上面任何一个系数都有用。κ 告诉你有多少分歧, 这里告诉你分歧是哪几件 —— 两个人坐下来把它们过一遍, 比讨论这个数该不该是 0.4 有意义得多。
它不知道的事
一致不等于对。 两个一起受训、一起养成同一套坏习惯的人, 可以一致得非常好,而且一起错。κ 量的是两个人之间的一致, 不是任何一个人跟事实之间的一致 —— 后者要有一份标准答案,那是另一件(而且贵得多的)事。
κ 依赖这一批东西的构成。 同样两个人,同样的标准, 换一批分布没那么偏的东西去判,κ 会明显不一样。 所以拿两份 κ 互相比大小,只有在两批数据的构成差不多时才说得通。
只管两个人。 三个人以上要用 Fleiss 的版本, 那是另一个系数,这里没做 —— 与其给一个名字像但定义不同的数,不如不给。
贴进来的东西只用来算这一次,不写盘、不记日志、不存任何地方。