在医学研究中,常需要评价不同观察者或不同测量方法之间的一致性,也就是结果是否可重复、可信。对于分类或等级资料,常用Kappa系数;对于连续变量,常用组内相关系数(ICC)。两者都衡量一致性,但适用资料类型与解释方式不同,不能混用。
一致性研究常见于诊断试验、量表评定和仪器测量等场景,是评估测量质量的重要环节。
一、Kappa系数
Kappa系数用于评价两名或多名评价者对同一对象进行分类判断时,实际一致程度是否超过了偶然一致。设有两名评价者,观察一致率为Po,由各行、各列边缘合计算出的期望一致率为Pe,则 Kappa=(Po-Pe)/(1-Pe)。Kappa的取值范围一般在-1到1之间:等于1表示完全一致,等于0表示一致程度与随机猜测相当,为负值表示实际一致低于偶然一致。Kappa同时考虑了实际一致与随机一致,因此比单纯计算一致率更能反映真实的判断水平。
对于有序等级资料,可使用加权Kappa,按等级差距赋予不同权重,能更合理地反映"差一级"与"差多级"的区别。多名评价者或多分类的情形,可用Fleiss Kappa等扩展形式。
二、Kappa的一致性分档
常用Landis与Koch提出的分档:小于0为差;0~0.20为极弱;0.21~0.40为一般;0.41~0.60为中等;0.61~0.80为较强;0.81~1.00为几乎完全一致。分档只是帮助理解的参考,一致性能否满足实际需要,还应结合具体指标与临床可接受标准判断。Kappa受患病率(边缘分布)影响较大,当某类别占比过高时,Kappa值可能偏低,此时应结合阳性一致率、阴性一致率等指标综合判断。
举例来说,两名评价者把结果分为轻、中、重三级,若一致格占比不高,加权Kappa会明显低于简单Kappa,但更符合"差距越大、惩罚越重"的直觉,因此对有序等级资料更为合适。报告加权Kappa时,应同时说明所用权重是线性权重还是平方权重。
三、医学实例:诊断一致性
两名医生用同一种影像方法对100例患者判断是否阳性(阳性/阴性),结果见表1。
| 医生B 阳性 | 医生B 阴性 | 合计 | |
| 医生A 阳性 | 55 | 5 | 60 |
| 医生A 阴性 | 7 | 33 | 40 |
| 合计 | 62 | 38 | 100 |
实际一致率 Po=(55+33)/100=0.88。期望一致率 Pe=(0.60×0.62)+(0.40×0.38)=0.372+0.152=0.524。Kappa=(0.88-0.524)/(1-0.524)=0.748,标准误约0.068,95%置信区间约为0.614~0.882。按分档标准,0.748属于较强一致,且置信区间不包含0,提示两名医生的判断一致性具有统计学意义,但仍未达到0.80以上,实际使用前宜进一步统一判读标准。
本例还可计算阳性一致率与阴性一致率:两名医生都判阳性的55例,占医生A所判60例阳性的91.7%;都判阴性的33例,占医生A所判40例阴性的82.5%。这两个指标从不同侧面反映一致性,报告时可与Kappa一并给出,以便读者判断不一致主要出现在哪一类。
四、ICC组内相关系数
ICC用于评价连续变量测量结果的一致性或信度,可理解为个体间差异占总变异的比例。当个体间的真实差异远大于测量误差时,ICC接近1。ICC有多种形式:单次测量还是多次测量的平均值、评价者视为固定还是随机、是否存在系统偏差,分别对应不同模型。报告时必须说明所用模型与计算方式,否则结果难以比较。
常参考的分档为:小于0.50为差;0.50~0.75为中等;0.75~0.90为良好;大于0.90为优。ICC同时受个体间变异与测量误差影响,样本的个体间差异过小会低估ICC,因此选入的受试对象应能覆盖目标人群的测量范围。
常见形式中,ICC(1,1)适用于每名受试者由不同评价者测量、评价者不固定且不要求系统偏差一致的情形;ICC(2,1)假定评价者是从更大评价者总体中随机抽取,允许存在系统偏差,结果可外推;ICC(3,1)把评价者视为固定,只关注当前这几名评价者的一致性。三者数值往往不同,研究目的决定了应选用哪一种。
五、医学实例:测量信度
两名医生分别用同一量表对20名患者的症状评分(0~100分)进行测量,数据见表2。
| 患者编号 | 医生A | 医生B |
| 1 | 52 | 54 |
| 2 | 61 | 59 |
| 3 | 47 | 49 |
| 4 | 70 | 68 |
| 5 | 55 | 56 |
| 6 | 63 | 61 |
| 7 | 45 | 47 |
| 8 | 58 | 60 |
| 9 | 66 | 64 |
| 10 | 50 | 52 |
| 11 | 72 | 70 |
| 12 | 57 | 55 |
| 13 | 49 | 51 |
| 14 | 64 | 66 |
| 15 | 53 | 51 |
| 16 | 68 | 69 |
| 17 | 46 | 44 |
| 18 | 60 | 62 |
| 19 | 56 | 57 |
| 20 | 62 | 60 |
采用双向随机效应的单次测量模型计算,ICC(2,1)=0.97(95%CI:0.93~0.99,P<0.001),提示两名医生的评分一致性为优。整体测量标准差约7.7分,按ICC折算的测量标准误约为1.3分,最小可检测变化约为3.6分,即评分变化小于该幅度时可能只是测量误差所致。
六、常见错误用法
- 用Kappa评价连续变量的一致性,或用ICC评价分类资料。
- 只报告Kappa或ICC数值,不说明所用模型、加权方式与置信区间。
- 把一致性当作准确性:一致性高只说明结果可重复,不代表结果正确。
- 受试对象个体间差异过小时计算ICC,得到偏低的信度。
- Kappa接近0时直接断言"完全无关",忽视边缘分布的影响。
- 用线性相关系数代替ICC评价一致性,相关系数对系统偏差不敏感。
七、注意事项
一致性研究应预先规定测量方法、评分标准与样本量,受试对象应覆盖目标人群的测量范围。Kappa与ICC都依赖研究样本,样本量越大,估计越稳定;报告置信区间有助于判断一致性的精度。此外,一致性只是测量学性质之一,还应结合重测信度、评定者间信度以及测量误差共同评价量表或仪器的表现。报告时宜同时给出原始一致率、Kappa及其95%置信区间,或ICC模型、数值及其95%置信区间,并结合专业标准判断一致性是否满足使用要求。