Kappa系数与ICC组内相关系数.医学统计实例详解

在医学研究中,常需要评价不同观察者或不同测量方法之间的一致性,也就是结果是否可重复、可信。对于分类或等级资料,常用Kappa系数;对于连续变量,常用组内相关系数(ICC)。两者都衡量一致性,但适用资料类型与解释方式不同,不能混用。

一致性研究常见于诊断试验、量表评定和仪器测量等场景,是评估测量质量的重要环节。

一、Kappa系数

Kappa系数用于评价两名或多名评价者对同一对象进行分类判断时,实际一致程度是否超过了偶然一致。设有两名评价者,观察一致率为Po,由各行、各列边缘合计算出的期望一致率为Pe,则 Kappa=(Po-Pe)/(1-Pe)。Kappa的取值范围一般在-1到1之间:等于1表示完全一致,等于0表示一致程度与随机猜测相当,为负值表示实际一致低于偶然一致。Kappa同时考虑了实际一致与随机一致,因此比单纯计算一致率更能反映真实的判断水平。

对于有序等级资料,可使用加权Kappa,按等级差距赋予不同权重,能更合理地反映"差一级"与"差多级"的区别。多名评价者或多分类的情形,可用Fleiss Kappa等扩展形式。

二、Kappa的一致性分档

常用Landis与Koch提出的分档:小于0为差;0~0.20为极弱;0.21~0.40为一般;0.41~0.60为中等;0.61~0.80为较强;0.81~1.00为几乎完全一致。分档只是帮助理解的参考,一致性能否满足实际需要,还应结合具体指标与临床可接受标准判断。Kappa受患病率(边缘分布)影响较大,当某类别占比过高时,Kappa值可能偏低,此时应结合阳性一致率、阴性一致率等指标综合判断。

举例来说,两名评价者把结果分为轻、中、重三级,若一致格占比不高,加权Kappa会明显低于简单Kappa,但更符合"差距越大、惩罚越重"的直觉,因此对有序等级资料更为合适。报告加权Kappa时,应同时说明所用权重是线性权重还是平方权重。

三、医学实例:诊断一致性

两名医生用同一种影像方法对100例患者判断是否阳性(阳性/阴性),结果见表1。

医生B 阳性医生B 阴性合计
医生A 阳性55560
医生A 阴性73340
合计6238100

实际一致率 Po=(55+33)/100=0.88。期望一致率 Pe=(0.60×0.62)+(0.40×0.38)=0.372+0.152=0.524。Kappa=(0.88-0.524)/(1-0.524)=0.748,标准误约0.068,95%置信区间约为0.614~0.882。按分档标准,0.748属于较强一致,且置信区间不包含0,提示两名医生的判断一致性具有统计学意义,但仍未达到0.80以上,实际使用前宜进一步统一判读标准。

本例还可计算阳性一致率与阴性一致率:两名医生都判阳性的55例,占医生A所判60例阳性的91.7%;都判阴性的33例,占医生A所判40例阴性的82.5%。这两个指标从不同侧面反映一致性,报告时可与Kappa一并给出,以便读者判断不一致主要出现在哪一类。

四、ICC组内相关系数

ICC用于评价连续变量测量结果的一致性或信度,可理解为个体间差异占总变异的比例。当个体间的真实差异远大于测量误差时,ICC接近1。ICC有多种形式:单次测量还是多次测量的平均值、评价者视为固定还是随机、是否存在系统偏差,分别对应不同模型。报告时必须说明所用模型与计算方式,否则结果难以比较。

常参考的分档为:小于0.50为差;0.50~0.75为中等;0.75~0.90为良好;大于0.90为优。ICC同时受个体间变异与测量误差影响,样本的个体间差异过小会低估ICC,因此选入的受试对象应能覆盖目标人群的测量范围。

常见形式中,ICC(1,1)适用于每名受试者由不同评价者测量、评价者不固定且不要求系统偏差一致的情形;ICC(2,1)假定评价者是从更大评价者总体中随机抽取,允许存在系统偏差,结果可外推;ICC(3,1)把评价者视为固定,只关注当前这几名评价者的一致性。三者数值往往不同,研究目的决定了应选用哪一种。

五、医学实例:测量信度

两名医生分别用同一量表对20名患者的症状评分(0~100分)进行测量,数据见表2。

患者编号医生A医生B
15254
26159
34749
47068
55556
66361
74547
85860
96664
105052
117270
125755
134951
146466
155351
166869
174644
186062
195657
206260

采用双向随机效应的单次测量模型计算,ICC(2,1)=0.97(95%CI:0.93~0.99,P<0.001),提示两名医生的评分一致性为优。整体测量标准差约7.7分,按ICC折算的测量标准误约为1.3分,最小可检测变化约为3.6分,即评分变化小于该幅度时可能只是测量误差所致。

六、常见错误用法

  • 用Kappa评价连续变量的一致性,或用ICC评价分类资料。
  • 只报告Kappa或ICC数值,不说明所用模型、加权方式与置信区间。
  • 把一致性当作准确性:一致性高只说明结果可重复,不代表结果正确。
  • 受试对象个体间差异过小时计算ICC,得到偏低的信度。
  • Kappa接近0时直接断言"完全无关",忽视边缘分布的影响。
  • 用线性相关系数代替ICC评价一致性,相关系数对系统偏差不敏感。

七、注意事项

一致性研究应预先规定测量方法、评分标准与样本量,受试对象应覆盖目标人群的测量范围。Kappa与ICC都依赖研究样本,样本量越大,估计越稳定;报告置信区间有助于判断一致性的精度。此外,一致性只是测量学性质之一,还应结合重测信度、评定者间信度以及测量误差共同评价量表或仪器的表现。报告时宜同时给出原始一致率、Kappa及其95%置信区间,或ICC模型、数值及其95%置信区间,并结合专业标准判断一致性是否满足使用要求。