ROC曲线与AUC.医学统计实例详解

在临床研究中,经常需要评价一项诊断试验(如某个血清标志物、影像征象或量表评分)区分"有病"与"无病"的能力。判断准确性不能只看某一个截断值下的灵敏度或特异度:截断值定得低,灵敏度升高但特异度下降;定得高则相反。两者此消彼长,任何单一截断值都只反映诊断试验在某一点上的表现。ROC曲线(受试者工作特征曲线,Receiver Operating Characteristic curve)把各种可能截断值下的表现连成一条曲线,从整体上描述诊断试验的判别能力;曲线下面积(AUC)则用一个数值概括这一能力。

ROC分析适用于结局为二分类的诊断试验资料,要求每个研究对象都有明确的金标准诊断结果,以及一个连续型或等级型的检验指标。

一、四格表与基本指标

以金标准为参照,把检验结果与真实情况交叉分类,得到四格表:真阳性(TP)为确实有病且检验阳性,假阳性(FP)为实际无病但检验阳性,假阴性(FN)为确实有病但检验阴性,真阴性(TN)为实际无病且检验阴性。由此定义:

  • 灵敏度 Se=TP/(TP+FN):实际有病者中被正确检出的比例,反映发现病人的能力。
  • 特异度 Sp=TN/(TN+FP):实际无病者中被正确排除的比例,反映排除非病人的能力。
  • 漏诊率=1−Se,误诊率=1−Sp。
  • 约登指数 J=Se+Sp−1:灵敏度与特异度之和减去1,取值越大提示该截断值的综合判别效果越好。
  • 阳性似然比 LR+=Se/(1−Sp),阴性似然比 LR−=(1−Se)/Sp,反映检验结果对患病概率的改变程度。

二、ROC曲线的构造

对检验指标设定一个截断值c,指标大于或等于c判为阳性,小于c判为阴性,即可按上面的公式算出一对灵敏度和特异度。把c从高到低逐个取遍所有观测值,便得到一系列(1−特异度,灵敏度)坐标点。以假阳性率(1−特异度)为横轴、灵敏度为纵轴,把这些点连成曲线,即为ROC曲线。曲线经过(0,0)与(1,1)两点,越偏向图的左上角,说明在相同的误诊率下能获得更高的灵敏度,诊断效能越好。

三、医学实例

某研究评价一种血清标志物X对某疾病的诊断价值,以临床金标准确诊,病例组10例、对照组10例,两组指标值见表1。

组别指标X的实测值
病例组(n=10)3.14.35.86.26.67.07.48.08.59.2
对照组(n=10)1.82.22.63.03.43.74.04.24.54.8

按"指标大于或等于截断值判为阳性"的规则,取若干截断值计算灵敏度和特异度,结果见表2。

截断值灵敏度(%)特异度(%)约登指数
3.1100400.40
4.390800.70
4.880900.70
5.8801000.80
6.2701000.70
7.0501000.50
8.5201000.20

由表2可见,约登指数在截断值5.8处取最大值0.80,对应灵敏度80%、特异度100%。截断值在4.9~5.8之间取任意值时结果相同,故最佳截断值可定为5.8。把这些(1−特异度,灵敏度)点连成曲线,计算曲线下面积AUC约为0.92。

四、结果解读

AUC可以理解为:随机抽取一名患病者和一名非患病者,患病者的指标值高于非患病者的概率。AUC与诊断效能的关系通常按下面的尺度判读。

AUC诊断效能
0.5无判别能力,等同于随机猜测
0.5~0.7较低
0.7~0.9中等
0.9以上较高

上例AUC为0.92,属于较高水平,说明该标志物对疾病有较好的判别能力。最佳截断值取5.8时,灵敏度80%、特异度100%,即能把全部对照组正确排除,同时检出80%的病例。

截断值的选择并不只依赖约登指数。约登指数对灵敏度和特异度同等对待,而实际工作中两者的重要性往往不同:用于筛查时更看重灵敏度,用于确诊时更看重特异度。此时可以结合阳性似然比、阴性似然比以及临床可接受的水平,在ROC曲线上另行选点。

五、常见错误用法

  • 只用单一截断值报告灵敏度和特异度,不给出ROC曲线与AUC,信息不完整。
  • 把AUC直接用于多分类结局或生存资料,这类资料需采用相应的扩展方法。
  • 在样本量很小的情况下下结论。本例20例仅用于演示,AUC的置信区间会很宽,实际研究需要足够大的病例组与对照组。
  • 用同一批数据反复挑选截断值并报告其灵敏度与特异度,造成乐观偏倚,这类选择应在独立样本中验证。
  • 把AUC的高低直接等同于临床价值,忽略指标的可及性、成本与可重复性。

六、注意事项

ROC分析要求金标准本身可靠,否则所有结果都是按有偏的参照计算出来的。病例组与对照组的构成也会影响AUC:对照组中混入不易区分的其他疾病患者,AUC会下降;只选典型病例,AUC则会偏高。报告时应写明金标准、研究对象的来源与纳入排除标准、指标的单位与测定方法,并给出AUC及其95%置信区间。

当同时评价多个指标时,可以比较各自AUC的大小;若两个AUC来自同一批研究对象,属于相关样本,比较时需采用考虑相关性的检验方法。把这一思路推广到多个指标的组合,即为多变量ROC分析。