二元Logistic回归分析.医学统计实例详解

二元Logistic回归是一种用于分析二分类结局变量(如患病与未患病、有效与无效、存活与死亡)与一个或多个自变量之间关系的回归方法。当结局只有两种可能结果时,普通线性回归不再适用:它可能预测出概率范围以外的数值,残差也不再满足方差齐性与正态性。Logistic回归对结局发生的概率作logit变换,把取值在0到1之间的概率映射到整个实数轴,从而建立自变量与结局概率之间的线性关系。

它的核心用途有两个:一是筛选与结局相关的危险因素或保护因素,二是估计各自变量对结局发生优势的效应大小。队列研究、病例对照研究和横断面研究都可以使用,特别适合结局为二分类的资料。

一、模型形式与效应指标

设结局发生的概率为P,模型为 ln[P/(1-P)] = β0 + β1X1 + β2X2 + … + βmXm。回归系数βi表示自变量Xi每改变一个单位时,logit(P)的平均改变量。把βi取指数即为优势比 OR=exp(βi),它表示在其他自变量保持不变的条件下,Xi每增加一个单位,结局发生的优势(odds)变为原来的多少倍。OR大于1提示危险因素,小于1提示保护因素,等于1提示无关联。

OR是条件优势比,并不等同于相对危险度。当结局发生率较低(通常低于10%)时,OR可以近似看作相对危险度;结局较常见时二者差别明显,此时不宜把OR直接解释为风险倍数。

二、应用条件

  • 因变量为二分类变量,通常把关注的事件编码为1、未发生编码为0。
  • 各观测相互独立,一般不适用于重复测量或聚集性数据,这类资料需考虑其他模型。
  • 自变量与logit(P)之间呈线性关系;连续变量线性关系不明显时,可考虑引入多项式项或样条。
  • 自变量之间不存在严重多重共线性,否则系数估计不稳定。
  • 样本量充足。经验法则为每个纳入模型的自变量至少对应10个结局事件(EPV≥10),纳入变量越多,所需事件数越多。
  • 注意完全分离、稀疏数据和强影响点等问题。

三、医学实例

某研究纳入300例接受腹部手术的患者,随访30天,观察是否发生术后并发症(发生=1,未发生=0),其中发生并发症90例,未发生210例。考察的因素包括年龄、体质指数(BMI)、是否合并糖尿病和是否吸烟,变量赋值见表1。

变量赋值或单位
术后并发症0=未发生,1=发生
年龄连续变量,按每增加10岁
BMI连续变量,kg/m²,每增加1个单位
糖尿病0=无,1=有(以"无"为参照)
吸烟0=无,1=有(以"无"为参照)

本研究中结局事件为90例,纳入4个自变量,平均每个自变量对应22.5个事件,满足EPV≥10的经验要求。分类自变量糖尿病、吸烟均以"无"作为参照水平;年龄按每增加10岁、BMI按每增加1个单位进入模型。建立二元Logistic回归模型,结果见表2。

自变量β标准误Wald χ²POROR的95%CI
年龄(每10岁)0.5120.1867.580.0061.6681.158~2.403
BMI(每1个单位)0.1480.0615.890.0151.1601.029~1.307
糖尿病(有 vs 无)0.8740.3127.850.0052.3971.301~4.417
吸烟(有 vs 无)0.4210.2982.000.1571.5240.850~2.732
常数项-4.2130.84225.04<0.0010.015—

模型整体检验提示模型有意义,Hosmer-Lemeshow拟合优度检验 χ²=6.42,自由度8,P=0.600,P值大于0.05,提示模型拟合情况可以接受。以预测概率绘制受试者工作特征曲线,曲线下面积(AUC)约为0.78。

四、结果解读

年龄的OR为1.668(95%CI:1.158~2.403),P=0.006,说明在其他因素不变的条件下,年龄每增加10岁,发生术后并发症的优势约增加66.8%。BMI的OR为1.160(95%CI:1.029~1.307),P=0.015,说明BMI每增加1个单位,并发症发生优势约增加16.0%。糖尿病的OR为2.397(95%CI:1.301~4.417),P=0.005,提示合并糖尿病者并发症的发生优势约为无糖尿病者的2.4倍。吸烟的OR为1.524(95%CI:0.850~2.732),P=0.157,置信区间包含1,提示在本资料中吸烟与并发症的关联尚无统计学意义。

需要强调,OR对应的参照水平决定了解释方向。上例中糖尿病的OR是"有糖尿病相对于无糖尿病",若把参照水平改为"有",OR将变为原来的倒数(约0.417)。因此各自变量的参照水平必须在结果中明确写出。

当自变量较多时,可先做单因素分析,再把有意义的变量纳入多因素模型;但变量筛选不能只依赖P值,还要结合临床意义,避免遗漏重要混杂因素。若怀疑两个因素存在交互作用,可在模型中引入乘积项,此时乘积项的OR反映的是相对效应上的偏离程度,解释需谨慎,并报告交互项的检验结果。

五、常见错误用法

  • 把连续变量随意分组后建模,损失信息并可能引入虚假的阈值效应。
  • 忽视EPV经验法则,自变量过多导致过拟合,系数和OR不稳定。
  • 把OR当作相对危险度解释,尤其在结局较常见时夸大效应。
  • 不说明分类自变量的参照水平,导致OR含义不清。
  • 未检查多重共线性与线性假设,或对完全分离不作处理。
  • 对有缺失的数据直接删除,可能造成选择偏倚。

六、注意事项

Logistic回归给出的是关联而非因果,因果推断仍需依赖研究设计。模型报告应包含自变量的编码与参照水平、OR及其95%置信区间、模型整体检验以及拟合优度信息。自变量较多时,可结合临床意义与变量筛选策略确定最终模型,并在结果中如实报告。