二元Logistic回归是一种用于分析二分类结局变量(如患病与未患病、有效与无效、存活与死亡)与一个或多个自变量之间关系的回归方法。当结局只有两种可能结果时,普通线性回归不再适用:它可能预测出概率范围以外的数值,残差也不再满足方差齐性与正态性。Logistic回归对结局发生的概率作logit变换,把取值在0到1之间的概率映射到整个实数轴,从而建立自变量与结局概率之间的线性关系。
它的核心用途有两个:一是筛选与结局相关的危险因素或保护因素,二是估计各自变量对结局发生优势的效应大小。队列研究、病例对照研究和横断面研究都可以使用,特别适合结局为二分类的资料。
一、模型形式与效应指标
设结局发生的概率为P,模型为 ln[P/(1-P)] = β0 + β1X1 + β2X2 + … + βmXm。回归系数βi表示自变量Xi每改变一个单位时,logit(P)的平均改变量。把βi取指数即为优势比 OR=exp(βi),它表示在其他自变量保持不变的条件下,Xi每增加一个单位,结局发生的优势(odds)变为原来的多少倍。OR大于1提示危险因素,小于1提示保护因素,等于1提示无关联。
OR是条件优势比,并不等同于相对危险度。当结局发生率较低(通常低于10%)时,OR可以近似看作相对危险度;结局较常见时二者差别明显,此时不宜把OR直接解释为风险倍数。
二、应用条件
- 因变量为二分类变量,通常把关注的事件编码为1、未发生编码为0。
- 各观测相互独立,一般不适用于重复测量或聚集性数据,这类资料需考虑其他模型。
- 自变量与logit(P)之间呈线性关系;连续变量线性关系不明显时,可考虑引入多项式项或样条。
- 自变量之间不存在严重多重共线性,否则系数估计不稳定。
- 样本量充足。经验法则为每个纳入模型的自变量至少对应10个结局事件(EPV≥10),纳入变量越多,所需事件数越多。
- 注意完全分离、稀疏数据和强影响点等问题。
三、医学实例
某研究纳入300例接受腹部手术的患者,随访30天,观察是否发生术后并发症(发生=1,未发生=0),其中发生并发症90例,未发生210例。考察的因素包括年龄、体质指数(BMI)、是否合并糖尿病和是否吸烟,变量赋值见表1。
| 变量 | 赋值或单位 |
| 术后并发症 | 0=未发生,1=发生 |
| 年龄 | 连续变量,按每增加10岁 |
| BMI | 连续变量,kg/m²,每增加1个单位 |
| 糖尿病 | 0=无,1=有(以"无"为参照) |
| 吸烟 | 0=无,1=有(以"无"为参照) |
本研究中结局事件为90例,纳入4个自变量,平均每个自变量对应22.5个事件,满足EPV≥10的经验要求。分类自变量糖尿病、吸烟均以"无"作为参照水平;年龄按每增加10岁、BMI按每增加1个单位进入模型。建立二元Logistic回归模型,结果见表2。
| 自变量 | β | 标准误 | Wald χ² | P | OR | OR的95%CI |
| 年龄(每10岁) | 0.512 | 0.186 | 7.58 | 0.006 | 1.668 | 1.158~2.403 |
| BMI(每1个单位) | 0.148 | 0.061 | 5.89 | 0.015 | 1.160 | 1.029~1.307 |
| 糖尿病(有 vs 无) | 0.874 | 0.312 | 7.85 | 0.005 | 2.397 | 1.301~4.417 |
| 吸烟(有 vs 无) | 0.421 | 0.298 | 2.00 | 0.157 | 1.524 | 0.850~2.732 |
| 常数项 | -4.213 | 0.842 | 25.04 | <0.001 | 0.015 | — |
模型整体检验提示模型有意义,Hosmer-Lemeshow拟合优度检验 χ²=6.42,自由度8,P=0.600,P值大于0.05,提示模型拟合情况可以接受。以预测概率绘制受试者工作特征曲线,曲线下面积(AUC)约为0.78。
四、结果解读
年龄的OR为1.668(95%CI:1.158~2.403),P=0.006,说明在其他因素不变的条件下,年龄每增加10岁,发生术后并发症的优势约增加66.8%。BMI的OR为1.160(95%CI:1.029~1.307),P=0.015,说明BMI每增加1个单位,并发症发生优势约增加16.0%。糖尿病的OR为2.397(95%CI:1.301~4.417),P=0.005,提示合并糖尿病者并发症的发生优势约为无糖尿病者的2.4倍。吸烟的OR为1.524(95%CI:0.850~2.732),P=0.157,置信区间包含1,提示在本资料中吸烟与并发症的关联尚无统计学意义。
需要强调,OR对应的参照水平决定了解释方向。上例中糖尿病的OR是"有糖尿病相对于无糖尿病",若把参照水平改为"有",OR将变为原来的倒数(约0.417)。因此各自变量的参照水平必须在结果中明确写出。
当自变量较多时,可先做单因素分析,再把有意义的变量纳入多因素模型;但变量筛选不能只依赖P值,还要结合临床意义,避免遗漏重要混杂因素。若怀疑两个因素存在交互作用,可在模型中引入乘积项,此时乘积项的OR反映的是相对效应上的偏离程度,解释需谨慎,并报告交互项的检验结果。
五、常见错误用法
- 把连续变量随意分组后建模,损失信息并可能引入虚假的阈值效应。
- 忽视EPV经验法则,自变量过多导致过拟合,系数和OR不稳定。
- 把OR当作相对危险度解释,尤其在结局较常见时夸大效应。
- 不说明分类自变量的参照水平,导致OR含义不清。
- 未检查多重共线性与线性假设,或对完全分离不作处理。
- 对有缺失的数据直接删除,可能造成选择偏倚。
六、注意事项
Logistic回归给出的是关联而非因果,因果推断仍需依赖研究设计。模型报告应包含自变量的编码与参照水平、OR及其95%置信区间、模型整体检验以及拟合优度信息。自变量较多时,可结合临床意义与变量筛选策略确定最终模型,并在结果中如实报告。