医学统计助手.功能简介

最新版本:V17.1.2

发布日期:2026.09.02

医学统计助手,是专为医学统计而设计的专业统计分析软件,简单易用。功能涵盖基础统计、卡方检验、t检验、z检验、比例检验、秩和检验、Cochran Q检验、游程检验、一致性检验、方差齐性检验、方差分析、回归分析、相关分析、诊断试验评价、生存分析、Meta分析、聚类分析、判别分析、主成分分析、因子分析、问卷分析、随机数生成、批量分析和统计图等二十一大类实用功能。

一、软件特点
     界面简洁直观,输入数据、选择方法、点击计算,三步完成分析,无需编程基础。
     体积小,速度快,无广告,无插件,本地运行,激活后断网可用,不收集、不上传任何用户分析数据,数据仅保存在本机。

二、软件安装

      支持多种应用商店安装:微软Store、360软件管家、腾讯软件市场、联想应用商店等,或查看下载与安装说明。

三、主要功能

一、描述与基础统计

基础统计描述性统计量、缺失值、频数分布、正态分布、二项分布、泊松分布、样本量估算
随机数生成均匀、正态、卡方、t、F、Poisson、二项、指数、Gamma、负二项、Beta、Weibull、对数正态、均匀整数、伯努利、无放回抽样、有放回抽样(Bootstrap)、截断正态
计算器常规计算、医学计算

二、假设检验

卡方检验四格表、行×列表、配对资料、多分类配对资料、Fisher 精确检验、卡方 P 值
t 检验独立样本(汇总/原始)、配对样本、单样本(汇总/原始)、t 检验 P 值
Z 检验独立样本(汇总/原始)、配对样本、单样本(汇总/原始)、Z 检验 P 值
比例检验独立样本(汇总/原始)、配对样本、单样本(汇总/原始)
秩和检验配对、单样本、独立、等级资料、Kruskal-Wallis H、Friedman M
科克伦检验二分类 Cochran Q
游程检验二分类游程、数值变量游程
一致性检验Kappa、Kendall 协调系数、ICC 组内相关系数
方差齐性检验F、Levene、Brown-Forsythe、Bartlett、Fligner-Killeen

三、方差 / 回归 / 相关

方差分析完全随机设计、简易计算、随机区组、重复测量、多因素、协方差(ANCOVA)
回归分析线性、逐步、二分类 Logistic、有序 Logistic、泊松、负二项
相关分析Pearson 直线相关、Spearman 秩相关、Kendall 秩相关、偏相关

四、高级统计

生存分析Kaplan-Meier、寿命表法、生存率比较、Cox 回归
ROC 曲线ROC 曲线分析、多变量 AUC 比较、AUC 样本量估算
Meta 分析连续型变量(MD/SMD)、相关系数 r/z、OR、RR、RD、HR、AUC、单组比例、通用逆方差
聚类分析样本聚类、变量聚类、K 均值聚类
判别分析线性判别(LDA)、二次判别(QDA)
主成分分析PCA
因子分析主成分法、主轴因子法
问卷分析题型设置、数据概览、综合分析、交叉分析、量表综合分析

五、统计图表(25 种图形)

条形图、折线图、箱线图、小提琴图、山脊图、饼图、环形图、散点图、热力图、棒棒糖图、蜂群图、带状图、马赛克图、直方图、Q-Q 图、P-P 图、ECDF 图、哑铃图、面积图、雷达图、凹凸图、瀑布图、矩形树图、坡度图、意大利面图。

医学统计助手 V16.1 功能整理与软件评价

一、软件介绍

医学统计助手是一款专为医学科研、公共卫生及临床研究打造的统计分析软件。以经典医学统计学理论为基石,各项分析按标准统计学方法实现。

【专业全面】涵盖描述统计、假设检验、回归分析、生存分析等二十余类方法。支持t检验、卡方检验、秩和检验等假设检验;提供单因素、多因素、重复测量等方差分析;集成线性回归、Logistic回归、泊松回归等建模工具;包含Pearson、Spearman、Kendall等多种相关分析;支持Kaplan-Meier法、Cox回归等生存分析;具备聚类、判别、主成分、因子等多变量分析功能。

【问卷专属】独立的问卷分析模块,支持单选、多选、数值、量表、排序等题型设置,实现数据概览、综合统计、交叉分析、分层汇总及信效度检验,一站式完成问卷数据处理。

【可视呈现】内置条形图、折线图、箱线图、小提琴图、饼图、散点图、热力图、正态分布图等统计图表,支持编辑美化,助力成果展示。

【便捷安全】界面简洁直观,输入数据、选择方法、点击计算,三步完成分析,无需编程基础。本地运行,断网可用,不收集、不上传任何用户数据,数据仅保存在本机。

【持续服务】激活用户可在当前版本内免费升级,持续新增统计方法与功能优化。

二、功能模块整理

1. 基本统计功能(5项)

  • 描述性统计量
  • 缺失值处理
  • 频数分布
  • 正态分布检验
  • 样本量估算

2. 卡方检验(6项)

  • 四格表卡方检验
  • 行×列表卡方检验
  • 配对资料卡方检验(McNemar检验)
  • 多分类配对资料卡方检验(Bowker检验)
  • Fisher精确检验
  • 卡方P值计算

3. t检验(6项)

  • 独立样本t检验(汇总数据/原始数据)
  • 配对样本t检验
  • 单样本t检验(汇总数据/原始数据)
  • t检验P值计算

4. Z检验(6项)

  • 独立样本Z检验(汇总数据/原始数据)
  • 配对样本Z检验
  • 单样本Z检验(汇总数据/原始数据)
  • Z检验P值计算

5. 比例检验(5项)

  • 独立样本比例检验(汇总数据/原始数据)
  • 配对样本比例检验
  • 单样本比例检验(汇总数据/原始数据)

6. 秩和检验(6项)

  • 配对样本秩和检验
  • 单样本秩和检验
  • 两独立样本秩和检验
  • 等级资料秩和检验
  • Kruskal-Wallis H检验
  • Friedman M检验

7. 其他检验(2项)

  • 科克伦Q检验
  • 游程检验(二分类/数值型)

8. 一致性检验(3项)

  • Kappa系数
  • Kendall协调系数
  • ICC组内相关系数

9. 离散分布(2项)

  • 二项分布
  • Poisson分布

10. 随机数生成(1项)

11. 方差齐性检验(5项)

  • F检验
  • Levene检验
  • Brown-Forsythe检验
  • Bartlett检验
  • Fligner-Killeen检验

12. 方差分析(6项)

  • 完全随机设计方差分析
  • 简易计算方差分析
  • 随机区组设计方差分析
  • 重复测量设计方差分析
  • 多因素方差分析
  • 协方差分析

13. 回归分析(5项)

  • 线性回归
  • 逐步回归
  • 二元Logistic回归
  • Poisson回归
  • 负二项回归

14. 相关分析(4项)

  • Pearson相关
  • Spearman相关
  • Kendall相关
  • 偏相关

15. 生存分析(4项)

  • Kaplan-Meier法
  • 寿命表法
  • 生存率比较
  • Cox回归

16. 聚类分析(3项)

  • 样本聚类
  • 变量聚类
  • K均值聚类

17. 判别分析(2项)

  • LDA(线性判别分析)
  • QDA(二次判别分析)

18. 主成分分析(1项)

19. 因子分析(2项)

  • 主成分法因子分析
  • 主轴因子法因子分析

20. 问卷分析(6项)

  • 题型设置
  • 数据概览
  • 综合分析
  • 交叉表分析
  • 分层交叉分析
  • 量表信效度分析

21. 统计图(8类)

  • 条形图/柱状图
  • 折线图
  • 箱线图
  • 小提琴图
  • 饼图
  • 散点图
  • 热力图
  • 正态分布图(密度直方图、频数直方图、频率直方图、Q-Q图、P-P图)

22. 工具

  • 计算器
  • 随机数生成
  • 临界值查表

三、软件评价

✅ 优势

  1. 功能全面
  • 涵盖22个主功能模块,120+个明细功能
  • 从基础统计到高级多变量分析一应俱全
  • 特别适合医学科研、公共卫生、临床研究等领域
  1. 帮助文档完善
  • 每个功能都有详细的操作步骤
  • 包含方法说明、术语解释、应用条件
  • 提供结果解释和注意事项
  • 有实际应用场景说明
  1. 数据输入灵活
  • 支持汇总数据和原始数据两种输入方式
  • 支持多种数据格式(xlsx、csv等)
  • 问卷分析支持单选题、多选题、数值题、量表题、排序题
  1. 可视化丰富
  • 提供8大类统计图
  • 支持图表编辑和导出
  • 正态分布图提供5种子类型
  1. 统计方法严谨
  • 提供多种检验方法供选择(如方差齐性检验有5种方法)
  • 包含事后比较、多重比较校正
  • 提供效应量指标

⚠️ 局限性

  1. 版本限制
  • 部分功能显示"未激活版"
  • 可能存在功能或次数限制
  1. 学习曲线
  • 功能众多,初学者可能需要时间熟悉
  • 部分高级统计方法需要专业知识
  1. 数据要求
  • 某些分析对样本量有要求
  • 需要满足特定的统计假设

📊 适用人群

  • 临床医生、护士、药师等医疗专业人员
  • 医学科研人员、研究生
  • 公共卫生、流行病学研究人员
  • 医药企业研发人员
  • 医学院校师生

🎯 总体评价

医学统计助手 V16.1 是一款功能全面、专业性强的医学统计软件,特别适合医学科研领域使用。其优势在于:

  1. 功能覆盖全面:从基础描述统计到高级多变量分析,基本满足医学研究的各种统计需求
  2. 操作相对简便:提供详细帮助文档,降低使用门槛
  3. 结果输出规范:包含统计表格和可视化图表,便于论文撰写
  4. 方法选择多样:同一分析目的提供多种方法选择

建议:

  • 初学者建议从基础统计功能开始学习
  • 使用前应了解各统计方法的应用条件
  • 复杂分析建议咨询专业统计人员
  • 注意样本量要求和数据质量

以上为开发者自行整理的功能说明与自评,非第三方评测。

本文所述功能与适用范围以软件实际版本为准,请结合自身研究需求判断是否适用。

卡方检验计算公式

      卡方检验应用于两个率或两个构成比比较;多个率或多个构成比比较以及分类资料的相关分析等。 分类为独立样本卡方检验和配对样本卡方检验,独立样本卡方检验包括四格表卡方检验和行乘列卡方检验, 配对样本卡方检验分为四格表形式的配对资料卡方检验和R×R列联表卡方检验。
一、四格表卡方检验
四格表卡方检验是卡方检验中最常使用的方法。四格表即2×2列联表,表内有a、b、c、d4个基本数据,其余数据均由此4个数据推算出来的,故称为四格表资料。如下表。

组别达标未达标合计
对照组aba+b
实验组cdc+d
合计a+cb+dn


1.基本公式

A表示实际频数,T表示理论频数。

计算过程:

 𝑇𝑅𝐶 表示第R行第C列的理论(期望)频数,𝑛𝑅 表示第R行合计, 𝑛𝐶 表示第C列合计,n表示总合计。例如第一个单元格,为第1行第1列,实际频数a,理论频数,同理,,。

代入基本公式

自由度df=(行数-1)(列数-1)=(2-1)(2-1)=1

2.专用公式

N≥40 且最小理论频数T≥5

3.连续性矫正公式

N≥40 且最小理论频数1≤T<5

4.n<40或最小理论频数T<1用Fisher精确检验,又叫确切概率检验

      在计算小样本的P值时,不能根据卡方检验公式计算,可以使用Fisher精确检验直接计算出P值,Fihser精确检验只适用于计算小样本计数资料。

二、行乘列R×C格式卡方检验公式
      行乘列卡方检验时,要求不能有20%以上的单元格理论频数小于5,或者不能有任意一个单元格理论频数小于1,否则容易出现偏差。

1.计算行乘列卡方检验可以使用基本公式

因该式需要计算大量理论频数 𝑇𝑅𝐶 较为繁琐,所以一般使用专用公式计算行乘列卡方检验。

2.专用公式

自由度df=(行数-1)(列数-1)

三、配对资料卡方检验公式
      配对资料也可以分为定量资料和定性资料,在定量资料中,如果数据符合正态分布的话,一般使用配对t检验,如果不符合正态分布, 一般使用Wilcoxon符号秩和检验。在定性资料中,又可以分为配对四格表资料和RxR列联表资料,配对四格表资料一般应用McNemar卡方检验, RxR列联表资料一般应用McNemar-Bowker卡方检验。
配对四格表卡方检验公式:
1.b+c≥40

2.b+c<40

连续矫正公式

自由度df=1

四、配对资料R×R列联表卡方检验公式

      配对设计R×R的列联表资料(R>2)使用McNemar-Bowker检验(麦克尼马尔-鲍克检验),当R=2时,等同于McNemar检验。 对于配对设计两分类资料, 经典的方法是使用四格表的配对检验,也称McNemar检验。而对于配对设计多分类资料,可以使用McNemar-Bowker检验。该检验由A.H.Bowkor在1948年提出。 Bowker检验也称平方表检验或对称检验,是McNemar检验的一般化及扩展。

自由度df=k(k-1)/2,如果有对称的两个单元格之和为0,则在公式中排除,自由度也相应的要减少。

五、卡方检验p值计算公式

卡方检验P值就是卡方分布的分布函数值,计算公式为:

公式中分子为不完全伽马函数,分母为伽马函数。
分母中伽马函数需要使用斯特林公式来近似求伽马函数:

分子中不完全伽马函数计算公式:

其中M函数是合连几何函数,计算公式:

网页内容为作者收集整理创作,转载引用请附上本网址链接。

使用软件计算卡方检验

医学统计助手(www.statsas.com)

问卷信度分析:Cronbach α 的用法与常见误区

一份 10 个条目的糖尿病自我管理行为量表,答案用 5 级评分(1=从不,5=总是),在某社区 2 型糖尿病患者中回收有效问卷 132 份。算下来 Cronbach α=0.858。这个数字报出去,审稿人会不会追问?通常会。

因为 α 只是信度分析的一个输出。它回答的是"这组条目测得一致不一致",但不回答是哪几个条目在拖后腿、删掉一个会不会更好、这个分数用来随访个体变化够不够精确。这些问题,靠一个 α 是看不出来的。

α 到底在算什么

Cronbach α 的公式是

α = k/(k−1) × (1 − Σσᵢ²/σ总²)

其中 k 是条目数,σᵢ² 是第 i 个条目的方差,σ总² 是量表总分的方差。括号里那一项的含义是:总分方差中,不能被各条目自身方差解释的那部分——也就是条目之间"共变"的部分。k/(k−1) 是一个随条目数增大的校正系数。所以 α 越高,说明条目之间越同向、越抱团。

把本例的数字代进去:10 个条目的方差之和为 7.315,总分方差为 32.06,括号内为 1−7.315/32.06=0.772,再乘 10/9,得 0.858。用公式算一遍,比看软件输出的数字更能明白它在衡量什么。

光有一个 α 不够,还要看条目

信度分析的价值一大半在条目层面。下表是这份量表的完整结果:各条目的均数、标准差、条目与总分的相关(CITC,条目分与"其余条目之和"的相关系数),以及删除该条目后 α 的变化。

条目内容均数±标准差CITC删除后 α
1按医嘱按时按量服药3.61±0.820.6600.836
2按计划监测血糖3.67±0.860.6100.840
3控制主食与含糖食物3.67±0.850.5600.845
4每周进行中等强度身体活动3.59±0.880.5920.842
5每天检查足部皮肤3.71±0.790.5250.847
6出现低血糖时能正确应对3.67±0.780.3270.862
7定期复查糖化血红蛋白3.64±0.920.6170.839
8控制体重3.78±0.860.5650.844
9戒烟限酒3.73±0.900.5820.843
10主动与医生沟通病情3.74±0.890.5930.842

总分 36.82±5.66,实际得分范围 24~50。各条目均数都在 3.6~3.8 之间,没有明显的天花板或地板效应(若大量患者所有条目都选 5 分,总分方差被压缩,α 会被压低,那是测量工具的毛病而不是信度的毛病)。条目间平均相关 0.374,最小 0.123,最大 0.531。

这张表里最值得说的是条目 6。“出现低血糖时能正确应对"的 CITC 只有 0.327,低于常用的 0.4 参考线;删除它之后 α 从 0.858 升到 0.862。看到这里,常见的做法是"删掉它,α 就上去了”。

这样处理值得商榷。低血糖应对处理的是急性事件中的行为,而其余九个条目测的是日常的、持续性的自我管理。它与其他条目相关性低,恰恰说明它测的是另一类内容,而不是它"没用"。一个条目在内容上属于量表要测的构念、但统计上表现不佳时,首先要问的是:它是独立的维度,还是表述让人误解,还是在这批样本里变异太小。本例中条目 6 的标准差 0.78 是十个条目里最小的,说明回答比较集中,这也压低了它与总分的相关。仅凭一次预调查的 α 就删条目,很可能删掉量表的覆盖面。稳妥的做法是结合内容效度、在其他样本中重复验证,再决定去留。

另外,删除条目后期望 α 上升的幅度只有 0.004,本来就属于噪声级别,不足以支撑删除的决定。

α 高不高,看用途

常见的判断标准是:0.9 以上很好,0.8~0.9 良好,0.7~0.8 可以接受,0.6~0.7 勉强可用于探索性研究,低于 0.6 说明内部一致性不足。这些界限是经验性的,不必当作硬门槛,但它们背后的逻辑要清楚——信度要求取决于分数用来做什么。

如果量表是用来给群体分类、比较组间均数(比如比较干预组与对照组的自我管理得分),α 在 0.8 左右通常够用。如果要用这个分数给个体下判断、或追踪某位患者前后的变化,要求就高得多,因为它直接决定了两点之差有多少是真实的改变、有多少是测量误差。这时候真正需要报告的是测量标准误。

本例量表总分的标准差为 5.66,α=0.858,测量标准误 SEM=5.66×√(1−0.858)=2.14 分;对应的最小可检测变化(MDC95)约为 5.92 分。意思是,同一位患者前后两次测量,得分变化要达到 5.9 分左右,才能比较有把握地说这是真实变化,而不是测量波动。总分范围是 10~50 分,6 分的变化并不小。这条信息对解释随访数据非常关键,却常常被漏报。

α 的三个常见误用

第一,把 α 的高低当成量表质量的唯一标尺。α 会随条目数单调上升。本例十个条目 α=0.858,只用前 6 个条目算就只有 0.775,只用前 3 个条目是 0.708。也就是说,往量表里塞进更多高度相似的条目,α 一定更好看,但这既没有提高内容效度,也谈不上测量得更准。比较两个量表的 α,必须在条目数相近的前提下才有意义。

第二,用高 α 证明量表是单维的。α 衡量的是条目间的平均一致性,一个由三个相关维度组成的量表,整体 α 同样可以很高,因为维度之间本身也相关。要判断维度结构,需要做探索性或验证性因子分析。用 α 来论证单维性,是信度分析里最常见的越界。

第三,α 与重测信度混为一谈。α 反映的是同一时点内部一致,与时间稳定性无关;一份量表可能内部高度一致(所有条目问的其实是同一句话的几种说法),但隔两周重测却对不上。考察稳定性需要重测信度或评定者间一致性,那要用另一套方法(例如 ICC),α 替代不了。

顺带一提,α 还有一个前提:它假定各条目对总分的贡献权重相同、误差方差相等(τ 等价)。这个假定在条目难度差异大时并不成立。近年来不少方法学文献建议同时报告 ω 系数,它对权重不作等值假设,解释也更直接。作为作者,报告 α 的同时给出分半信度或 ω,是更稳妥的做法。

本例的其他信度证据

把十个条目按奇偶数分成两半,两半得分相关 r=0.746,经 Spearman-Brown 公式校正后为 0.854;按前五条与后五条分半,校正后为 0.849。三种拆分方式给出的结果都在 0.85 附近,与 α 吻合,说明结果不是某一种计算方式带来的。

需要注意的是,分半信度依赖于拆分方式,同一份数据奇偶分半和前后分半能得到不同的数值,报告时应当写明拆法。也正因为这个缺点,分半信度现在多作为 α 的补充,而不是替代。

在软件里做信度分析

把问卷原始数据整理成 CSV,一行一份问卷,一列一个条目(本题为 10 列 132 行),在医学统计助手中打开问卷分析模块,可以直接得到题型识别、整体概览与条目摘要;信度分析选 Cronbach α,勾选需要纳入的条目列即可。软件会输出总量表的 α,以及每个条目的 CITC 和删除后 α,正好对应本文上面那张表。需要分半信度时,用同样的数据再跑一次即可。

最后提醒一句:信度是效度的必要条件而非充分条件。α 达到 0.858,只说明这份量表测得稳定、内部抱团,并不能证明它测的确实是"自我管理行为"而不是别的东西。量表能不能用,还要看内容效度、结构效度以及与外部标准的关联,那是另一篇文章的内容了。

协方差分析:基线不齐时如何比较两组疗效

某研究回顾性纳入 40 例 2 型糖尿病患者,比较两种口服降糖方案治疗 12 周后的血糖控制情况。方案 A 为二甲双胍联合 DPP-4 抑制剂,方案 B 为二甲双胍联合磺脲类,两组各 20 例,疗效指标是糖化血红蛋白(HbA1c,%)。

治疗 12 周后,A 组 HbA1c 为 6.65±0.69%,B 组为 6.67±0.70%,两组相差 0.02%,独立样本 t 检验 t=−0.09,P=0.93。照这个结果写结论,两种方案降糖效果相当。

这个结论是错的。问题出在起点。

入组时 A 组 HbA1c 为 8.57±0.90%,B 组为 7.95±0.85%,A 组平均高出 0.62%,差异有统计学意义(t=2.26,P=0.029)。两组的终点值看着一样,但 A 组是从更差的水平降下来的:A 组平均下降 1.93±0.47%,B 组下降 1.28±0.41%。同样是 6.6% 左右的终点,一个起点是 8.6%,另一个是 7.9%,这两件事的临床含义并不相同。

终点值相同,为什么会得出相反的答案

关键在于基线在两组之间不均衡,而基线本身又是终点最强的预测因素。本例中基线与终点的相关系数约为 0.87。当这样一个变量同时与分组有关、又与结局有关时,它就是一个混杂因素。直接比较终点值,等于把两组的基线差异一并算进了疗效里。

A 组基线更高,而 HbA1c 存在"回归到均值"的现象——基线偏高的个体,即使不做任何干预,复测时也倾向于向均值回落。所以基线高的 A 组天然会有更大的降幅。两组终点打平,既可能是 A 方案真的更强,也可能只是回归到均值的假象。单看终点值,无法区分这两种解释。

协方差分析在做什么

协方差分析(analysis of covariance,ANCOVA)把基线作为协变量放进模型,同时估计基线的回归系数和组间效应:

终点 HbA1c = 常数 + b₁×基线 HbA1c + b₂×组别

其中组别取 A=1、B=0。这个式子回答的问题是:如果两组的基线处在同一水平,它们的期望终点分别是多少。基线差异被"扣除"之后,剩下的才是组间效应。

本例拟合结果为:

终点 HbA1c = 1.191 + 0.689×基线 HbA1c − 0.451×组别

组别系数 −0.451(95%CI:−0.688~−0.213),t=−3.84,P=0.0005。也就是说,在基线相同的前提下,A 组的期望 HbA1c 比 B 组低 0.45 个百分点。令两组基线都取总体均数 8.26%,得到的调整均数为 A 组 6.43%、B 组 6.88%,差距 0.45 个百分点——同一个模型换一种表达方式而已。

方差分析部分:组别 F=14.75,df=(1,37),P=0.0005,偏 η²=0.285;基线 F=113.27,P<0.001,偏 η²=0.754。基线对终点的解释力远大于分组,这也从侧面说明,把它排除在模型之外会损失多少信息。

换一种说法:调整基线后的结论

把上面两个结果放在一起看,本例的完整结论应该是:两组治疗 12 周后的 HbA1c 终点值接近,但 A 组基线更高;在校正基线差异后,A 组比 B 组多降低约 0.45 个百分点(95%CI 0.21~0.69),差异有统计学意义。至于这 0.45 个百分点有没有临床意义,又是另一个需要结合指南阈值来判断的问题——统计学显著并不自动等于临床重要。

能不能用变化值代替

既然终点值相同、基线不同,一个自然的想法是比较"下降幅度"。本例变化值为 A 组 1.93±0.47%、B 组 1.28±0.41%,t=4.66,P<0.001,同样得到显著差异,看上去比协方差分析更"干脆"。

但变化值分析隐含了一个假设:终点与基线的回归系数等于 1。也就是它认为,无论基线是多少,个体都会以同样的幅度改变。本例实际估计出的系数是 0.689,明显不等于 1。当真实系数小于 1 时,用变化值做比较会系统性放大基线较高那一组的疗效,因为它把回归到均值的部分算成了治疗效果。协方差分析不预设这个系数,而是从数据里估计它,因此在基线不齐时更可靠。

反过来说,如果两组基线均衡(例如样本量充足的随机对照试验),变化值和协方差分析的结论通常是一致的,这时用哪个差别不大。协方差分析真正不可替代的场合,正是基线不齐的非随机资料——回顾性队列、真实世界研究、单臂对照等。

用之前要确认的几件事

协方差分析的结论建立在几条假设上,报告结果时应当一并给出检验结果。

回归线的平行性,也叫斜率齐性。它要求两组的"终点对基线"回归斜率相同,模型才可以用一个共同的 b₁。检查办法是在模型里加入组别与基线的交互项:本例交互项系数 −0.070,t=−0.53,P=0.597,两条回归线近似平行,条件满足。如果交互项显著(P<0.05),说明基线对终点的影响在两组间不同,此时不宜报告单一的调整均数差,应当分别给出两组的回归式,或者改用其他模型。

线性关系。协方差分析假定终点与基线近似线性相关。基线是连续变量的场合,可以先画散点图看一眼;如果关系明显弯曲,可考虑对基线做变换或加入二次项。

残差的正态性与方差齐性。本例残差的 Shapiro-Wilk 检验 W=0.981,P=0.725;基线在两组间的方差齐性检验(Levene 法)P=0.681,都可以接受。

协变量必须是"分组之前"测量的。基线 HbA1c 是入组时测的,在分组之前,作为协变量是合适的。但把治疗过程中某个中间变量(比如 6 周时的血糖)放进模型就不对了——那是分组之后的结果,属于中介变量,校正它会掩盖真实的组间差异,甚至把效应完全"校正掉"。

协变量不能有大的测量误差。如果基线本身就是个测得很粗糙的指标,校正会不充分,剩下的偏差仍然会留在结论里。

不要在基线范围之外外推。本例基线范围大致是 5.3%~10.4%,模型给出的调整结果只在这个区间内成立。若把它用于基线 12% 的患者,结论未必成立。

最后一点常被忽略:协方差分析校正的是"测量到的"基线差异。如果还存在没测到的组间不均衡(比如病程、用药依从性、饮食控制),协方差分析并不能替你消除它们,这些因素需要在设计阶段考虑,或者在敏感性分析中讨论。

在软件里怎么做

把数据整理成三列——分组、基线值、终点值,一行一个观察对象——在医学统计助手中选择协方差分析,指定分组变量、协变量与结局变量即可,软件会输出组别与协变量的系数、标准误、t 值、P 值与置信区间,以及调整后的组间均数差和偏 η²。若要顺手核对斜率齐性,再跑一次带交互项的模型就能看出两条回归线是否平行。

文末附表给出本例的 40 例原始数据,可以自己复核上面的每一个数字。

编号A组基线A组终点B组基线B组终点
18.96.67.97.1
210.27.87.96.4
310.48.17.46.1
48.76.17.36.4
57.36.58.36.8
68.56.28.77.7
78.86.88.06.8
87.35.67.66.8
97.96.58.97.3
109.37.29.27.6
119.87.77.76.7
127.26.27.65.7
138.86.65.34.7
148.36.68.76.6
158.76.77.76.0
167.65.47.46.6
178.96.98.67.4
188.26.78.67.2
198.56.88.67.0
208.15.97.56.4

ROC曲线与AUC.医学统计实例详解

在临床研究中,经常需要评价一项诊断试验(如某个血清标志物、影像征象或量表评分)区分"有病"与"无病"的能力。判断准确性不能只看某一个截断值下的灵敏度或特异度:截断值定得低,灵敏度升高但特异度下降;定得高则相反。两者此消彼长,任何单一截断值都只反映诊断试验在某一点上的表现。ROC曲线(受试者工作特征曲线,Receiver Operating Characteristic curve)把各种可能截断值下的表现连成一条曲线,从整体上描述诊断试验的判别能力;曲线下面积(AUC)则用一个数值概括这一能力。

ROC分析适用于结局为二分类的诊断试验资料,要求每个研究对象都有明确的金标准诊断结果,以及一个连续型或等级型的检验指标。

一、四格表与基本指标

以金标准为参照,把检验结果与真实情况交叉分类,得到四格表:真阳性(TP)为确实有病且检验阳性,假阳性(FP)为实际无病但检验阳性,假阴性(FN)为确实有病但检验阴性,真阴性(TN)为实际无病且检验阴性。由此定义:

  • 灵敏度 Se=TP/(TP+FN):实际有病者中被正确检出的比例,反映发现病人的能力。
  • 特异度 Sp=TN/(TN+FP):实际无病者中被正确排除的比例,反映排除非病人的能力。
  • 漏诊率=1−Se,误诊率=1−Sp。
  • 约登指数 J=Se+Sp−1:灵敏度与特异度之和减去1,取值越大提示该截断值的综合判别效果越好。
  • 阳性似然比 LR+=Se/(1−Sp),阴性似然比 LR−=(1−Se)/Sp,反映检验结果对患病概率的改变程度。

二、ROC曲线的构造

对检验指标设定一个截断值c,指标大于或等于c判为阳性,小于c判为阴性,即可按上面的公式算出一对灵敏度和特异度。把c从高到低逐个取遍所有观测值,便得到一系列(1−特异度,灵敏度)坐标点。以假阳性率(1−特异度)为横轴、灵敏度为纵轴,把这些点连成曲线,即为ROC曲线。曲线经过(0,0)与(1,1)两点,越偏向图的左上角,说明在相同的误诊率下能获得更高的灵敏度,诊断效能越好。

三、医学实例

某研究评价一种血清标志物X对某疾病的诊断价值,以临床金标准确诊,病例组10例、对照组10例,两组指标值见表1。

组别指标X的实测值
病例组(n=10)3.14.35.86.26.67.07.48.08.59.2
对照组(n=10)1.82.22.63.03.43.74.04.24.54.8

按"指标大于或等于截断值判为阳性"的规则,取若干截断值计算灵敏度和特异度,结果见表2。

截断值灵敏度(%)特异度(%)约登指数
3.1100400.40
4.390800.70
4.880900.70
5.8801000.80
6.2701000.70
7.0501000.50
8.5201000.20

由表2可见,约登指数在截断值5.8处取最大值0.80,对应灵敏度80%、特异度100%。截断值在4.9~5.8之间取任意值时结果相同,故最佳截断值可定为5.8。把这些(1−特异度,灵敏度)点连成曲线,计算曲线下面积AUC约为0.92。

四、结果解读

AUC可以理解为:随机抽取一名患病者和一名非患病者,患病者的指标值高于非患病者的概率。AUC与诊断效能的关系通常按下面的尺度判读。

AUC诊断效能
0.5无判别能力,等同于随机猜测
0.5~0.7较低
0.7~0.9中等
0.9以上较高

上例AUC为0.92,属于较高水平,说明该标志物对疾病有较好的判别能力。最佳截断值取5.8时,灵敏度80%、特异度100%,即能把全部对照组正确排除,同时检出80%的病例。

截断值的选择并不只依赖约登指数。约登指数对灵敏度和特异度同等对待,而实际工作中两者的重要性往往不同:用于筛查时更看重灵敏度,用于确诊时更看重特异度。此时可以结合阳性似然比、阴性似然比以及临床可接受的水平,在ROC曲线上另行选点。

五、常见错误用法

  • 只用单一截断值报告灵敏度和特异度,不给出ROC曲线与AUC,信息不完整。
  • 把AUC直接用于多分类结局或生存资料,这类资料需采用相应的扩展方法。
  • 在样本量很小的情况下下结论。本例20例仅用于演示,AUC的置信区间会很宽,实际研究需要足够大的病例组与对照组。
  • 用同一批数据反复挑选截断值并报告其灵敏度与特异度,造成乐观偏倚,这类选择应在独立样本中验证。
  • 把AUC的高低直接等同于临床价值,忽略指标的可及性、成本与可重复性。

六、注意事项

ROC分析要求金标准本身可靠,否则所有结果都是按有偏的参照计算出来的。病例组与对照组的构成也会影响AUC:对照组中混入不易区分的其他疾病患者,AUC会下降;只选典型病例,AUC则会偏高。报告时应写明金标准、研究对象的来源与纳入排除标准、指标的单位与测定方法,并给出AUC及其95%置信区间。

当同时评价多个指标时,可以比较各自AUC的大小;若两个AUC来自同一批研究对象,属于相关样本,比较时需采用考虑相关性的检验方法。把这一思路推广到多个指标的组合,即为多变量ROC分析。

Meta分析.医学统计实例详解

针对同一临床问题,不同研究常得到方向一致但大小不一的结论,单个研究的样本量有限,结果波动较大。Meta分析把多项符合条件的研究结果按一定规则合并,得到一个合并效应量及其95%置信区间,从而提高估计的精确度和结论的稳健性。它属于系统评价中的定量合并环节,前提是先完成系统的文献检索、严格的纳入排除和质量评价。

Meta分析不是把数字简单平均,而是按每项研究提供信息的多少赋予权重:样本量大、标准误小的研究权重大,样本量小的研究权重小。

一、基本流程与效应量选择

一次完整的Meta分析通常包括:提出明确的临床问题,制定检索策略与纳入排除标准,筛选文献并提取数据,评价纳入研究的偏倚风险,选择效应量并合并,检验异质性,必要时做亚组分析与敏感性分析,最后评估发表偏倚。合并之前必须确认各项研究在研究对象、干预(或暴露)、对照和结局方面具有可比性,即通常所说的可合并性。

效应量的选择取决于结局类型。

  • 二分类结局:常用优势比OR、相对危险度RR或危险差RD,分析时先在log尺度上合并再还原。
  • 连续型结局:各研究使用同一测量量表时用均值差MD,量表或单位不一致时用标准化均值差SMD。MD保留原始单位,临床意义直观;SMD是无单位的相对量。
  • 生存资料:用风险比HR。
  • 相关性研究:用相关系数r,或经Fisher z变换后合并。

二、固定效应与随机效应

合并的核心是逆方差加权法。设第i项研究的效应量为θi、标准误为SEi,则权重wi=1/SEi²,合并效应量为各研究效应量按权重加权的平均,其标准误为1除以权重之和的平方根。

固定效应模型假定所有研究估计的是同一个真值,研究间差异仅来自抽样误差,权重完全由SE决定。随机效应模型则认为各研究的真值本身存在分布(均值μ、方差τ²),权重变为wi=1/(SEi²+τ²),τ²越大,各研究的权重越接近,置信区间也越宽。当研究间存在明显异质性时,随机效应模型更为合适。

三、异质性检验

常用Q检验和I²统计量衡量研究间的差异。Q等于各研究效应量与合并效应量离差平方的加权和,自由度df=k−1(k为研究数),Q大于相应卡方界值时提示存在异质性。I²表示研究间变异占总变异的比例,通常按小于25%、25%~50%、50%~75%、75%以上分别视为低、中、较高和很高。需要特别注意,研究数较少时Q检验的效能较低,容易把真实存在的异质性判为不显著,因此应结合I²和临床判断,而不是只看Q的P值。

四、医学实例

某研究评价一种降压方案对收缩压的降低效果,检索到3项随机对照试验,结局为收缩压较基线的下降值(mmHg),效应量为试验组与对照组的均值差MD,各研究的MD与标准误见表1。

研究MD(mmHg)SE95%CI权重 wi=1/SE²
研究A0.800.200.41~1.1925.00
研究B0.300.150.01~0.5944.44
研究C0.100.25−0.39~0.5916.00

按逆方差加权,Σwi=25.00+44.44+16.00=85.44,合并MD=(25.00×0.80+44.44×0.30+16.00×0.10)/85.44=0.41;合并标准误为85.44的平方根取倒数,等于0.108;95%置信区间为0.20~0.62,Z=3.78,P小于0.001。

异质性检验结果:Q=5.88,df=2,P=0.053;I²=(5.88−2)/5.88×100%=66.0%。Q检验在0.05水准上尚不显著,但I²已达66%,提示研究间存在较高异质性,这与研究数只有3项、Q检验效能偏低有关。此时改用随机效应模型更为稳妥。按DerSimonian-Laird法估计τ²约为0.0746,重新加权后合并MD为0.41,标准误0.195,95%置信区间为0.03~0.79,Z=2.11,P=0.035。两种模型的合并结果见表2。

模型合并MD95%CIZPI²
固定效应0.410.20~0.623.78<0.00166.0%
随机效应0.410.03~0.792.110.03566.0%

五、结果解读

森林图是Meta分析的标准呈现方式:每一行代表一项研究,方块的位置是效应量点估计、面积反映权重,横线是95%置信区间;最下方的菱形是合并结果,菱形的中心是合并点估计,左右顶点是置信区间的上下限。若菱形不与无效线(MD为0,OR、RR为1)相交,提示合并效应有统计学意义。

上例3项研究的点估计均为正值,其中研究C的置信区间跨过0,单独看没有统计学意义;合并后点估计为0.41 mmHg,随机效应模型下95%置信区间为0.03~0.79,未跨越0,提示该方案平均可使收缩压多降低约0.41 mmHg。同时应当看到,随机效应下置信区间下限已接近0,P值为0.035,处于临界水平,结论并不十分稳固。此外,合并效应量只有0.41 mmHg,与临床上有意义的降压幅度相比偏小,即使有统计学意义,也未必具有临床价值。

面对较高的异质性,应进一步查找来源:比较各研究在人群特征、给药方案、随访时间、测量方法上的差异,按这些因素做亚组分析;也可逐一剔除单项研究做敏感性分析,观察合并结果是否稳定。若异质性无法解释,报告时应如实说明,并谨慎解释合并结果。

六、常见错误用法

  • 把结局定义或测量方式明显不同的研究强行合并,MD与SMD混用。
  • 存在明显异质性却只报告固定效应模型结果;反过来,在无把握时也不应无条件默认随机效应。
  • 纳入研究过少(2~3项)就下结论,此时异质性估计和发表偏倚评价都不可靠。
  • 不考虑研究数就用漏斗图评价发表偏倚,研究数少于10项时漏斗图基本没有意义。
  • 只报告合并后的P值,不报告效应量与置信区间,也不讨论临床意义。
  • 忽略纳入研究本身的偏倚风险,把低质量研究与高质量研究等权看待。

七、注意事项

Meta分析的结果依赖于纳入的研究,不能纠正原始研究的设计缺陷,因此常被称为"对研究的研究"。合并前应预先确定分析方案,避免根据结果反复更换模型或剔除研究。报告时应完整给出检索来源、纳入排除流程、各研究的效应量与权重、异质性指标以及所用模型,使读者可以复核每一步计算。

主成分分析与因子分析.医学统计实例详解

主成分分析与因子分析都是处理多个相关变量的多元统计方法,常用于降维和探索变量之间的内在结构。当一项研究同时测量了许多彼此相关的指标时,这些指标往往存在信息重叠,直接拿它们建模或比较会带来麻烦。主成分分析和因子分析可以把大量相关的原始变量浓缩为少数几个综合指标,从而简化数据结构,便于后续分析。

方法说明与两者的区别

主成分分析(Principal Component Analysis,PCA)是一种降维方法。它把原始变量通过线性组合转换成少数几个互不相关的新变量,称为主成分,第一个主成分方差最大,依次递减,各主成分之间正交。主成分是原始变量的线性组合,属于对现有信息的重新表达,并不假设背后存在不可观测的变量。

因子分析(Factor Analysis)是一种探索潜在结构的方法。它假设各原始变量由少数几个不可直接观测的公共因子加上各自特有的特殊因子共同决定,通过分析变量之间的相关性来找出这些公共因子,并给出因子载荷,用以解释变量间相关的来源。

两者常被放在一起讨论,但目的并不相同:主成分分析回答的是“如何用更少的综合指标概括原有信息”,因子分析回答的是“变量之间为什么会相关,背后有哪些潜在维度”。在做法上也有差异:主成分分析通常不做旋转;因子分析常配合方差最大正交旋转,使因子载荷更易解释,且只解释变量间的共同方差。

应用场景与前提条件

当研究涉及多个高度相关的连续变量时,例如一组血液生化指标或一组生理测量指标,希望从中提取综合指标用于评价或分型,就可以考虑这两类方法。常见用途包括构造综合评分、消除后续回归或判别分析中的多重共线性,以及探索量表或问卷的维度结构。

  • 变量应为连续变量或近似连续变量,分类变量不宜直接纳入。
  • 样本量一般建议不少于变量个数的5至10倍,样本过少时结果不稳定。
  • 各变量量纲或数量级不同时,必须先做标准化处理,否则量纲大的变量会主导结果,实践中通常基于相关系数矩阵进行分析。
  • 变量之间应存在一定相关性,否则降维没有意义,可用KMO检验和Bartlett球形检验判断。

医学实例

为评价代谢紊乱程度,某研究对15名受试者测量了5项指标:体重指数(BMI)、腰围(cm)、收缩压(mmHg)、甘油三酯(mmol/L)、空腹血糖(mmol/L)。数据如下表。

编号BMI腰围收缩压甘油三酯空腹血糖
125.7921291.325.86
232.51011642.826.51
326.0871231.234.97
427.5871552.406.68
524.6831281.865.81
633.01021572.517.06
730.1951502.535.97
827.1891532.716.56
921.8841392.426.49
1028.7971291.275.58
1127.2961432.606.66
1227.1881521.966.83
1327.0881272.455.81
1423.4821221.705.62
1529.0901281.766.81

本例为便于说明计算过程,样本例数较少,实际研究应按前述样本量要求纳入足够数量的受试对象。

由于5项指标量纲不同,先对数据做标准化,再基于相关系数矩阵进行分析。是否适合降维,先做KMO检验与Bartlett球形检验:KMO=0.73,Bartlett球形检验χ²=41.1,df=10,P<0.001,说明变量之间存在较强的相关,适合做主成分分析或因子分析。

各主成分的特征值与方差贡献率如下表。

主成分特征值方差贡献率(%)累积方差贡献率(%)
第一主成分3.21464.2764.27
第二主成分1.12222.4386.71
第三主成分0.3717.4394.13
第四主成分0.1723.4497.57
第五主成分0.1212.43100.00

前两个主成分的特征值均大于1,累积方差贡献率为86.71%,已达80%以上,因此取两个主成分。两主成分的载荷如下表。

变量第一主成分第二主成分
BMI0.800.54
腰围0.750.61
收缩压0.91-0.21
甘油三酯0.76-0.49
空腹血糖0.77-0.42

第一主成分在各变量上的载荷均为同向且数值较高,反映的是整体代谢紊乱程度,可解释为综合代谢因子;第二主成分在BMI、腰围上为正,在血压、血脂、血糖上为负,反映体型与代谢指标之间的相对关系。若改用因子分析并做方差最大正交旋转,通常可得到两个更易命名的公共因子:一个在血压、甘油三酯、空腹血糖上载荷较高,另一个在BMI、腰围上载荷较高,分别对应“代谢因子”与“肥胖因子”。

判定与计算要点

  • KMO反映变量间的偏相关程度,一般以大于0.6为可接受、大于0.7为较好;Bartlett球形检验P值小于0.05,说明变量间存在相关,可继续分析。
  • 主成分个数常按特征值大于1选取,或按累积方差贡献率达到80%以上选取,也可结合碎石图的拐点判断;不同准则结论不一致时,应结合专业可解释性取舍。
  • 载荷的绝对值越大,说明该变量对该主成分或公共因子的贡献越大,通常以0.5以上作为有意义的参考标准。
  • 因子分析中,变量的共同度反映公共因子对该变量的解释比例,共同度过低的变量可考虑剔除。

结果解读

本例中,前两个主成分累积解释了86.71%的总方差,即5个原始指标的信息可以用两个综合指标概括,信息损失较少。第一主成分得分越高,提示受试者的代谢紊乱越明显;第二主成分得分则刻画体型与代谢指标之间的相对偏离。

常见错误用法

  • 不先标准化就直接分析,导致量纲大的变量主导结果。
  • 把主成分当作客观存在的潜变量去解释,混淆了主成分分析与因子分析的目的。
  • 不做KMO与Bartlett球形检验,对相关很弱甚至不相关的变量盲目降维。
  • 为了凑够80%的累积方差贡献率而纳入大量主成分,失去了降维的意义。
  • 把分类变量直接纳入分析,或样本量远小于变量个数。

注意事项

主成分分析与因子分析的结果会受样本构成和变量选择的影响,变量增删后主成分结构与载荷可能改变,因此结论应结合专业知识判断。因子分析得到的公共因子是统计上的潜变量,命名时需要结合变量的实际含义。对同一批数据反复尝试不同的旋转方式或主成分个数,直到得到想要的结论,属于不当做法。

重复测量方差分析.医学统计实例详解

重复测量方差分析(Repeated Measures ANOVA)用于分析同一批受试对象在不同时间点或不同条件下重复测量所得到的资料。它是医学研究中很常见的一类设计:例如对同一位患者,在治疗前、治疗中、治疗后多次测量血压或某项血液指标,每个对象会被测量多次。这类数据的各个观测值之间并不独立,同一个体的多次测量往往相互关联,因此不能简单地按完全随机设计处理。

方法说明与两类因素

重复测量方差分析把变异来源分为组内因素、组间因素以及它们的交互作用。

  • 组内因素(within-subject factor),又称被试内因素,是每个受试对象都要经历其全部水平的因素,最典型的就是时间,如治疗前、第4周、第8周、第12周。
  • 组间因素(between-subject factor),又称被试间因素,是不同对象归属于不同水平的因素,例如试验药组与对照组,每个对象只属于其中一个水平。
  • 交互作用反映的是组间因素各组的指标随时间变化的趋势是否相同。

与普通方差分析相比,重复测量方差分析的关键区别在于:同一对象的多次测量构成一个区组,数据存在相关性,如果把重复测量当作独立样本处理,会低估误差、使检验变得过于敏感,从而增加假阳性。因此,当同一对象被反复测量时,应使用重复测量方差分析而不能用完全随机的方差分析。

前提假设

  • 正态性:各处理水平下或残差近似服从正态分布。
  • 方差齐性:组间因素各组之间方差齐同。
  • 球对称假设(sphericity):组内因素任意两个水平之间差值的方差相等,等价于各水平两两比较时差值方差相同。该假设用Mauchly检验来判断。
  • 当存在组间因素时,还要求各组间协方差矩阵相同,可用Box M检验辅助判断。

球对称假设是重复测量方差分析中最容易被忽略的一条。如果球对称成立,组内效应的F检验是精确的;如果违反,未校正的F检验会偏大,P值偏小。

医学实例

某研究比较两种降压药对收缩压的疗效,将60名高血压患者随机分为试验药组与对照组,每组30人,分别在治疗前(基线)、第4周、第8周、第12周测量收缩压(mmHg)。组间因素为药物(2个水平),组内因素为时间(4个水平)。各时间点收缩压的均数与标准差如下表。

组别基线第4周第8周第12周
试验药组(n=30)152.4±10.2141.6±9.8133.2±9.1128.5±8.7
对照组(n=30)151.8±10.5146.2±10.0141.3±9.6138.7±9.4

先做球对称检验:Mauchly W=0.79,χ²=13.54,df=5,P=0.019,小于0.05,说明不满足球对称假设,需要对组内效应的自由度进行校正。常用的校正方法有Greenhouse-Geisser校正与Huynh-Feldt校正,本例ε估计值分别为0.78与0.86。

校正后重复测量方差分析结果如下表。

效应F值自由度P值
组间(药物)6.421, 580.014
组内(时间)未校正18.603, 174<0.001
组内(时间)GG校正18.602.34, 135.72<0.001
时间×药物 未校正4.853, 1740.003
时间×药物 GG校正4.852.34, 135.720.006

由结果可见:组间因素药物主效应有统计学意义(F=6.42,P=0.014),总体上试验药组血压低于对照组;组内因素时间主效应显著(F=18.60,P<0.001),血压随治疗推进下降;时间与药物的交互作用也显著(P=0.006),说明两组血压随时间下降的趋势并不相同,试验药组下降幅度更大。由于交互作用显著,进一步做简单效应分析会更清楚地说明在哪些时间点上两组存在差异。

判定与计算要点

  • 球对称检验以Mauchly检验为主,P值大于0.05时可认为满足球对称,直接采用未校正结果。
  • 违反球对称时,应对组内效应的自由度乘以校正系数ε。ε取值范围为自由度分之一到1之间,ε越小说明偏离球对称越严重。
  • Greenhouse-Geisser校正较为保守,即ε估计偏小、P值偏大,一般当ε小于0.75时优先采用;Huynh-Feldt校正相对宽松,当ε接近1时与之接近。当ε等于1时,两种校正与未校正结果一致。
  • 校正只改变F检验的自由度和P值,F值本身不变。
  • 交互作用显著时,应做简单效应分析;单一指标的多时间点比较还可配合多重比较校正。

结果解读

本例中药物治疗是有效的:试验药组与对照组在第12周的收缩压分别为128.5±8.7与138.7±9.4,试验药组下降约23.9mmHg,对照组下降约13.1mmHg。药物主效应P=0.014说明两组总体存在差异,时间×药物交互作用P=0.006说明两组的下降趋势不同,即药物效果随治疗时间逐渐显现。由于球对称假设被违反,报告结果时应给出校正后的自由度与P值,而不是直接使用未校正的结果。

常见错误用法

  • 把重复测量数据当成独立样本做完全随机方差分析,忽视同一对象多次测量之间的相关性。
  • 把时间作为组间因素而不是组内因素,导致设计类型判断错误。
  • 不做球对称检验,直接报告未校正结果,尤其当时间点较多时更易出现问题。
  • 只用两两t检验比较各个时间点,既未控制多重比较,也未考虑数据的相关性。
  • 对缺失值随意填补或直接删除整个对象,影响结果的代表性。

注意事项

重复测量设计的时间点越多,球对称假设越容易被违反,因此更应重视Mauchly检验与校正。当球对称严重违反、校正后仍难以处理,或组内因素水平较多时,也可考虑采用多元方差分析的思路或混合效应模型,以更灵活地处理相关结构。各组样本量最好接近,缺失数据应尽量说明其模式与处理方式。结果的解释要符合临床意义,收缩压下降幅度虽然具有统计学意义,还应结合不良事件、耐受性等综合判断疗效。

生存分析.Kaplan-Meier法与Cox回归医学统计实例详解

生存分析是研究从某一时间起点到关注事件发生所经历时间的一类统计方法,广泛用于肿瘤随访、器官移植、慢性病预后等研究。与普通方法相比,它有两个特点:一是结局不仅包含事件是否发生,还包含事件发生的时间;二是随访过程中常出现删失数据。

把事件时间纳入分析,可以提高信息利用效率,也能正确处理随访时间长短不一的情况。

一、生存时间与删失数据

生存时间指从起点到事件发生所经历的时间。起点必须明确且统一,例如确诊日期或手术日期;事件可以是死亡、复发、疾病进展等。删失是指随访结束时仍未观察到关注事件,最常见的形式是右删失:受试者在研究终止时仍存活,或中途失访。删失个体的生存时间只提供了"至少活到该时刻"的信息,处理时不能简单当作事件,也不能直接剔除。

生存分析的基本假设是删失与生存时间相互独立,即删失的原因不包含与预后相关的信息。若失访者与继续观察者的预后明显不同,结果可能产生偏倚。

二、Kaplan-Meier法与Log-rank检验

Kaplan-Meier法又称乘积极限法,用于估计生存函数S(t),即在时刻t仍未发生事件的概率。它按事件发生的时间点逐步计算条件生存概率并累乘,得到阶梯状的生存曲线。当随访中存在删失时,每个时间点参与"风险集"的人数相应减少,Kaplan-Meier法正是针对这种情形设计的。中位生存期是使生存函数首次降至0.5所对应的时间;若曲线始终未降到0.5,则无法从该资料估计中位生存期。

比较两组或多组生存曲线常用Log-rank检验,其零假设为各组生存分布相同。该检验对整条曲线上的差异较敏感,尤其适合比例风险成立的情形。

三、Cox比例风险回归

Cox回归可以同时分析多个因素对生存时间的影响。其风险函数写作 h(t)=h0(t)·exp(β1X1+…+βmXm),其中h0(t)是不指定具体形式的基准风险,这也是它被称为半参数模型的原因。exp(βi)即风险比HR,表示其他变量保持不变时,Xi每增加一个单位,事件发生的瞬时风险变为原来的多少倍。HR大于1为危险因素,小于1为保护因素。

Cox回归的前提是比例风险假定,即任意两组的风险比不随时间改变,可用Schoenfeld残差等方法检验。若假定不成立,可引入时依协变量或改用分层Cox模型。

四、医学实例

某研究比较新疗法与标准治疗对某恶性肿瘤患者生存的影响,共随访120例患者,随访期最长60个月,主要终点为全因死亡。其中新疗法组60例,观察期间死亡24例;标准治疗组60例,死亡36例,其余为删失。按治疗方式绘制Kaplan-Meier曲线,主要结果见表1,Cox回归结果见表2。

组别例数死亡事件删失中位生存期(月)
新疗法组60243638.5
标准治疗组60362424.2
变量HR95%CIP
新疗法 vs 标准治疗(单因素)0.580.39~0.860.007
新疗法 vs 标准治疗(多因素)0.620.42~0.920.017
年龄(每增加10岁)1.311.08~1.590.006
分期 III~IV期 vs I~II期2.151.42~3.25<0.001

两组生存曲线在随访早期即出现分离。Log-rank检验 χ²=7.86,自由度1,P=0.005,提示两组生存分布差异有统计学意义。多因素Cox回归中,校正年龄与临床分期后,新疗法组死亡风险为标准化治疗组的0.62倍(HR=0.62,95%CI:0.42~0.92,P=0.017),相当于死亡风险降低约38%。分期较晚者死亡风险约为早期患者的2.15倍(95%CI:1.42~3.25,P<0.001)。比例风险假定检验的全局P值为0.31,大于0.05,提示假定成立。

五、结果解读

HR的解释必须结合变量单位与参照组。上例中新疗法相对标准治疗的HR为0.62,说明新疗法与更低的死亡风险相关;年龄按每10岁计算,HR为1.31,表示年龄每增加10岁,死亡风险约为原来的1.31倍。HR的95%置信区间不包含1且P值小于0.05,提示关联具有统计学意义。

中位生存期与中位随访时间含义不同:前者是生存曲线降到0.5对应的时间,描述的是生存结局;后者描述的是随访时间的集中趋势。两者不可混用,报告时也应写清各自定义。

除HR之外,生存分析还应结合生存曲线整体形态、事件发生的时间分布以及是否满足比例风险来综合判断。若某因素在随访早、晚期作用方向不同,提示可能存在非比例风险,单用Cox回归会掩盖这种变化,可采用时依协变量处理。

六、常见错误用法

  • 把删失当作事件处理,或直接删除删失个体,导致结果偏倚。
  • 用t检验或方差分析比较生存时间,忽略删失并违反分布假设。
  • 不检验比例风险假定就直接报告Cox回归结果。
  • 把HR写成相对危险度,或在忽略参照组与单位的情况下随意解释。
  • 只报告P值而不报告HR及其95%置信区间。
  • 把中位随访时间误当作中位生存期。

七、注意事项

生存分析要求起点与终点定义清晰、随访资料完整。曲线尾部涉及的人数较少时,生存曲线的估计不稳定,解释应谨慎。报告时宜同时给出各组例数、事件数、中位生存期、HR及其95%置信区间,并说明是否满足比例风险假定。