问卷信度分析:Cronbach α 的用法与常见误区

一份 10 个条目的糖尿病自我管理行为量表,答案用 5 级评分(1=从不,5=总是),在某社区 2 型糖尿病患者中回收有效问卷 132 份。算下来 Cronbach α=0.858。这个数字报出去,审稿人会不会追问?通常会。

因为 α 只是信度分析的一个输出。它回答的是"这组条目测得一致不一致",但不回答是哪几个条目在拖后腿、删掉一个会不会更好、这个分数用来随访个体变化够不够精确。这些问题,靠一个 α 是看不出来的。

α 到底在算什么

Cronbach α 的公式是

α = k/(k−1) × (1 − Σσᵢ²/σ总²)

其中 k 是条目数,σᵢ² 是第 i 个条目的方差,σ总² 是量表总分的方差。括号里那一项的含义是:总分方差中,不能被各条目自身方差解释的那部分——也就是条目之间"共变"的部分。k/(k−1) 是一个随条目数增大的校正系数。所以 α 越高,说明条目之间越同向、越抱团。

把本例的数字代进去:10 个条目的方差之和为 7.315,总分方差为 32.06,括号内为 1−7.315/32.06=0.772,再乘 10/9,得 0.858。用公式算一遍,比看软件输出的数字更能明白它在衡量什么。

光有一个 α 不够,还要看条目

信度分析的价值一大半在条目层面。下表是这份量表的完整结果:各条目的均数、标准差、条目与总分的相关(CITC,条目分与"其余条目之和"的相关系数),以及删除该条目后 α 的变化。

条目内容均数±标准差CITC删除后 α
1按医嘱按时按量服药3.61±0.820.6600.836
2按计划监测血糖3.67±0.860.6100.840
3控制主食与含糖食物3.67±0.850.5600.845
4每周进行中等强度身体活动3.59±0.880.5920.842
5每天检查足部皮肤3.71±0.790.5250.847
6出现低血糖时能正确应对3.67±0.780.3270.862
7定期复查糖化血红蛋白3.64±0.920.6170.839
8控制体重3.78±0.860.5650.844
9戒烟限酒3.73±0.900.5820.843
10主动与医生沟通病情3.74±0.890.5930.842

总分 36.82±5.66,实际得分范围 24~50。各条目均数都在 3.6~3.8 之间,没有明显的天花板或地板效应(若大量患者所有条目都选 5 分,总分方差被压缩,α 会被压低,那是测量工具的毛病而不是信度的毛病)。条目间平均相关 0.374,最小 0.123,最大 0.531。

这张表里最值得说的是条目 6。“出现低血糖时能正确应对"的 CITC 只有 0.327,低于常用的 0.4 参考线;删除它之后 α 从 0.858 升到 0.862。看到这里,常见的做法是"删掉它,α 就上去了”。

这样处理值得商榷。低血糖应对处理的是急性事件中的行为,而其余九个条目测的是日常的、持续性的自我管理。它与其他条目相关性低,恰恰说明它测的是另一类内容,而不是它"没用"。一个条目在内容上属于量表要测的构念、但统计上表现不佳时,首先要问的是:它是独立的维度,还是表述让人误解,还是在这批样本里变异太小。本例中条目 6 的标准差 0.78 是十个条目里最小的,说明回答比较集中,这也压低了它与总分的相关。仅凭一次预调查的 α 就删条目,很可能删掉量表的覆盖面。稳妥的做法是结合内容效度、在其他样本中重复验证,再决定去留。

另外,删除条目后期望 α 上升的幅度只有 0.004,本来就属于噪声级别,不足以支撑删除的决定。

α 高不高,看用途

常见的判断标准是:0.9 以上很好,0.8~0.9 良好,0.7~0.8 可以接受,0.6~0.7 勉强可用于探索性研究,低于 0.6 说明内部一致性不足。这些界限是经验性的,不必当作硬门槛,但它们背后的逻辑要清楚——信度要求取决于分数用来做什么。

如果量表是用来给群体分类、比较组间均数(比如比较干预组与对照组的自我管理得分),α 在 0.8 左右通常够用。如果要用这个分数给个体下判断、或追踪某位患者前后的变化,要求就高得多,因为它直接决定了两点之差有多少是真实的改变、有多少是测量误差。这时候真正需要报告的是测量标准误。

本例量表总分的标准差为 5.66,α=0.858,测量标准误 SEM=5.66×√(1−0.858)=2.14 分;对应的最小可检测变化(MDC95)约为 5.92 分。意思是,同一位患者前后两次测量,得分变化要达到 5.9 分左右,才能比较有把握地说这是真实变化,而不是测量波动。总分范围是 10~50 分,6 分的变化并不小。这条信息对解释随访数据非常关键,却常常被漏报。

α 的三个常见误用

第一,把 α 的高低当成量表质量的唯一标尺。α 会随条目数单调上升。本例十个条目 α=0.858,只用前 6 个条目算就只有 0.775,只用前 3 个条目是 0.708。也就是说,往量表里塞进更多高度相似的条目,α 一定更好看,但这既没有提高内容效度,也谈不上测量得更准。比较两个量表的 α,必须在条目数相近的前提下才有意义。

第二,用高 α 证明量表是单维的。α 衡量的是条目间的平均一致性,一个由三个相关维度组成的量表,整体 α 同样可以很高,因为维度之间本身也相关。要判断维度结构,需要做探索性或验证性因子分析。用 α 来论证单维性,是信度分析里最常见的越界。

第三,α 与重测信度混为一谈。α 反映的是同一时点内部一致,与时间稳定性无关;一份量表可能内部高度一致(所有条目问的其实是同一句话的几种说法),但隔两周重测却对不上。考察稳定性需要重测信度或评定者间一致性,那要用另一套方法(例如 ICC),α 替代不了。

顺带一提,α 还有一个前提:它假定各条目对总分的贡献权重相同、误差方差相等(τ 等价)。这个假定在条目难度差异大时并不成立。近年来不少方法学文献建议同时报告 ω 系数,它对权重不作等值假设,解释也更直接。作为作者,报告 α 的同时给出分半信度或 ω,是更稳妥的做法。

本例的其他信度证据

把十个条目按奇偶数分成两半,两半得分相关 r=0.746,经 Spearman-Brown 公式校正后为 0.854;按前五条与后五条分半,校正后为 0.849。三种拆分方式给出的结果都在 0.85 附近,与 α 吻合,说明结果不是某一种计算方式带来的。

需要注意的是,分半信度依赖于拆分方式,同一份数据奇偶分半和前后分半能得到不同的数值,报告时应当写明拆法。也正因为这个缺点,分半信度现在多作为 α 的补充,而不是替代。

在软件里做信度分析

把问卷原始数据整理成 CSV,一行一份问卷,一列一个条目(本题为 10 列 132 行),在医学统计助手中打开问卷分析模块,可以直接得到题型识别、整体概览与条目摘要;信度分析选 Cronbach α,勾选需要纳入的条目列即可。软件会输出总量表的 α,以及每个条目的 CITC 和删除后 α,正好对应本文上面那张表。需要分半信度时,用同样的数据再跑一次即可。

最后提醒一句:信度是效度的必要条件而非充分条件。α 达到 0.858,只说明这份量表测得稳定、内部抱团,并不能证明它测的确实是"自我管理行为"而不是别的东西。量表能不能用,还要看内容效度、结构效度以及与外部标准的关联,那是另一篇文章的内容了。