一份 10 个条目的糖尿病自我管理行为量表,答案用 5 级评分(1=从不,5=总是),在某社区 2 型糖尿病患者中回收有效问卷 132 份。算下来 Cronbach α=0.858。这个数字报出去,审稿人会不会追问?通常会。
因为 α 只是信度分析的一个输出。它回答的是"这组条目测得一致不一致",但不回答是哪几个条目在拖后腿、删掉一个会不会更好、这个分数用来随访个体变化够不够精确。这些问题,靠一个 α 是看不出来的。
α 到底在算什么
Cronbach α 的公式是
α = k/(k−1) × (1 − Σσᵢ²/σ总²)
其中 k 是条目数,σᵢ² 是第 i 个条目的方差,σ总² 是量表总分的方差。括号里那一项的含义是:总分方差中,不能被各条目自身方差解释的那部分——也就是条目之间"共变"的部分。k/(k−1) 是一个随条目数增大的校正系数。所以 α 越高,说明条目之间越同向、越抱团。
把本例的数字代进去:10 个条目的方差之和为 7.315,总分方差为 32.06,括号内为 1−7.315/32.06=0.772,再乘 10/9,得 0.858。用公式算一遍,比看软件输出的数字更能明白它在衡量什么。
光有一个 α 不够,还要看条目
信度分析的价值一大半在条目层面。下表是这份量表的完整结果:各条目的均数、标准差、条目与总分的相关(CITC,条目分与"其余条目之和"的相关系数),以及删除该条目后 α 的变化。
| 条目 | 内容 | 均数±标准差 | CITC | 删除后 α |
|---|---|---|---|---|
| 1 | 按医嘱按时按量服药 | 3.61±0.82 | 0.660 | 0.836 |
| 2 | 按计划监测血糖 | 3.67±0.86 | 0.610 | 0.840 |
| 3 | 控制主食与含糖食物 | 3.67±0.85 | 0.560 | 0.845 |
| 4 | 每周进行中等强度身体活动 | 3.59±0.88 | 0.592 | 0.842 |
| 5 | 每天检查足部皮肤 | 3.71±0.79 | 0.525 | 0.847 |
| 6 | 出现低血糖时能正确应对 | 3.67±0.78 | 0.327 | 0.862 |
| 7 | 定期复查糖化血红蛋白 | 3.64±0.92 | 0.617 | 0.839 |
| 8 | 控制体重 | 3.78±0.86 | 0.565 | 0.844 |
| 9 | 戒烟限酒 | 3.73±0.90 | 0.582 | 0.843 |
| 10 | 主动与医生沟通病情 | 3.74±0.89 | 0.593 | 0.842 |
总分 36.82±5.66,实际得分范围 24~50。各条目均数都在 3.6~3.8 之间,没有明显的天花板或地板效应(若大量患者所有条目都选 5 分,总分方差被压缩,α 会被压低,那是测量工具的毛病而不是信度的毛病)。条目间平均相关 0.374,最小 0.123,最大 0.531。
这张表里最值得说的是条目 6。“出现低血糖时能正确应对"的 CITC 只有 0.327,低于常用的 0.4 参考线;删除它之后 α 从 0.858 升到 0.862。看到这里,常见的做法是"删掉它,α 就上去了”。
这样处理值得商榷。低血糖应对处理的是急性事件中的行为,而其余九个条目测的是日常的、持续性的自我管理。它与其他条目相关性低,恰恰说明它测的是另一类内容,而不是它"没用"。一个条目在内容上属于量表要测的构念、但统计上表现不佳时,首先要问的是:它是独立的维度,还是表述让人误解,还是在这批样本里变异太小。本例中条目 6 的标准差 0.78 是十个条目里最小的,说明回答比较集中,这也压低了它与总分的相关。仅凭一次预调查的 α 就删条目,很可能删掉量表的覆盖面。稳妥的做法是结合内容效度、在其他样本中重复验证,再决定去留。
另外,删除条目后期望 α 上升的幅度只有 0.004,本来就属于噪声级别,不足以支撑删除的决定。
α 高不高,看用途
常见的判断标准是:0.9 以上很好,0.8~0.9 良好,0.7~0.8 可以接受,0.6~0.7 勉强可用于探索性研究,低于 0.6 说明内部一致性不足。这些界限是经验性的,不必当作硬门槛,但它们背后的逻辑要清楚——信度要求取决于分数用来做什么。
如果量表是用来给群体分类、比较组间均数(比如比较干预组与对照组的自我管理得分),α 在 0.8 左右通常够用。如果要用这个分数给个体下判断、或追踪某位患者前后的变化,要求就高得多,因为它直接决定了两点之差有多少是真实的改变、有多少是测量误差。这时候真正需要报告的是测量标准误。
本例量表总分的标准差为 5.66,α=0.858,测量标准误 SEM=5.66×√(1−0.858)=2.14 分;对应的最小可检测变化(MDC95)约为 5.92 分。意思是,同一位患者前后两次测量,得分变化要达到 5.9 分左右,才能比较有把握地说这是真实变化,而不是测量波动。总分范围是 10~50 分,6 分的变化并不小。这条信息对解释随访数据非常关键,却常常被漏报。
α 的三个常见误用
第一,把 α 的高低当成量表质量的唯一标尺。α 会随条目数单调上升。本例十个条目 α=0.858,只用前 6 个条目算就只有 0.775,只用前 3 个条目是 0.708。也就是说,往量表里塞进更多高度相似的条目,α 一定更好看,但这既没有提高内容效度,也谈不上测量得更准。比较两个量表的 α,必须在条目数相近的前提下才有意义。
第二,用高 α 证明量表是单维的。α 衡量的是条目间的平均一致性,一个由三个相关维度组成的量表,整体 α 同样可以很高,因为维度之间本身也相关。要判断维度结构,需要做探索性或验证性因子分析。用 α 来论证单维性,是信度分析里最常见的越界。
第三,α 与重测信度混为一谈。α 反映的是同一时点内部一致,与时间稳定性无关;一份量表可能内部高度一致(所有条目问的其实是同一句话的几种说法),但隔两周重测却对不上。考察稳定性需要重测信度或评定者间一致性,那要用另一套方法(例如 ICC),α 替代不了。
顺带一提,α 还有一个前提:它假定各条目对总分的贡献权重相同、误差方差相等(τ 等价)。这个假定在条目难度差异大时并不成立。近年来不少方法学文献建议同时报告 ω 系数,它对权重不作等值假设,解释也更直接。作为作者,报告 α 的同时给出分半信度或 ω,是更稳妥的做法。
本例的其他信度证据
把十个条目按奇偶数分成两半,两半得分相关 r=0.746,经 Spearman-Brown 公式校正后为 0.854;按前五条与后五条分半,校正后为 0.849。三种拆分方式给出的结果都在 0.85 附近,与 α 吻合,说明结果不是某一种计算方式带来的。
需要注意的是,分半信度依赖于拆分方式,同一份数据奇偶分半和前后分半能得到不同的数值,报告时应当写明拆法。也正因为这个缺点,分半信度现在多作为 α 的补充,而不是替代。
在软件里做信度分析
把问卷原始数据整理成 CSV,一行一份问卷,一列一个条目(本题为 10 列 132 行),在医学统计助手中打开问卷分析模块,可以直接得到题型识别、整体概览与条目摘要;信度分析选 Cronbach α,勾选需要纳入的条目列即可。软件会输出总量表的 α,以及每个条目的 CITC 和删除后 α,正好对应本文上面那张表。需要分半信度时,用同样的数据再跑一次即可。
最后提醒一句:信度是效度的必要条件而非充分条件。α 达到 0.858,只说明这份量表测得稳定、内部抱团,并不能证明它测的确实是"自我管理行为"而不是别的东西。量表能不能用,还要看内容效度、结构效度以及与外部标准的关联,那是另一篇文章的内容了。