主成分分析与因子分析都是处理多个相关变量的多元统计方法,常用于降维和探索变量之间的内在结构。当一项研究同时测量了许多彼此相关的指标时,这些指标往往存在信息重叠,直接拿它们建模或比较会带来麻烦。主成分分析和因子分析可以把大量相关的原始变量浓缩为少数几个综合指标,从而简化数据结构,便于后续分析。
方法说明与两者的区别
主成分分析(Principal Component Analysis,PCA)是一种降维方法。它把原始变量通过线性组合转换成少数几个互不相关的新变量,称为主成分,第一个主成分方差最大,依次递减,各主成分之间正交。主成分是原始变量的线性组合,属于对现有信息的重新表达,并不假设背后存在不可观测的变量。
因子分析(Factor Analysis)是一种探索潜在结构的方法。它假设各原始变量由少数几个不可直接观测的公共因子加上各自特有的特殊因子共同决定,通过分析变量之间的相关性来找出这些公共因子,并给出因子载荷,用以解释变量间相关的来源。
两者常被放在一起讨论,但目的并不相同:主成分分析回答的是“如何用更少的综合指标概括原有信息”,因子分析回答的是“变量之间为什么会相关,背后有哪些潜在维度”。在做法上也有差异:主成分分析通常不做旋转;因子分析常配合方差最大正交旋转,使因子载荷更易解释,且只解释变量间的共同方差。
应用场景与前提条件
当研究涉及多个高度相关的连续变量时,例如一组血液生化指标或一组生理测量指标,希望从中提取综合指标用于评价或分型,就可以考虑这两类方法。常见用途包括构造综合评分、消除后续回归或判别分析中的多重共线性,以及探索量表或问卷的维度结构。
- 变量应为连续变量或近似连续变量,分类变量不宜直接纳入。
- 样本量一般建议不少于变量个数的5至10倍,样本过少时结果不稳定。
- 各变量量纲或数量级不同时,必须先做标准化处理,否则量纲大的变量会主导结果,实践中通常基于相关系数矩阵进行分析。
- 变量之间应存在一定相关性,否则降维没有意义,可用KMO检验和Bartlett球形检验判断。
医学实例
为评价代谢紊乱程度,某研究对15名受试者测量了5项指标:体重指数(BMI)、腰围(cm)、收缩压(mmHg)、甘油三酯(mmol/L)、空腹血糖(mmol/L)。数据如下表。
| 编号 | BMI | 腰围 | 收缩压 | 甘油三酯 | 空腹血糖 |
| 1 | 24.3 | 82 | 121 | 1.32 | 5.02 |
| 2 | 28.6 | 96 | 142 | 2.35 | 6.31 |
| 3 | 22.1 | 74 | 115 | 1.05 | 4.68 |
| 4 | 31.2 | 104 | 158 | 2.86 | 7.05 |
| 5 | 26.4 | 89 | 133 | 1.78 | 5.62 |
| 6 | 29.8 | 99 | 150 | 2.54 | 6.64 |
| 7 | 23.5 | 78 | 119 | 1.16 | 4.85 |
| 8 | 27.9 | 94 | 138 | 2.21 | 6.08 |
| 9 | 25.2 | 85 | 127 | 1.47 | 5.24 |
| 10 | 32.6 | 108 | 163 | 3.05 | 7.32 |
| 11 | 21.8 | 72 | 112 | 0.96 | 4.51 |
| 12 | 30.4 | 101 | 155 | 2.72 | 6.88 |
| 13 | 24.9 | 84 | 125 | 1.39 | 5.11 |
| 14 | 28.3 | 95 | 141 | 2.30 | 6.22 |
| 15 | 26.8 | 91 | 136 | 1.92 | 5.78 |
本例为便于说明计算过程,样本例数较少,实际研究应按前述样本量要求纳入足够数量的受试对象。
由于5项指标量纲不同,先对数据做标准化,再基于相关系数矩阵进行分析。是否适合降维,先做KMO检验与Bartlett球形检验:KMO=0.78,Bartlett球形检验χ²=63.7,df=10,P<0.001,说明变量之间存在较强的相关,适合做主成分分析或因子分析。
各主成分的特征值与方差贡献率如下表。
| 主成分 | 特征值 | 方差贡献率(%) | 累积方差贡献率(%) |
| 第一主成分 | 3.42 | 68.4 | 68.4 |
| 第二主成分 | 1.05 | 21.0 | 89.4 |
| 第三主成分 | 0.26 | 5.2 | 94.6 |
| 第四主成分 | 0.16 | 3.2 | 97.8 |
| 第五主成分 | 0.11 | 2.2 | 100.0 |
前两个主成分的特征值均大于1,累积方差贡献率为89.4%,已达80%以上,因此取两个主成分。两主成分的载荷如下表。
| 变量 | 第一主成分 | 第二主成分 |
| BMI | 0.83 | 0.55 |
| 腰围 | 0.84 | 0.54 |
| 收缩压 | 0.82 | -0.38 |
| 甘油三酯 | 0.83 | -0.38 |
| 空腹血糖 | 0.82 | -0.38 |
第一主成分在各变量上的载荷均为同向且数值较高,反映的是整体代谢紊乱程度,可解释为综合代谢因子;第二主成分在BMI、腰围上为正,在血压、血脂、血糖上为负,反映体型与代谢指标之间的相对关系。若改用因子分析并做方差最大正交旋转,通常可得到两个更易命名的公共因子:一个在血压、甘油三酯、空腹血糖上载荷较高,另一个在BMI、腰围上载荷较高,分别对应“代谢因子”与“肥胖因子”。
判定与计算要点
- KMO反映变量间的偏相关程度,一般以大于0.6为可接受、大于0.7为较好;Bartlett球形检验P值小于0.05,说明变量间存在相关,可继续分析。
- 主成分个数常按特征值大于1选取,或按累积方差贡献率达到80%以上选取,也可结合碎石图的拐点判断;不同准则结论不一致时,应结合专业可解释性取舍。
- 载荷的绝对值越大,说明该变量对该主成分或公共因子的贡献越大,通常以0.5以上作为有意义的参考标准。
- 因子分析中,变量的共同度反映公共因子对该变量的解释比例,共同度过低的变量可考虑剔除。
结果解读
本例中,前两个主成分累积解释了89.4%的总方差,即5个原始指标的信息可以用两个综合指标概括,信息损失较少。第一主成分得分越高,提示受试者的代谢紊乱越明显;第二主成分得分则刻画体型与代谢指标之间的相对偏离。
常见错误用法
- 不先标准化就直接分析,导致量纲大的变量主导结果。
- 把主成分当作客观存在的潜变量去解释,混淆了主成分分析与因子分析的目的。
- 不做KMO与Bartlett球形检验,对相关很弱甚至不相关的变量盲目降维。
- 为了凑够80%的累积方差贡献率而纳入大量主成分,失去了降维的意义。
- 把分类变量直接纳入分析,或样本量远小于变量个数。
注意事项
主成分分析与因子分析的结果会受样本构成和变量选择的影响,变量增删后主成分结构与载荷可能改变,因此结论应结合专业知识判断。因子分析得到的公共因子是统计上的潜变量,命名时需要结合变量的实际含义。对同一批数据反复尝试不同的旋转方式或主成分个数,直到得到想要的结论,属于不当做法。