协方差分析

官方医学老师·20 页·深入(追求细节与边界)·0 次浏览·2 天前
ANCOVA混杂控制回归分解假设检验

协方差分析

看清协变量如何剥离混杂干扰,让组间效应回归可解释的本质

按 空格/→ 演示下一步

1 / 20 页

全部页面点击任意一页,跳回舞台从这页播放

ANCOVA混杂控制回归分解假设检验

协方差分析

看清协变量如何剥离混杂干扰,让组间效应回归可解释的本质

1第 1 页 · 协方差分析

协方差分析的定义

前面我们谈过 ANCOVA 存在的意义——当干扰因素暗中作祟时,单纯比均值会失真。这一页落到定义,看它到底是怎么做到的。

方差 + 回归的合体
本质是带连续协变量的线性模型,框架上属于 GLM
协变量是连续型控制变量
不能是分组变量,必须是数值型且与因变量近似线性
先扣再比
先用回归把协变量的线性效应从 Y 中剥离,再对残差做方差分析
调整后均值做 F 检验
把每组均值校准到协变量同一水平,再检验组间差异
入学水平不齐的两班比期末成绩对应 →扣除协变量后再比处理效应

两组起点不同直接比不公平,先把'入学水平'差异扣掉,剩下的才是教学方法的真实差距

Yij=μ+τi+β(XijXˉ)+εijY_{ij}=\mu+\tau_i+\beta(X_{ij}-\bar{X})+\varepsilon_{ij}
2第 2 页 · 协方差分析的定义

与方差分析、回归分析的关系

三种方法经常被混用,但各自解决的是不同问题

方差分析 ANOVA
  • 比较各组均值差异
  • 自变量必须是分类变量
  • 无法纳入连续自变量
  • 看 F 值与组间显著性
回归分析 Linear
  • 预测或解释因变量
  • 自变量可连续或分类
  • 可纳入多个连续变量
  • 看回归系数与显著性
协方差分析兼顾两者:先用回归剔除混杂,再用 ANOVA 比组间
3第 3 页 · 与方差分析、回归分析的关系

协方差分析的基本思想

方差分析假设各组'站在同一条起跑线',但现实中协变量本就不齐。协方差分析的核心,就是用统计手段把这些'起点偏差'扣除,让各组在公平基础上比处理效应。

起点不齐
各组协变量均值天然就有差异,方差分析直接比Y会被这个'先天差距'干扰
统计控制
用X对Y做回归,估计协变量对因变量的影响量,再从Y中扣除
同基比较
校正后的Y让各组站到同一水平线上,处理组差异才'纯净'
增检验力
把协变量解释的变异从误差项剥离,误差方差变小,F检验更灵敏
高考分省录取按难度调分对应 →协方差分析的统计控制

都先把'起点不同'剥离掉,再做公平比较

Yij=μ+αi+β(XijXˉ)+εijY_{ij}=\mu+\alpha_i+\beta(X_{ij}-\bar{X})+\varepsilon_{ij}
4第 4 页 · 协方差分析的基本思想

线性回归关系检验

检验协变量与因变量是否存在直线关系,决定它能否进入协方差分析。

1
散点图诊断
画散点图观察整体趋势、弯曲程度与异常点,初判是否近似直线。
2
提出假设
设 H0:β=0(无线性关系),备择 H1:β≠0。
3
OLS拟合
用最小二乘估计 y=α+βx+ε 中的 β̂ 与标准误 SE。
4
斜率检验
算 t = β̂ / SE,若 |t| 超过临界值则拒绝 H0。
5
综合判断
结合图形与显著性,决定协变量是否纳入协方差分析。
5第 5 页 · 线性回归关系检验

回归系数齐性检验

齐性检验是 ANCOVA 的前提:先确认各组回归斜率是否真的相等。

1
设交互模型
让组别与协变量产生交互,每组自由估计自己的斜率
2
设主效应模型
去掉交互项,强制所有组共用同一条斜率(齐性假设)
3
F检验比较
用 F 检验比较两个嵌套模型,看交互项是否显著
4
判定齐性
显著→斜率不齐需分组回归;不显著→齐性成立可进入 ANCOVA
6第 6 页 · 回归系数齐性检验

修正均数的计算

上一张我们验证了回归系数可以合并。这页进入核心计算:用回归线把每组的均数点平移到协变量总均值处,得到修正均数。扣掉协变量带来的先天优势,组间比较才公平。

修正均数的含义
假设各组协变量都等于总均值X̄时,估计得到的组均数
计算三要素
各组原始均数ȳᵢ、各组协变量均值X̄ᵢ、合并回归斜率b
修正公式
ȳᵢᵃᵈʲ = ȳᵢ − b(X̄ᵢ − X̄),扣掉协变量贡献的优势
修正后的去向
用修正均数替换原始均数,进入下一步组间F检验
名义工资按通胀折算对应 →原始均数按协变量差修正

名义工资高但物价也高,扣掉通胀才是实际购买力;均数高但协变量也高,扣掉b·ΔX才是公平起点

yˉiadj=yˉib(xˉixˉ)\bar{y}_{i}^{\text{adj}} = \bar{y}_{i} - b(\bar{x}_{i} - \bar{x})
7第 7 页 · 修正均数的计算

假设检验

修正均数算出来后,用假设检验判断组间差异是真是假。

1
提出假设
H₀各组修正均数全相等;H₁至少两组不等
2
构造F统计量
F等于组间均方除以误差均方
3
查F分布临界值
按组间与误差自由度查F界值表
4
下推断结论
F超临界值则拒绝H₀,差异显著
8第 8 页 · 假设检验

完全随机设计概述

上一节我们完成了修正均数的假设检验。但 F 检验能识别处理效应差异,前提是处理组是被随机分出来的——完全随机设计(CRD)正是这一前提的实验来源。

随机分配机制
每个实验单位进入任一处理组的概率相等
与随机抽样区分
随机分配控制内部混杂,随机抽样保证外部可推广
对ANCOVA的前提作用
保证协变量与处理独立,使调整后的处理效应估计无偏
主要局限
未利用区组信息;当存在已知区组因素时效率较低
抽签分座位对应 →完全随机分配

每张签被抽中的概率相等,但谁抽到哪张与个人特征完全无关

9第 9 页 · 完全随机设计概述

单因素协方差分析步骤

把前面各分项概念串成一条流水线,从建模到最终检验,五步走完整套流程。

1
建立模型
把处理因素和协变量一起纳入模型,写出ANCOVA方程
2
回归关系检验
看协变量与因变量是否有线性关系,无关系则协方差分析失去意义
3
回归系数齐性
检验各组回归斜率是否平行,不平行则需重新分组或换用其他方法
4
计算修正均数
用公共回归系数将各组均值校正到协变量同一水平上
5
修正均数检验
对修正后的均数做F检验,判断处理组间差异是否显著
10第 10 页 · 单因素协方差分析步骤

药物治疗实例演示

顺着箭头看三药比较的完整流程,两个菱形是必须通过的检验关卡。

图解渲染中…
a2X 为基线协变量(治疗前血压)a3Y 为因变量(治疗后血压)a6修正均数 = 用公共斜率把各组 Y 校正到同一基线后的组均值
11第 11 页 · 药物治疗实例演示

多因素完全随机设计扩展

上页我们演示了单因素协方差分析的全流程。但实际研究往往不止一个处理因素——比如同时比较药物种类和性别差异——这时模型必须从单因素扩展为两因素甚至更多。

两因素模型
在单因素模型基础上加入第二处理因素B,增加主效应βj与交互效应(αβ)ij
主效应分解
因素A、B各自的主效应αi和βj相互独立,可分别做F检验
交互效应
(αβ)ij反映两因素搭配产生的额外效应,是多因素分析独有的考察对象
修正均数扩展
在A、B与协变量联合控制下,计算每个处理组合(共ab个)的修正均数
齐性检验扩展
需检验ab个处理组合下协变量的回归斜率是否相等,比单因素更复杂
一场分男女组的赛跑对应 →两因素协方差分析

训练方法是因素A、性别是因素B、赛前体能是协变量;调整赛前体能后,分别看训练效应、性别差异及二者交互

yij=μ+αi+βj+(αβ)ij+γ(xijxˉ)+ϵijy_{ij} = \mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \gamma(x_{ij} - \bar{x}) + \epsilon_{ij}
12第 12 页 · 多因素完全随机设计扩展

随机区组设计概述

上一页完全随机设计假设所有个体差不多,直接随机分组。但现实总不配合:田有坡度、患者年龄悬殊——这些不关我们的事,却影响指标。怎么办?先按相似性分组,再随机。

区组
把相似的实验单位归为一组,每组就是一个区组
区组内随机
每个区组内部独立地把各处理随机分给个体
吸收区组间差异
组间系统差异被划入区组效应,从误差中剥离
前提:分块依据已知
必须事先知道按什么因素分,且该因素与处理无交互
与完全随机的权衡
多一层分组结构,牺牲部分自由度换取更小误差
农田沿坡位分块种试验对应 →随机区组设计

坡顶坡底肥力差大;按坡位分块(区组),块内随机安排品种(处理);坡度差异不再污染品种比较

13第 13 页 · 随机区组设计概述

两因素协方差分析步骤

两因素协方差分析把处理因素和区组因素同时纳入模型,分五步走完整套流程。

1
建立统计模型
把处理因素A、区组因素B与协变量X一并纳入回归方程
2
回归系数齐性检验
检验各处理组协变量X对响应变量Y的回归斜率是否一致
3
调整后方差分析
扣除协变量X的影响后,对处理A、区组B及交互项作F检验
4
计算修正均数
将各处理组校正到协变量同一水平后再做比较
5
多重比较
处理效应显著时,对修正均数进行组间两两比较
14第 14 页 · 两因素协方差分析步骤

动物实验实例演示

用一只「小鼠增重实验」演示协方差分析完整流程:从分组到修正后方差分析,八步走完一遍。

图解渲染中…
A2X=协变量,饲养前的小鼠初始体重A3Y=因变量,饲养结束后的增重量A4检验X与Y是否存在线性回归关系A6修正均数=用X矫正后的Y均值
15第 15 页 · 动物实验实例演示

与拉丁方设计的联系

上一页我们用协变量控制了连续型混杂因素。其实方差分析里早有类似思路——拉丁方设计控制行和列两个区组因素。今天看这两种方法骨子里想的是同一件事。

共同目标
都识别并剔除系统变异,让处理效应更干净地浮出来
拉丁方思路
用行、列两个方向划分区组,吸收两个已知干扰因素
协方差思路
用连续协变量回归,把随个体变化的干扰从误差里剥出
底层逻辑
都把总变异拆成「可解释」与「不可解释」,让 F 检验更灵敏
可融合
拉丁方设计也可引入协变量,做带协变量的拉丁方分析
给老照片去噪对应 →两种设计降误差

拉丁方像去掉网格状划痕,协方差像抹平明暗渐变;都是滤掉干扰让主体清晰

16第 16 页 · 与拉丁方设计的联系

医学研究应用场景

先按研究设计分流,再汇入同一模型;实线表示分析路径,虚线表示解释边界。

图解渲染中…
m校正协变量后估计组间差异t关注回归关系与斜率齐性i随机分组可加强疗效因果解释j仍可能有未测混杂,只能说明关联
17第 17 页 · 医学研究应用场景

协方差分析的关键要点

上页动物实验里,我们用协变量吸收了初始体重的干扰——但为什么必须先验证线性?为什么样本量不能省?这页把容易踩的坑和边界条件梳一遍。

混杂因素控制
协变量将组间基线差异'扣除',让处理效应比较公平
线性假设检验
协变量与因变量须满足直线关系,不满足需先做变量变换
回归系数齐性
各组回归斜率须一致;不齐说明存在交互,需改用分层模型
样本量要求
每纳入一个协变量,经验上需多10-20个观测,否则估计不稳
比较不同田块的作物产量对应 →协方差分析控制混杂

田块肥力差异会'污染'肥料效果——把肥力作为协变量调整,相当于把不同田块拉到同一肥力基准再比较

18第 18 页 · 协方差分析的关键要点

自测检验

点击作答

协方差分析中的「修正均数」是指什么?

19第 19 页 · 自测检验

课后思考

先独立思考再看参考答案,三个问题分别对应核心回顾、应用边界与知识迁移。

1为什么协方差分析要先做回归系数齐性检验,才能计算修正均数?

参考答案先验证调整方向一致——各组协变量对因变量的影响斜率必须相同,才能用同一把"尺"把各组拉到同一基准上比较;不齐则修正均数失去比较意义。

2如果处理因素和协变量存在交互(回归斜率不齐),常规修正均数比较会出什么问题?

参考答案斜率不齐意味着处理效应随协变量水平变化(交互效应)。此时合并的修正均数掩盖了真实差异,需按斜率分组讨论或引入交互项。

3协变量测量有误差时(如24小时回忆法),ANCOVA结果会偏倚吗?与普通回归的偏差有何不同?

参考答案测量误差导致协变量被"打散",普通回归会出现衰减偏倚;但ANCOVA还涉及残差方差与组间比较,偏差方向与影响路径不同,需用测量误差模型校正。

20第 20 页 · 课后思考
协方差分析 · 知识图解