多因素试验资料的方差分析

官方医学老师·28 页·深入(追求细节与边界)·0 次浏览·2 天前
方差分析多因素试验设计统计分析

多因素试验资料的方差分析

看透单因素到多因素的跨越,掌握多因素方差分析的核心逻辑

按 空格/→ 演示下一步

1 / 28 页

全部页面点击任意一页,跳回舞台从这页播放

方差分析多因素试验设计统计分析

多因素试验资料的方差分析

看透单因素到多因素的跨越,掌握多因素方差分析的核心逻辑

1第 1 页 · 多因素试验资料的方差分析

什么是多因素试验

养花时想弄清光照和浇水哪个影响更大。单因素试验只能一个一个来——先固定浇水测光照,再固定光照测浇水。多因素试验可以同时改变两者,一次看清全貌。

同时考察多因素
试验中同时改变两个或两个以上因素的水平
全面交叉组合
各因素的水平两两搭配,形成多种处理组合
可分析交互作用
发现一个因素的效果是否随另一因素变化
效率高、更贴近实际
一次试验同时回答多个问题,结论适用面更广
同时调空调温度和风速对应 →多因素试验

两两搭配出多种组合,找出最佳搭配——这就是在考察多因素共同效果

2第 2 页 · 什么是多因素试验

多因素试验的分类体系

四种设计并列,按处理组合方式与误差结构区分

图解渲染中…
a1所有水平全组合,可分析交互作用b1用正交表选代表组合,效率高c1因素分层包含,水平数不等d1分主副区,两阶段误差不同
3第 3 页 · 多因素试验的分类体系

析因设计的基本原理

前面讲了多因素试验是什么、怎么分类。这一页聚焦最常用的一类——析因设计。它的核心一句话:把所有因素的每个水平都两两搭配,全部做一遍,一组不漏。

交叉分组
因素A的每个水平,都要与因素B的每个水平在试验中相遇一次
全面组合
k个因素各有nᵢ个水平,总处理数=各水平数之积,全部组合都要做
主效应+交互效应同时估计
既能拆开每个因素自己的影响,也能揭示因素间是否互相牵制
均衡可比
每个处理组合的重复数相同,方差分析建立在对称结构上
厨房调味试验对应 →析因设计的全面组合

盐3档×火候3档=9组,少一个既分不清谁在起作用,更看不出两者是否互相牵制

yij=μ+αi+βj+(αβ)ij+εijy_{ij} = \mu + \alpha_i + \beta_j + (\alpha\beta)_{ij} + \varepsilon_{ij}
4第 4 页 · 析因设计的基本原理

两因素析因设计的数据结构

从n个原始观测出发,先聚合成ab个处理小计,再按A、B分别归并出行/列边际合计,最终汇入总合计G。

图解渲染中…
n1每个观测对应A第i水平、B第j水平、第k次重复t1同处理组合内的观测累加,记为X_ijr1固定i,沿j=1..b求和,得A第i水平的行合计c1固定j,沿i=1..a求和,得B第j水平的列合计
5第 5 页 · 两因素析因设计的数据结构

方差分析的步骤流程

方差分析按四步走:从分解总变异到F检验得出结论,每步都有明确任务。

1
总变异分解
把全部数据波动拆成处理、误差等若干来源
2
自由度计算
每个变异来源对应各自的自由度
3
构造F统计量
用效应均方与误差均方之比构造F值
4
F检验并结论
将F值与临界值比较,判断效应是否显著
6第 6 页 · 方差分析的步骤流程

变异来源的分解逻辑

SS总=SSA+SSB+SSAB+SSe,总自由度分解为主效应与交互效应自由度

变异来源的分解逻辑
SS总=SSA+SSB+SSAB+SSe,总自由度分解为主效应与交互效应自由度
7第 7 页 · 变异来源的分解逻辑

交互效应的意义与解读

什么是交互作用、正交互作用与负交互作用、交互作用的专业含义

交互效应的意义与解读
什么是交互作用、正交互作用与负交互作用、交互作用的专业含义
8第 8 页 · 交互效应的意义与解读

固定效应 vs 随机效应模型

析因设计中,固定与随机效应直接决定方差分析的构造方式,混淆会导致 F 检验失效。

固定效应模型
  • 水平由研究者主动选定
  • 期望均方含固定效应与误差
  • 结论只适用于所选水平
  • F=处理均方/误差均方
随机效应模型
  • 水平从总体中随机抽取
  • 期望均方含随机效应方差分量
  • 结论可推广到所有可能水平
  • F比需重新匹配期望均方
研究者刻意选定水平用固定模型;水平是总体抽样用随机模型——F比错了结论全错。
9第 9 页 · 固定效应 vs 随机效应模型

三因素析因设计概述

两因素析因设计中,每个因素取2水平就有4种处理组合。第三个因素加入后,局面会发生什么变化?

全面组合
三因素的所有水平逐一搭配,穷尽所有可能性
8种处理
2×2×2=8,三因素各2水平即得8个处理组合
三阶交互效应
A×B×C,三个因素共同产生的效应,两因素设计里不存在
高阶解读难度
三阶交互难用一张图说清,常用切片法或数值表解读
调鸡尾酒对应 →三因素析因设计

基酒、辅料、装饰各选一种,调出8杯各不相同的口感

$2^3 = 2 \times 2 \times 2 = 8$
10第 10 页 · 三因素析因设计概述

三因素设计的变异分解

从上往下读:总变异先拆为处理与误差,处理变异再按主效应→一级交互→二级交互逐层分解。

图解渲染中…
t3误差变异,反映随机波动g1各因素单独的平均影响g2两因素联合才出现的效应g3三因素同时变动才显现
11第 11 页 · 三因素设计的变异分解

三因素方差分析操作流程

三因素方差分析按六步推进,从算平方和到 F 检验一气呵成。

1
建表与校正项C
整理三因素各处理组合的观测值,按 C=(ΣX)²/N 算出基准项
2
分解总平方和
SST 拆为 SSA、SSB、SSC、SSAB、SSAC、SSBC、SSABC、SSe 共八项
3
计算自由度df
主效应 df=水平数-1;交互 df=对应主效应 df 之积;误差 df 取剩余
4
求各均方MS
各 MS=SS/df;其中误差均方 MS_e 是后续 F 检验的分母
5
构造F统计量
各效应 F=MS_效应/MS_e,与 F 分布临界值比较得 P 值
6
列方差分析表
汇总成一张 ANOVA 表,标记显著效应,不显著项保留供后续讨论
12第 12 页 · 三因素方差分析操作流程

主效应与交互效应的解释

上一页我们把变异拆成若干份,但「主效应=0.8」这种数字究竟在说什么?它说的是平均水平,而交互效应说的是平均水平掩盖下的差异——这两件事必须分开讲。

单元均值
所有因子取特定水平组合时的均值,是最具体的处理效应
边际均值
对其他因子取平均后得到的均值,反映某因子的「平均表现」
简单效应
把另一因子固定在某一水平后,主效应在该水平下的「切片」
三阶交互解读
看两两交互的方向是否随第三因子水平改变而翻转
班级考试平均分对应 →单元均值 vs 边际均值

全班数学均分是边际均值(性别已平均掉);男生数学均分是单元均值(性别+科目均固定)

YˉijYˉi 随 j 变即交互\bar{Y}_{ij\cdot}-\bar{Y}_{i\cdot\cdot}\ \text{随 }j\text{ 变即交互}
13第 13 页 · 主效应与交互效应的解释

正交设计的基本思想

三因素 2 水平要做 8 次,5 因素 4 水平就是要 1024 次——因素和水平数一膨胀,全面试验就跑不动。正交设计挑出一张精挑细选的'代表队',把试验次数砍下来,同时保住关键信息。

部分实施
从全部水平组合中精选代表性子集,大幅压缩试验次数
均匀分散
代表点在因子空间内均匀铺开,避免扎堆或遗漏
整齐可比
任两因素的水平组合出现次数相等,保证可比性
正交性
两条原则的数学结果:各列正交,主效应独立估计
品酒盲品实验对应 →正交设计

4 款酒覆盖 3 因素 × 2 水平:每因素各水平 2 次、每两因素组合 1 次——即 L₄(2³)

Ln(mk), i=1nxijxik=0 (jk)L_n(m^k),\ \sum_{i=1}^{n} x_{ij}\,x_{ik}=0\ (j\neq k)
14第 14 页 · 正交设计的基本思想

正交表及其符号解读

从通用记号 Lₙ(kᵐ) 解构入手,展示列与因素的对应关系,并以 L8(2⁷) 为例说明交互列的安排规则。

图解渲染中…
S正交表通用记号 Lₙ(kᵐ):n 次试验、k 水平、m 列F列有双重身份:可安排因素,也可承载因素间的交互作用H2L8(2⁷) 中列3 由列1、2 自动生成的二阶交互列H6三阶交互列 A×B×C,占最后一列
15第 15 页 · 正交表及其符号解读

正交试验的方差分析流程

正交试验方差分析五步走:算总变异→拆列间变异→分自由度→F检验→选最优。

1
算总平方和
所有观测值与总均值之差的平方和,记作S_T,刻画全部变异总量
2
分列间变异
按正交表各列拆SS_A、SS_B等,空列或SS小列并入误差SS_e
3
分配自由度
总df=N-1;因素df=水平数-1;误差df由所并入列累加得到
4
列F检验
每列F=MS_因/MS_误差,与F临界值比,判定该因素是否显著
5
定最优组合
显著因素选最优水平均值所在列,不显著因素水平可任选
16第 16 页 · 正交试验的方差分析流程

正交设计 vs 析因设计

两者都用于多因素试验,但试验次数和信息量差异巨大,适用场景完全不同。

析因设计
  • 完全组合,次数随因素数指数增长
  • 完整信息,主效应与所有交互效应都可估计
  • 因素与水平少时首选,能完整揭示交互作用
  • 强于解析交互效应,机理研究的核心工具
正交设计
  • 部分组合,用正交表大幅精简试验次数
  • 信息有损,部分交互效应混杂或无法估计
  • 因素多、水平多时首选,适合初步因素筛选
  • 强于快速定位主效应,工程优化的常用手段
要解析交互机理选析因,要高效筛选因素选正交;因素少用析因,因素多用正交。
17第 17 页 · 正交设计 vs 析因设计

嵌套设计的概念与特征

析因设计里,A 的每个水平下都出现 B 的全部水平——这叫交叉。但有些结构是「嵌套」的:B 因素下的各水平只「藏在」A 的某个特定水平下,无法跨界。这种结构对应一套独立的方差分解方式。

嵌套结构
B 的各水平只存在于 A 的某个特定水平内部,A 不同水平下对应的是 B 的不同实例
不能交叉
A 各水平下的 B 水平互不相同,无法构成 A×B 的全组合
不可随机排列
B 的水平从属于 A 的特定水平,不能拆出来与其他 A 水平重新搭配
记法 B(A)
用 B(A) 表示 B 嵌套于 A,读作「B 在 A 内」
典型场景
不同工厂的工人、不同门店的店员、不同产地的子批次样本等天然具有层级关系
不同工厂的工人对应 →嵌套设计 B(A)

工厂 1 的工人甲与工厂 2 的工人甲是完全不同的人,分别嵌套在各自工厂下

18第 18 页 · 嵌套设计的概念与特征

嵌套设计的模型结构

先看上方总变异如何向下分解为三层,再看B如何在各A水平内部分支。

图解渲染中…
SBSSB(A) 表示B的变异被嵌套在A内,与析因的B不同A1BA1只属于A1,不与其他A水平交叉
19第 19 页 · 嵌套设计的模型结构

嵌套设计的方差分析要点

嵌套效应的假设检验、下层因素不与上层因素交叉

嵌套设计的方差分析要点
嵌套效应的假设检验、下层因素不与上层因素交叉
20第 20 页 · 嵌套设计的方差分析要点

嵌套设计 vs 交叉设计

嵌套和交叉都涉及多因素,但一个的B只在A内出现,另一个则全面配对——本质区别决定模型选错全盘皆错。

嵌套设计
  • B的水平只在A某水平内出现
  • B的不同水平是不同批次,不可横比
  • 例:不同医院的不同医生各不相同
  • 只估A的主效应和B(A)方差分量
交叉设计
  • A的每水平都与B所有水平配对
  • B同一水平在所有A水平下都出现
  • 例:每种药物的每个剂量都做试验
  • 可估主效应和交互效应
判断标准:B的同一水平能否在A的不同水平下重复出现?能则交叉,不能则嵌套。
21第 21 页 · 嵌套设计 vs 交叉设计

裂区设计的适用场景

上节讲嵌套设计解决'因素分层'。但还有一种情况:两因素都重要,但改起来的成本天差地别——换灌溉方式要重铺管道,换肥料批次只是换个包装。'成本不对等'的场合,正是裂区设计的用武之地。

调整成本不对等
不同因素的设置难度差异显著,有的要整批改动,有的可随手切换
难调因素定主区
一次性大单位(whole plot)容纳难调因素的水平
易调因素布副区
每个主区内细分若干副区(sub-plot)安排易调因素
精度此消彼长
副区因素估计更精确,主区因素精度反而下降
田间灌溉实验对应 →裂区设计

整片田灌溉难改(主区),同片田中品种易换(副区)

22第 22 页 · 裂区设计的适用场景

裂区设计的模型结构

从试验地往下,先按 A 划分主区(粗粒度),再在主区内按 B 划分裂区(细粒度)——两级随机化。

图解渲染中…
B1主区:A 的随机化单位,对应主区误差 EaC1裂区:B 的随机化单位,对应裂区误差 EbA两级随机化:A 先分主区,B 再在主内分裂区
23第 23 页 · 裂区设计的模型结构

裂区设计的方差分析特点

上一页讲裂区设计有主区、副区两层随机化,这直接决定了方差分析必须用两把不同的尺子度量误差。

两层误差结构
主区误差估计主区之间差异,副区误差估计副区之间差异
误差精度不同
主区通常较大含更多环境变异,副区小且同质精度更高
效应与误差匹配
A主效应用主区误差MS_Ea,B主效应及AB交互用副区误差MS_Eb
F检验分母各异
三个F值分母各不相同,分别反映各自层次的变异精度
工厂的大车间与小班组对应 →主区误差和副区误差

车间间差异大用粗尺衡量,班组间差异小用精尺衡量

FA=MSAMSEa,FB=MSBMSEb,FAB=MSABMSEbF_A=\dfrac{MS_A}{MS_{Ea}},\quad F_B=\dfrac{MS_B}{MS_{Eb}},\quad F_{AB}=\dfrac{MS_{AB}}{MS_{Eb}}
24第 24 页 · 裂区设计的方差分析特点

核心概念自测

点击作答

在两因素析因设计中,A因素3水平、B因素4水平。A1水平下B各水平均值差异小,A3水平下B各水平均值差异大。这种现象最合理的解释是:

25第 25 页 · 核心概念自测

五种设计方法的对比总览

析因与嵌套是两种最基本的多因素结构——交叉还是层级,决定你能回答什么问题。

析因设计
  • 两因素完全交叉,对等独立
  • 可估计 A×B 交互效应
  • A、B 均以误差 MSE 为分母
  • 因素对等、关注交互时选用
嵌套设计
  • B 嵌套于 A,存在层级
  • 无法估计交互效应
  • B 以 A 内变异为分母
  • 因素有层级或不可交叉时选用
要估计交互选析因,要处理层级选嵌套——正交是析因的省力版,裂区兼顾两者。
26第 26 页 · 五种设计方法的对比总览

多因素试验方差分析要点回顾

  • 变异按设计结构逐层拆分到各因素与交互
  • 交互效应是多因素分析的核心价值所在
  • 设计类型先于模型,分析方法随设计走
  • 固定与随机效应选择决定 F 检验含义
  • 统计效率与现实约束之间永远要权衡
延伸主题:重复测量资料的方差分析协方差分析 ANCOVA线性混合效应模型
27第 27 页 · 多因素试验方差分析要点回顾

课后思考

先自己想,再对照参考答案琢磨思路。带着问题继续思考实际研究中的设计选择。

1为什么分析多因素试验时不能只看主效应,而必须考虑交互作用?

参考答案主效应只是各因素单独的平均效果;若因素间存在交互,单独看主效应可能掩盖或误导真实规律,必须结合交互效应解读。

2如果资源只够跑部分处理组合,全因子与正交设计该如何取舍?

参考答案正交设计牺牲了高阶交互的估计来换取处理数大幅减少;全因子保留全部交互但成本高。取舍取决于是否需要估计高阶交互。

3现实中若因素天然存在嵌套关系(如医院-科室),还能用析因设计吗?

参考答案不能强行做交叉。嵌套设计的因素水平只在上级内出现,跨级无交叉;若用析因会产生大量空单元格,参数估计失效。

28第 28 页 · 课后思考
多因素试验资料的方差分析 · 知识图解