多变量数据的统计描述与统计推断

官方医学老师·19 页·深入(追求细节与边界)·0 次浏览·2 天前
医学统计多变量分析统计推断

多变量数据的统计描述与统计推断

看懂多元统计方法如何处理医学数据,并辨清关键假设与适用边界

按 空格/→ 演示下一步

1 / 19 页

全部页面点击任意一页,跳回舞台从这页播放

医学统计多变量分析统计推断

多变量数据的统计描述与统计推断

看懂多元统计方法如何处理医学数据,并辨清关键假设与适用边界

1第 1 页 · 多变量数据的统计描述与统计推断

什么是多变量数据

你去体检,护士一口气量了血压、血糖、血脂、心率——这些数字排在同一张报告单上。它们合起来,就是多变量数据:同一个体身上同时测出的多个相关指标。

同一客体的多个变量
对同一个个体同时记录多个指标,血压、血糖、血脂、BMI 是典型例子
变量之间普遍相关
血压高的人往往血脂也高,这些变量在统计上不能视为独立,否则会丢掉关键信息
焦点是变量间的联动
分析多变量数据时,重点不在每个变量的分布,而在它们之间如何共同变化、彼此牵制
「多」的门槛是 p≥2
二元(两个变量)是多变量分析的起点,也是最常见的入门情形
听交响乐团演奏对应 →观测多变量数据

单听小提琴只听到旋律,整个乐团各声部合奏才是立体的音乐;多变量也是要合起来听

2第 2 页 · 什么是多变量数据

单变量 vs 多变量分析

单变量只看一个指标,多变量联合多个维度——本质区别在哪?

单变量分析
  • 一次只看一个指标的变化
  • 方法简单:均值、方差、直方图
  • 忽略变量之间的关联
  • 适合初步描述单一现象
多变量分析
  • 同时考察多个指标的联合分布
  • 方法复杂:相关、回归、降维
  • 揭示变量间的相关与因果
  • 适合多因素影响的真实问题
研究多个因素的联合影响时,必须升级到多变量分析。
3第 3 页 · 单变量 vs 多变量分析

多变量描述统计的核心指标

上页我们看到多变量分析要同时盯住 p 个变量。最朴素的思路:每个变量都算一个单变量代表数,再把它们打包——这就是均值向量和方差向量的来历。

均值向量
各变量样本均值拼成的 p 维列向量,指向数据的「重心」
方差向量
各变量方差拼成的向量,描述每个维度各自的离散程度
协方差矩阵
对角线是方差,非对角线是两两协方差,刻画维度间的共变关系
一群人的体检档案对应 →多变量描述统计量

均值向量=人群平均档案;方差向量=每项指标自身波动;协方差=体重↑血压↑的关联

Xˉ=(Xˉ1,,Xˉp)T, sij=Cov(Xi,Xj)\bar{X} = (\bar{X}_1, \ldots, \bar{X}_p)^T,\ s_{ij} = \mathrm{Cov}(X_i, X_j)
4第 4 页 · 多变量描述统计的核心指标

协方差矩阵的结构与意义

前一页我们用均值向量描述集中趋势,用各变量方差描述离散程度。可两两变量之间的关系散落在各对协方差里——协方差矩阵正是把"每变量自身变异"与"每对变量共同变动"一次性打包的矩阵工具。

p×p 对称方阵
p 个变量对应 p×p 矩阵;因 Cov(Xᵢ,Xⱼ)=Cov(Xⱼ,Xᵢ),沿主对角线对称
对角线=方差
Σᵢᵢ 即变量 Xᵢ 的方差,反映其自身的离散程度
非对角线=协方差
Σᵢⱼ 为 Xᵢ 与 Xⱼ 的协方差,正负号揭示同向或反向变动
任一行的画像
第 i 行/列同时给出 Xᵢ 与全部变量(含自身)的关系,一图胜千言
多变量分析的基石
主成分分析、马氏距离、判别分析、典型相关等都建立在 Σ 之上
学生多科成绩分析表对应 →协方差矩阵

对角线=该生单科分数的波动范围;非对角线=两科分数共同涨跌的协方差

Σ=[σij]p×p, σii=Var(Xi), σij=Cov(Xi,Xj) (ij)\Sigma = [\sigma_{ij}]_{p\times p},\ \sigma_{ii}=\text{Var}(X_i),\ \sigma_{ij}=\text{Cov}(X_i,X_j)\ (i\neq j)
5第 5 页 · 协方差矩阵的结构与意义

相关系数矩阵的可视化

横向是处理流程:原始数据→中心化→协方差→除σᵢσⱼ→相关矩阵→热力图;右侧虚线连接的是相关矩阵的三个数学性质。

图解渲染中…
a4σᵢ、σⱼ为变量i、j的标准差,除以它们的乘积消除量纲a6热力图:颜色深浅表示相关性强弱
6第 6 页 · 相关系数矩阵的可视化

Hotelling's T²检验原理

单变量 t 检验问的是「样本均值离总体均值有多远」;多变量时,样本均值变成 p 维向量——关键是:在多维空间里怎样度量这个「远」?

假设形式
H₀: μ = μ₀ 是 p 维向量等式,要求 p 个分量均值同时等于指定值
马氏距离
用 S⁻¹ 对差异向量加权,综合考虑各变量尺度与彼此相关性
统计量构造
T² = n · D²,其中 D² 是 x̄ 到 μ₀ 的马氏距离
分布性质
H₀ 下 (n−p)/[p(n−1)]·T² 服从 F(p, n−p)
单变量退化
p = 1 时 T² = t²,恰好退化为单变量 t 检验的平方
数轴上点到原点的距离对应 →多维空间里均值向量到 μ₀ 的马氏距离

多维不仅看「多远」,还要把方向、尺度、相关性都折算进去

T2=n(xˉμ0)S1(xˉμ0)T^{2}=n(\bar{\mathbf{x}}-\boldsymbol{\mu}_{0})^{\top}\mathbf{S}^{-1}(\bar{\mathbf{x}}-\boldsymbol{\mu}_{0})
7第 7 页 · Hotelling's T²检验原理

Hotelling's T²的计算步骤

Hotelling's T² 检验五步走:从假设到决策的完整流程。

1
建立假设
设定原假设 H₀: μ = μ₀ 与备择假设 H₁
2
算均值与协方差
由样本算出均值向量 x̄ 与协方差矩阵 S
3
计算 T² 统计量
代入 T² = n(x̄-μ₀)ᵀS⁻¹(x̄-μ₀) 求值
4
转换为 F 统计量
用 F = [(n-p)/(p(n-1))]·T² 转成 F 分布
5
比较并决策
查 F 临界值或算 p 值,与 α 比较下结论
8第 8 页 · Hotelling's T²的计算步骤

两独立组的多变量检验

前面学的 Hotelling's T² 是把一个样本跟一个已知总体比——可现实里更常遇到的是两组人:甲药组和乙药组、新教学法和旧教学法——要回答的是,多个指标整体上有没有差别?

检验场景
两组独立样本,各自含 n 个观测、p 个指标
原假设
H₀: μ₁ = μ₂,两均值向量整体相等
统计量
双样本 Hotelling's T²,用均值差向量构造
t 检验推广
p=1 时退化为两样本 t² 的等价形式
协方差前提
需 Σ₁ = Σ₂,否则用近似 F 检验校正
十项全能综合得分对应 →双样本均值向量比较

不能只比一项速度,要看十项加权的总分有没有实质差距

T2=(xˉ1xˉ2)[Sp(1n1+1n2)]1(xˉ1xˉ2)T^2 = (\bar{x}_1 - \bar{x}_2)' \left[S_p\left(\frac{1}{n_1} + \frac{1}{n_2}\right)\right]^{-1} (\bar{x}_1 - \bar{x}_2)
9第 9 页 · 两独立组的多变量检验

两配对组的多变量检验

上一页我们处理了两组独立对象。设想同一批病人在服药前与服药后各测了血压、血糖、心率——病人即对照,独立的检验方法已不适用,需换一套思路。

配对的本质:同体重复测量
同一对象的多次测量构成配对,区别于两个独立人群
差值向量 d
每人对所有指标计算前后差,得 N×p 的差值矩阵
差值上的 T² 检验
零假设:差值均值向量为零;即多项指标整体无变化
前后测与配对设计
同一对象两条件测量、配对匹配、重复测量数据均适用此方法
配对的统计增益
吸收个体基线差异,灵敏度通常高于独立组检验
同一批学生补习前后成绩对比对应 →配对多变量检验

不比较两组人谁高,而是看这群人各自进步多少;每人对应差值向量的一行

T2=ndˉTSd1dˉ,F=npp(n1)T2Fp,npT^2 = n\bar{\mathbf{d}}^T S_d^{-1} \bar{\mathbf{d}}, \quad F = \frac{n-p}{p(n-1)}T^2 \sim F_{p,n-p}
10第 10 页 · 两配对组的多变量检验

多变量方差分析(MANOVA)概述

前两页的 Hotelling's T² 只解决两组对比。现实中更常遇到三组、四组甚至更多——三种教学法、四个地区——MANOVA 就是为这种 k≥2 组场景设计的。

核心问题
同时检验 k≥2 组的均值向量 μ₁,…,μₖ 是否全部相等
方法谱系
k=2 时等价于 Hotelling's T²,单因变量时退化为单因素 ANOVA
四类统计量
Wilks' Λ、Pillai 迹、Hotelling-Lawley 迹、Roy 最大根
假设与稳健性
需多元正态 + 协方差齐性(Box's M);不齐时 Pillai 迹最稳健
三种教学法的整体评估对应 →MANOVA

把期末、期中、平时成绩合到一张成绩单上比,比只看一门分数更能反映方法差异

Λ=EE+H,  H0:μ1==μk\Lambda=\dfrac{|\mathbf{E}|}{|\mathbf{E}+\mathbf{H}|},\;H_0:\mu_1=\cdots=\mu_k
11第 11 页 · 多变量方差分析(MANOVA)概述

四大检验统计量

上页说MANOVA要回答'组间均值向量是否相同'。同一个问题,统计学家给了四种不同的'判官'来审——它们的脾气不同,给出的结论也可能不同。

Wilks Lambda
最常用的似然比法,比较组内与总协方差的比值,Λ越接近0组间差异越大
Pillai轨迹
把各判别维度的差异累加,对非正态和异方差最稳健,实际推荐首选
HL轨迹
Hotelling-Lawley,直接累加全部特征根不标准化,数学最简洁但敏感
Roy最大根
只看最大的一个特征根,最敏感也最'赌':方向对了最强,错了偏宽松
四位评委评同一支舞对应 →四个MANOVA检验统计量

Wilks看综合、Pillai累加各动作差、HL直接累加幅度、Roy只盯最惊艳那段

Λ=11+λi,  V=λi1+λi,  H=λi,  θ=maxλi\Lambda=\prod\frac{1}{1+\lambda_i},\;V=\sum\frac{\lambda_i}{1+\lambda_i},\;H=\sum\lambda_i,\;\theta=\max\lambda_i
12第 12 页 · 四大检验统计量

MANOVA结果解读

上一节认识了四个检验统计量,但拿到 MANOVA 输出后只看 p 值够吗?显著了之后又该怎么往下挖?这页讲判读的整体逻辑与边界。

选对统计量
平衡设计优先 Wilks' Λ;担心存在一个支配性效应时改用 Roy's 最大根
看整体显著性
p<α 只能拒绝 H0:至少两组均值向量不同,无法定位是哪两组、哪个因变量
显著后做 post-hoc
判别分析找最佳线性组合;或逐因变量单因素 ANOVA 并用 Bonferroni 校正
边界与陷阱
样本量小致功效不足漏检;因变量高度共线会扭曲统计量、放大一类错误
校正不可省
k 次两两比较把 α 调到 α/k,否则累积第一类错误率远超设定的显著性水平
体检诊断流程对应 →MANOVA 结果解读

omnibus 检验是『有没有病』的初筛,显著后再做 post-hoc 定位到具体病灶

13第 13 页 · MANOVA结果解读

重复测量设计的特点

上一页的两配对组检验只是重复测量的最小情形——同一对象只测两次。这一页把视野拉宽,看「同一个人被反复测」这种设计到底带来了什么。

同对象多次测量
同一批受试者在不同条件或时间点接受多次测量,属于 within-subject 设计
个体差异被自动消化
每个人做自己的对照,组间变异不再进入误差项
观测值不再独立
同一受试者多次测量彼此相关,必须借助多变量方法处理协方差结构
样本更省、检验力更高
误差项缩小后,达到同等检验力所需样本量比独立组设计少
需检验球形性
若违反 sphericity(所有配对差分方差齐),需用 Greenhouse-Geisser 校正
一个学生每次月考的成绩对应 →重复测量设计

学生自己跟自己比,水平高低这个干扰被抵消,看的只是变化幅度

\sigma^2_{error}^{RM}=\sigma^2(1-\rho)
14第 14 页 · 重复测量设计的特点

单变量 vs 多变量方法

同一份重复测量数据,既能用 RM-ANOVA 拆开看,也能用多变量方法整体看。分水岭在协方差结构。

单变量方法
  • 逐个因变量做 F 检验
  • 要求严格满足球形假设
  • 球形满足时:效能最高
  • 球形违反时:F 值膨胀、α 失控
多变量方法
  • 把测量视为整体向量统一检验
  • 只要求多元正态,不要求球形
  • 样本够大时:结果稳健可靠
  • 样本小时:效能不如 RM-ANOVA
先跑 Mauchly 球形检验:满足用 RM-ANOVA(效能高);违反用 RM-MANOVA 或 GG 校正。球形检验是分水岭。
15第 15 页 · 单变量 vs 多变量方法

球形检验与校正方法

上一页我们讲了重复测量设计——同一被试多次测量。这种设计天然产生一个问题:各次测量之间的差异是否均匀?这就是球形假设要回答的事。

球形假设
任意两次测量条件之差值的方差都相等,是单变量重复测量ANOVA的前提
Mauchly检验
专门检验球形假设是否成立;p<.05 则拒绝,即球形不成立
G-G校正
用ε调整自由度;ε越小于1,校正越强,结果越保守
H-F校正
同样基于ε,但补偿了G-G的偏保守;样本小时更稳定
用不同尺子反复量同一本书对应 →球形假设

每把尺子两两测量之差的波动应接近,等同于方差齐

$\varepsilon \in \left[\frac{1}{k-1},\, 1\right]$,k为测量条件数
16第 16 页 · 球形检验与校正方法

重复测量分析实操步骤

从数据检查到结果报告的五步实操流程,每步都有判断门槛。

1
数据检查
看缺失值、异常值,画各时间点描述统计图
2
球形检验
用Mauchly检验判断各时间点方差-协方差是否齐
3
选择方法
满足用普通F;违反则用校正系数或转走MANOVA
4
效应与事后比较
读η²与偏η²,对时间点做事后多重比较
5
规范报告
写清检验统计量、自由度、效应量与校正方法
17第 17 页 · 重复测量分析实操步骤

核心知识回顾

  • 维度上升:矩阵替换标量,自由度收紧
  • 协方差矩阵统一了描述与推断的几何基础
  • 单变量叠加不能替代多变量整体检验
  • 数据结构(独立/配对/纵向)决定检验路径
  • 违反假设时靠校正(GG/HF)或多变量兜底
延伸主题:判别分析与分类预测因子分析:降维与潜在结构
18第 18 页 · 核心知识回顾

课后思考

先合上屏幕想30秒,再看参考答案——重点是思路,不是标准答案。

1多变量分析为什么不能简单等同于"对每个变量各做一个单变量检验"?

参考答案多次单变量检验忽略变量间的相关结构,I类错误概率累积膨胀(族错误率>设定α)。多变量检验通过协方差矩阵整体建模,统一控制整体错误率。

25个相关结局变量、3个组、样本量50,你选什么方法?为什么?

参考答案首选MANOVA;若样本偏紧或变量高度相关,可先降维再做或用正则化判别;组间协方差结构异质时考虑稳健MANOVA。

3当变量数p接近甚至超过样本量n时,多变量检验会面临什么本质困难?

参考答案协方差矩阵奇异或病态,Wilks' Lambda等经典统计量分布假设失效;可走降维(PCA/PLS)、正则化协方差,或置换检验/贝叶斯等非参数路线。

19第 19 页 · 课后思考