多变量数据的统计描述与统计推断
看懂多元统计方法如何处理医学数据,并辨清关键假设与适用边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
多变量数据的统计描述与统计推断
看懂多元统计方法如何处理医学数据,并辨清关键假设与适用边界
什么是多变量数据
你去体检,护士一口气量了血压、血糖、血脂、心率——这些数字排在同一张报告单上。它们合起来,就是多变量数据:同一个体身上同时测出的多个相关指标。
单听小提琴只听到旋律,整个乐团各声部合奏才是立体的音乐;多变量也是要合起来听
单变量 vs 多变量分析
单变量只看一个指标,多变量联合多个维度——本质区别在哪?
- 一次只看一个指标的变化
- 方法简单:均值、方差、直方图
- 忽略变量之间的关联
- 适合初步描述单一现象
- 同时考察多个指标的联合分布
- 方法复杂:相关、回归、降维
- 揭示变量间的相关与因果
- 适合多因素影响的真实问题
多变量描述统计的核心指标
上页我们看到多变量分析要同时盯住 p 个变量。最朴素的思路:每个变量都算一个单变量代表数,再把它们打包——这就是均值向量和方差向量的来历。
均值向量=人群平均档案;方差向量=每项指标自身波动;协方差=体重↑血压↑的关联
协方差矩阵的结构与意义
前一页我们用均值向量描述集中趋势,用各变量方差描述离散程度。可两两变量之间的关系散落在各对协方差里——协方差矩阵正是把"每变量自身变异"与"每对变量共同变动"一次性打包的矩阵工具。
对角线=该生单科分数的波动范围;非对角线=两科分数共同涨跌的协方差
相关系数矩阵的可视化
横向是处理流程:原始数据→中心化→协方差→除σᵢσⱼ→相关矩阵→热力图;右侧虚线连接的是相关矩阵的三个数学性质。
Hotelling's T²检验原理
单变量 t 检验问的是「样本均值离总体均值有多远」;多变量时,样本均值变成 p 维向量——关键是:在多维空间里怎样度量这个「远」?
多维不仅看「多远」,还要把方向、尺度、相关性都折算进去
Hotelling's T²的计算步骤
Hotelling's T² 检验五步走:从假设到决策的完整流程。
两独立组的多变量检验
前面学的 Hotelling's T² 是把一个样本跟一个已知总体比——可现实里更常遇到的是两组人:甲药组和乙药组、新教学法和旧教学法——要回答的是,多个指标整体上有没有差别?
不能只比一项速度,要看十项加权的总分有没有实质差距
两配对组的多变量检验
上一页我们处理了两组独立对象。设想同一批病人在服药前与服药后各测了血压、血糖、心率——病人即对照,独立的检验方法已不适用,需换一套思路。
不比较两组人谁高,而是看这群人各自进步多少;每人对应差值向量的一行
多变量方差分析(MANOVA)概述
前两页的 Hotelling's T² 只解决两组对比。现实中更常遇到三组、四组甚至更多——三种教学法、四个地区——MANOVA 就是为这种 k≥2 组场景设计的。
把期末、期中、平时成绩合到一张成绩单上比,比只看一门分数更能反映方法差异
四大检验统计量
上页说MANOVA要回答'组间均值向量是否相同'。同一个问题,统计学家给了四种不同的'判官'来审——它们的脾气不同,给出的结论也可能不同。
Wilks看综合、Pillai累加各动作差、HL直接累加幅度、Roy只盯最惊艳那段
MANOVA结果解读
上一节认识了四个检验统计量,但拿到 MANOVA 输出后只看 p 值够吗?显著了之后又该怎么往下挖?这页讲判读的整体逻辑与边界。
omnibus 检验是『有没有病』的初筛,显著后再做 post-hoc 定位到具体病灶
重复测量设计的特点
上一页的两配对组检验只是重复测量的最小情形——同一对象只测两次。这一页把视野拉宽,看「同一个人被反复测」这种设计到底带来了什么。
学生自己跟自己比,水平高低这个干扰被抵消,看的只是变化幅度
单变量 vs 多变量方法
同一份重复测量数据,既能用 RM-ANOVA 拆开看,也能用多变量方法整体看。分水岭在协方差结构。
- 逐个因变量做 F 检验
- 要求严格满足球形假设
- 球形满足时:效能最高
- 球形违反时:F 值膨胀、α 失控
- 把测量视为整体向量统一检验
- 只要求多元正态,不要求球形
- 样本够大时:结果稳健可靠
- 样本小时:效能不如 RM-ANOVA
球形检验与校正方法
上一页我们讲了重复测量设计——同一被试多次测量。这种设计天然产生一个问题:各次测量之间的差异是否均匀?这就是球形假设要回答的事。
每把尺子两两测量之差的波动应接近,等同于方差齐
重复测量分析实操步骤
从数据检查到结果报告的五步实操流程,每步都有判断门槛。
核心知识回顾
- ✓维度上升:矩阵替换标量,自由度收紧
- ✓协方差矩阵统一了描述与推断的几何基础
- ✓单变量叠加不能替代多变量整体检验
- ✓数据结构(独立/配对/纵向)决定检验路径
- ✓违反假设时靠校正(GG/HF)或多变量兜底
课后思考
先合上屏幕想30秒,再看参考答案——重点是思路,不是标准答案。
参考答案多次单变量检验忽略变量间的相关结构,I类错误概率累积膨胀(族错误率>设定α)。多变量检验通过协方差矩阵整体建模,统一控制整体错误率。
参考答案首选MANOVA;若样本偏紧或变量高度相关,可先降维再做或用正则化判别;组间协方差结构异质时考虑稳健MANOVA。
参考答案协方差矩阵奇异或病态,Wilks' Lambda等经典统计量分布假设失效;可走降维(PCA/PLS)、正则化协方差,或置换检验/贝叶斯等非参数路线。