多元线性回归分析

官方医学老师·44 页·深入(追求细节与边界)·0 次浏览·2 天前
多元回归医学统计共线性模型诊断

多元线性回归分析

搞懂偏回归系数、共线性诊断与模型评价的完整逻辑

按 空格/→ 演示下一步

1 / 44 页

全部页面点击任意一页,跳回舞台从这页播放

多元回归医学统计共线性模型诊断

多元线性回归分析

搞懂偏回归系数、共线性诊断与模型评价的完整逻辑

1第 1 页 · 多元线性回归分析

从简单到多元:为什么需要多元回归

冰淇淋销量越高,溺水死亡越多——难道冰淇淋害死了人?夏天才是真正的元凶:它同时让两者都上升。单看一个变量,规律是被骗出来的。

混杂变量
同时影响X和Y的第三方因素,让X与Y出现虚假相关
偏效应估计
控制其他变量后,X对Y的真实净影响
联合预测
多因素共同作用,比单一变量预测更贴近现实
拍照同时调曝光+对比度+饱和度对应 →多元回归同时纳入多个自变量

单调一项照片失真,多参数联合调整才接近真实画面

2第 2 页 · 从简单到多元:为什么需要多元回归

多元回归的核心思想

上一页我们意识到:一个结果往往受多个因素共同作用。那要怎么把这'多个因素'同时塞进一个方程,让它们彼此配合、互不打架?这就是多元回归要回答的核心问题。

联合建模
把多个自变量同时塞进一个方程,整体估计它们对因变量的联合影响
偏效应
每个 β_j 的含义:其它 X 不变时,X_j 变动一单位,Y 平均变化多少
控制混淆
把可能的混淆变量纳入模型,相当于'按住'它们,让目标 X 的估计更干净
调一道菜对应 →多元回归的偏效应

想知道盐对味道影响多大,光尝盐没用;要让糖、火候、时长不变,只动盐——这就是'控制其他变量'的思想

Y=β0+β1X1+β2X2+β3X3+εY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 X_3 + \varepsilon
3第 3 页 · 多元回归的核心思想

多元线性回归模型的基本形式

前面我们说,多个自变量会"合力"影响因变量。但"合力"究竟长什么样,必须落到方程上才说得清。这一页同时摆出两种方程——一个是"上帝视角"的真相,一个是"手里有数据"的估计。

总体回归方程 PRF
描述 Y 与 X 的真实关系,参数 β 固定但不可观测
样本回归方程 SRF
用一组样本数据估计出的方程,b 是 β 的估计量
两者的三大差异
β 对 b、确定对随机、不可观测对可计算
残差项 u 与 e
u 含所有不可观测因素;e 是 u 的样本对应物
靶心与一次射击的弹孔对应 →总体参数与样本估计

靶心(β)固定但看不到;弹孔(b)能看见,但每枪都偏一点

Yi=β0+β1X1i++βkXki+uiY^i=b0+b1X1i++bkXkiY_i = \beta_0 + \beta_1 X_{1i} + \cdots + \beta_k X_{ki} + u_i \hat{Y}_i = b_0 + b_1 X_{1i} + \cdots + b_k X_{ki}
4第 4 页 · 多元线性回归模型的基本形式

回归系数的直观含义

从「所有变量一起变」出发,用「冻结其他变量」的思维,找到 X₁ 对 Y 的纯影响。

图解渲染中…
D「固定切面」= 其他变量视为常数F偏回归系数 = 控制其他 X 后 X₁ 的纯效应
5第 5 页 · 回归系数的直观含义

回归系数的矩阵表示

上页逐个理解了 β 的直觉含义。可当 p 个变量进来,每个系数都要重复列表达式,解起来还得联立 p 个偏导方程。能不能『打包』一次搞定?这就要请出线性代数。

模型压成一行
用 y = Xβ + ε 把 n 个观测和 p 个系数一次性写成一个矩阵等式
设计矩阵 X
n 行 × p 列结构,每行是一次观测的 p 个自变量取值,β 是 p×1 向量
法方程组
p 个偏导等于零合并为 XᵀXβ = Xᵀy,一个矩阵等式替代 p 个标量方程
闭合解公式
β̂ = (XᵀX)⁻¹ Xᵀy,一步同时求出所有 p 个系数的最佳估计
存在性条件
XᵀX 必须可逆 ⇔ X 列满秩,要求 n > p 且自变量之间无完全共线性
排队点餐每人单独下单对应 →矩阵形式求所有 β

p 个系数逐个解像每人单独点单;矩阵法把样本和系数列成表格,一次运算同时处理所有 β

y=Xβ+ε,β^=(XTX)1XTyy = X\beta + \varepsilon,\quad \hat\beta = (X^TX)^{-1}X^Ty
6第 6 页 · 回归系数的矩阵表示

回归方程的几何解释

上一页我们用矩阵把回归写得很紧凑。矩阵是抽象的——这一页换双眼睛:把方程"画"出来看。在几何视角下,回归就是在高维点云里拟合一张超平面。

数据是点
每个观测 (x₁,…,xₖ, y) 在 (k+1) 维空间中是一个点
方程是超平面
回归方程对应 k 维超平面,嵌在 (k+1) 维空间里
垂直距离最小
拟合准则:沿 y 轴方向垂直距离的平方和最小
维度递进图景
k=1 是直线,k=2 是平面,k≥3 是无法画出但能推理的超平面
一片倾斜的玻璃板穿过 3D 点云对应 →高维空间中的回归超平面

玻璃板的倾角对应回归系数,点的上下偏移就是残差

i=1n(yiy^i)2=yy^2y^e\sum_{i=1}^{n}(y_i-\hat{y}_i)^2=\|y-\hat{y}\|^2 \quad \hat{y}\perp e
7第 7 页 · 回归方程的几何解释

多元回归六大基本假设概览

上一页从几何看到了 OLS 的优雅——投影意义下最优。但任何解法都有适用前提,多元回归的可靠性依赖 6 个假设同时成立。下面这一组,一一认识它们。

线性与可加性
因变量与自变量呈线性关系,多个自变量效应可直接相加
误差独立
各观测残差之间不存在自相关,时间/空间数据尤需警惕
同方差性
残差方差在不同自变量取值下保持恒定,不随 X 变化
误差正态性
残差服从均值 0 的正态分布,是 t/F 检验和置信区间的前提
无多重共线性
自变量之间不存在高度线性相关,否则系数估计不稳定
做一道菜对应 →回归的六大假设

配比正确(线性可加)、不串味(独立)、火候稳定(同方差)、调味均匀(正态)、食材不重复(无共线性)

εiiidN(0,σ2)\varepsilon_i \stackrel{iid}{\sim} N(0, \sigma^2)
8第 8 页 · 多元回归六大基本假设概览

线性假设与可加性假设

上一页我们列出了六大假设的清单。现在挑前两条最容易被误解的来讲——很多同学以为'线性'就是散点图要画成一条直线,其实远不止这么简单。

线性假设
在固定其他自变量时,因变量Y对每个X的关系是线性的(一条直线)
可加性假设
各X对Y的效应可独立相加,X₁的影响不随X₂变化(无交互)
线性的真正含义
线性是针对参数β而言,不是要求X本身必须原始——X²、log(X)仍可纳入
违反后果
系数估计有偏且不一致,预测系统性偏离真实值,模型整体可信度坍塌
餐厅账单对应 →线性 + 可加性

每道菜定价固定(线性),总账=各菜价格之和(可加),点牛排不会让沙拉涨价(无交互)

E(YX1,,Xp)=β0+β1X1+β2X2++βpXpE(Y \mid X_1, \ldots, X_p) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_p X_p
9第 9 页 · 线性假设与可加性假设

独立性假设与正态性假设

上一页我们约束了 X 与 Y 的关系形态:线性、可加。但模型再漂亮,如果误差项本身出了问题——比如这次的误差记住了上次的——结论照样会崩。这一页看两条直接管住误差项的假设。

误差项独立
Cov(ε_i, ε_j)=0(i≠j),一次观测不影响下一次
误差项同分布
所有 ε_i 均值为 0、方差同为 σ²,方差不随 X 变化
误差项正态
ε_i ~ N(0, σ²),中心极限定理为它兜底
违反后果与诊断
自相关→DW 检验;非正态→Q-Q 图、Shapiro 检验
打靶弹孔分布对应 →独立同分布的正态误差

每发子弹独立瞄准(独立性),弹孔云以靶心为中心、远近呈钟形(同分布正态)

εii.i.dN(0,σ2)\varepsilon_i \overset{i.i.d}{\sim} N(0,\sigma^2)
10第 10 页 · 独立性假设与正态性假设

同方差性假设

误差方差恒定的意义与违背后果

同方差性假设
误差方差恒定的意义与违背后果
11第 11 页 · 同方差性假设

多重共线性问题

前几页讨论的都是因变量 Y 的性质。但真正让系数估计崩盘的,往往不是 Y,而是自变量之间的纠缠——这就是多重共线性。

共线性定义
自变量之间存在较强的线性相关关系
系数估计不稳
数据微扰,系数可能大幅跳变甚至变号
标准误被膨胀
导致 t 检验失效,置信区间异常宽
VIF 指标
方差膨胀因子,>10 视为严重共线性
常见场景
收入与消费、各科成绩等天然相关
两人合力搬桌子对应 →多重共线性

两人总是一起发力(高度相关),合力(整体预测)能算清,但谁的贡献(各自系数)分不清

VIFj=11Rj2VIF_j = \frac{1}{1 - R_j^2}
12第 12 页 · 多重共线性问题

最小二乘法原理回顾

前面我们讲了回归的六大假设,但还有一个根本问题没回答:面对一堆散点,凭什么画这条线而不是那条?最小二乘法就是回答「哪条直线最配这些点」的判据。

残差 eᵢ
观测值 yᵢ 与拟合值 ŷᵢ 之差,反映单点的偏离方向与大小
残差平方和 SSE
把所有点的残差平方后加总,衡量整体拟合好坏
最小二乘原则
找到使 SSE 最小的参数,定义为「最优」回归直线
为何取平方
避免正负抵消;放大偏离;数学上便于求导得闭式解
射击打靶心对应 →最小二乘拟合

多次射击的弹孔离靶心越近越好——最小化所有弹孔到靶心距离的平方和

β^=argminβi=1n(yixiTβ)2\hat{\boldsymbol{\beta}} = \arg\min_{\boldsymbol{\beta}}\sum_{i=1}^{n}(y_i - \mathbf{x}_i^T\boldsymbol{\beta})^2
13第 13 页 · 最小二乘法原理回顾

正规方程与参数求解

上节把最小二乘写成了矩阵语言。现在的问题是:损失函数的最低点在哪?参数 β 取什么值能让残差平方和最小?用微积分把它解出来。

目标函数矩阵式
J(β) = (y-Xβ)ᵀ(y-Xβ) 是残差平方和的紧凑写法
偏导置零
对 β 求梯度并令其为 0 向量:-2Xᵀ(y-Xβ) = 0
正规方程
整理得 XᵀXβ = Xᵀy,参数必须满足这 p 个方程
显式解
XᵀX 可逆时 β̂ = (XᵀX)⁻¹Xᵀy,一步到位
满秩条件
可逆要求 X 列满秩;不可逆就回头看共线性
一元函数求极小点对应 →多元损失函数求极小值

一元只对一个方向求导令=0;多元对每个分量方向都求导令=0

β^=(XX)1Xy\hat{\beta} = (X^\top X)^{-1} X^\top y
14第 14 页 · 正规方程与参数求解

矩阵形式的参数估计

正规方程已经写成 X'Xβ = X'Y,但 β 还裹在矩阵里。怎么把它单独拎出来?思路和解 ax=b 完全一样——两边乘逆。

残差矩阵化
把 n 个残差堆成向量 e=Y-Xβ,RSS 写成 e 转置乘 e
向量求导
对 β 求偏导并令为零,得 X 转置乘(Y-Xβ)=0
正则方程
展开整理:X'Xβ = X'Y,关于 β 的线性方程组
可逆条件
X'X 必须是满秩可逆方阵,等价于 X 列满秩
参数解
两边左乘 (X'X)⁻¹,β 帽 = (X'X)⁻¹X'Y
解方程 ax=b 求 x对应 →矩阵形式求 β

都是「两边乘逆」把未知量隔离出来,只是未知量从数变成向量

β^=(XTX)1XTY\hat{\beta} = (X^TX)^{-1}X^TY
15第 15 页 · 矩阵形式的参数估计

最小二乘估计量的性质

从有限样本到大样本,看三大性质在高维下的成立逻辑。

图解渲染中…
M多元回归下OLS给出的系数估计向量G高斯马尔可夫定理保证OLS为BLUEK大数定律支撑一致性的成立Q高维回归下矩阵可逆的硬性前提
16第 16 页 · 最小二乘估计量的性质

假设检验的整体框架

前面的 OLS 让我们求出了系数,但这只是数字——这些数字到底有没有意义?统计学用「假设检验」来回答。这页拆开多元回归检验的两层结构。

双层结构
模型整体检验 + 单个系数检验,两层各管一段
F 检验
检验模型整体显著性,H₀:所有系数同时为 0
t 检验
检验单个系数显著性,H₀:某个 βⱼ = 0
两层的依赖
F 不显著则 t 检验意义有限;F 显著后再看谁在贡献
体检对应 →F 检验 + t 检验

先全身筛查(F)发现可疑项,再针对单项指标复查(t)

H0:β1=β2==βp=0vsH0:βj=0H_0:\,\beta_1=\beta_2=\cdots=\beta_p=0 \quad\text{vs}\quad H_0:\,\beta_j=0
17第 17 页 · 假设检验的整体框架

回归方程的显著性检验

上页我们搭好了假设检验的四步框架:提假设、构统计量、比临界值、做决策。现在把这套流程套到回归方程整体上——检验所有解释变量联合起来是否真有解释力。

整体联合检验
H₀:β₁=β₂=…=βₖ=0,所有解释变量联合对 y 无线性影响
F 统计量
分子是回归产生的「解释能力」均值,分母是模型未能解释的「噪声」均值
自由度分配
分子自由度 k(变量个数),分母自由度 n-k-1(剩余观测)
决策规则
F > F_α(k, n-k-1) 时拒绝 H₀,认定方程整体显著
与 t 检验的关系
k=1 时 F = t² 严格成立;k≥2 时二者不再等价
体检综合评分对应 →F 检验整体显著性

t 检验逐项看指标是否超标,F 看综合分是否及格——单项正常不代表整体健康

F=SSR/kSSE/(nk1)=MSRMSEF = \dfrac{SSR/k}{SSE/(n-k-1)} = \dfrac{MSR}{MSE}
18第 18 页 · 回归方程的显著性检验

F检验的详细步骤

F检验四步走:从平方和分解到显著性判断,每步数学依据清晰。

1
总平方和分解
把SST拆成SSR(回归解释)与SSE(残差),分清已解释和未解释
2
计算自由度
SSR自由度为k,SSE为n-k-1,决定F分布的具体形态
3
构造F统计量
F=(SSR/k)÷(SSE/(n-k-1)),是两个均方的比值
4
比较P值
F服从F(k,n-k-1)分布,P<α则拒绝原假设,方程整体显著
19第 19 页 · F检验的详细步骤

回归系数的显著性检验

上页 F 检验给了「整个方程是否有用」的结论,但它没回答:里面哪些变量是真出力、哪些只是凑数?这就要逐个拷问偏回归系数,主角换成 t 检验。

检验对象
对每个偏回归系数 βj 单独考察,判断它对 Y 的贡献是否真实存在
假设形式
原假设 H0: βj=0(该变量无贡献);备择假设 H1: βj≠0
t 统计量
等于 βj 的估计值除以其标准误,分子是信号强度、分母是估计噪声
自由度
在 H0 下服从 t(n−k−1) 分布,n 为样本量、k 为自变量个数
判断规则
|t| 超过临界值或 p 值小于 α,拒绝 H0,该系数显著不为零
项目组整体评审后再逐一面谈成员对应 →F 检验显著后再做 t 检验

F 检验答「组里有没有能人」,t 检验追问「具体哪几位真出力」

t=β^jSE(β^j)    t(nk1)t=\frac{\hat{\beta}_j}{SE(\hat{\beta}_j)}\;\sim\;t(n-k-1)
20第 20 页 · 回归系数的显著性检验

t检验与F检验的关系

单个系数检验与整体模型检验的内在联系

t检验与F检验的关系
单个系数检验与整体模型检验的内在联系
21第 21 页 · t检验与F检验的关系

决定系数R²的含义

F 检验通过后,我们知道模型「整体有用」,但还差一步:它到底把因变量解释得多好?这时需要一个衡量「解释力」的指标——决定系数 R²。

R² 的定义
因变量总变异中被模型解释的比例,等于 SSR/SST
变异分解
SST = SSR + SSE,总变异拆成回归解释与残差两部分
取值与解读
R² ∈ [0,1],越接近 1 表示拟合越好
与 r 的关系
简单线性回归时 R² = r²,等于相关系数的平方
R² 的局限
增加自变量 R² 必然不减,因此需要调整 R² 来修正
切蛋糕对应 →R² 的变异分解

整块蛋糕=SST,你吃的=SSR,掉地的=SSE;R²=你吃的/整块

R2=SSRSST=1SSESSTR^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}
22第 22 页 · 决定系数R²的含义

调整R²的必要性与计算

上一节我们看到了R²衡量模型解释力的优雅。但它有个致命缺陷——只要你往模型里塞变量,R²就只会涨不会跌。这就像一份只看总分不看效率的考核表。调整R²正是为了修补这个漏洞。

R²的贪心缺陷
增加自变量时R²必增不减,无关变量也能拉高数值
调整R²的惩罚项
用自由度(n-p-1)对残差平方和进行惩罚,p越大惩罚越重
调整R²的计算公式
1-(1-R²)(n-1)/(n-p-1),n为样本量,p为自变量个数
判断标准的变化
调整R²下降⇒新变量无价值;上升⇒新变量有实质贡献
考试只看总分对应 →R² vs 调整R²

R²如总分,题越多分越高;调整R²按有效得分加权,新题没带来知识就扣分

Rˉ2=1(1R2)(n1)np1\bar{R}^2 = 1 - \frac{(1-R^2)(n-1)}{n-p-1}
23第 23 页 · 调整R²的必要性与计算

R² vs 调整R²对比

两者都衡量拟合优度,但加入无效变量时反应截然相反——不区分会高估模型。

决定系数 R²
  • 定义:解释方差占总方差的比例
  • 加变量后:只升不降
  • 不惩罚变量数量
  • 适合:简单回归或粗评
调整 R²
  • 定义:用自由度修正后的比例
  • 加变量后:有价值才升
  • 每加一变量都要付出代价
  • 适合:多元回归模型选择
多元回归中以调整R²为主,规避过拟合;R²仅在简单回归时更直观。
24第 24 页 · R² vs 调整R²对比

变量选择的意义与挑战

现实里影响房价的因素可能上百个——地段、学区、楼层、噪音……全部塞进模型,R²会接近1,但预测能力可能反而更差。这就是变量选择要面对的两难。

变量过少
遗漏与因变量有关的关键因素,系数估计产生系统性偏差
变量过多
无关噪声被纳入,估计方差增大,模型在新数据上表现恶化
奥卡姆剃刀
解释力相近时,优先选择更简约、变量更少的模型
偏差-方差权衡
选变量的本质,是在遗漏偏差与估计方差之间寻找平衡
侦探筛选线索对应 →回归选择变量

关键证据缺失破不了案(遗漏变量),无关线索全查拖慢调查(噪声干扰),老侦探知道追哪些

E ⁣[(yf^)2]=Bias2(f^)+Var(f^)+σ2E\!\left[(y-\hat{f})^{2}\right]=\mathrm{Bias}^{2}(\hat{f})+\mathrm{Var}(\hat{f})+\sigma^{2}
25第 25 页 · 变量选择的意义与挑战

全子集回归与CP准则

上一节提到变量太多会引发过拟合、共线性等麻烦。那到底该留哪几个?最直接的办法是——把所有组合都试一遍,再用统一标准评判。Mallows 的 Cp 准则就是为此而生的。

全子集回归
k个自变量共2^k−1个非空组合,每个都拟合回归,记录关键统计量
Cp 准则公式
Cp = 残差平方和/σ̂² − n + 2p;σ̂²用全模型的 MSE 估计
理想判读
无偏模型 E(Cp)≈p。Cp ≫ p 提示漏变量,Cp < p−1 则需警惕
Cp 图
横轴 p、纵轴 Cp 画散点,作参考线 Cp=p,贴近直线者即为优选
试菜打分对应 →遍历组合并用 Cp 评选

厨师把所有食材组合都做一遍,评委用 Cp 打分,分数贴近配料数 p 说明搭配合理

Cp=RSSpσ^2n+2pC_p=\dfrac{RSS_p}{\hat{\sigma}^2}-n+2p
26第 26 页 · 全子集回归与CP准则

前向逐步选择法

全子集回归要穷举所有变量组合,变量一多就算不动。前向逐步选择换思路:从一个变量都没有起步,每一步只挑一个最有用的加进来。

起点:空模型
回归方程起初只有截距项,没有自变量,作为迭代的起点
逐步纳入最优
每步在候选变量中挑加入后F统计量最大(或p值最小)的那一个
双阈值控制
设纳入门槛P_enter与剔除门槛P_remove,过了门槛变量才允许进出
贪心搜索
只看当前最优、不回溯;不保证全局最优,但计算量远小于全子集
组建球队逐个签球员对应 →前向逐步纳入变量

每轮在剩余候选人里选当下提升最大的那位,签下就不换

Fenter=(SSEoldSSEnew)/1SSEnew/(nk2)F_{enter}=\frac{(SSE_{old}-SSE_{new})/1}{SSE_{new}/(n-k-2)}
27第 27 页 · 前向逐步选择法

后向逐步剔除法

前向选择从空模型往里加,后向剔除反过来——先把所有候选变量都放进来,再一个一个把不显著的踢出去。

起点是完整模型
把所有候选变量一次性纳入,从最复杂的模型开始
找最不显著变量
在当前模型中找 p 值最大的变量,即对 y 贡献最弱的那一个
踢出去再重算
若最大 p 值超过剔除阈值(如 0.05),删除该变量并重新拟合
循环直到停止
每剔除一个就重做一次 t 检验,直到所有变量都显著
变量数受限
要求样本量 n 大于变量数 p,否则满模型本身就估计不出来
修剪盆栽对应 →后向剔除法

枝叶都长出来后,从最弱最不健康的开始剪,留下健壮的主干

剔除准则:若 maxjpj>αout, 则剔除 xj\text{剔除准则:若 } \max_j p_j > \alpha_{\text{out}},\ \text{则剔除 } x_j
28第 28 页 · 后向逐步剔除法

逐步回归法(双向)

前向法只加不删,后向法只删不加。真实建模中,新加入的变量可能让老变量变冗余——双向逐步回归让两个方向同时动起来。

双向结合
每一步既检查能否加入新变量,也检查已选变量是否该剔除
迭代流程
添加候选→检验已选→再添加→再检验,往复循环
捕捉冗余变化
后引入的变量可能让早选变量失去解释力,双向法能识别剔除
判定准则
常用p值阈值(如0.05入、0.1出)、AIC、BIC等
实践首选
兼顾前向探索与后向精简,是SPSS、R等软件的默认策略
编辑文章边写边改对应 →双向逐步回归

写稿时既补新内容、也删冗余句,每轮同步增减优化

29第 29 页 · 逐步回归法(双向)

三种变量选择方法比较

两种逐步法结构对称但方向相反,混淆会导致选错模型方向

前向逐步选择法
  • 起点:空模型起步,逐步加入显著变量
  • 优点:变量极多时仍可用,可处理 p≥n
  • 缺点:只看单个加入项,嵌套路径易陷局部最优
  • 适用:候选变量池大、样本少
后向逐步剔除法
  • 起点:全模型起步,逐步剔除不显著变量
  • 优点:先看整体再精简,统计意义强
  • 缺点:必须 p<n,否则全模型无法拟合
  • 适用:变量数适中、关注模型整体显著性
p<n 关注整体→后向;p≥n 变量极多→前向;拿不准就双向逐步或全子集
30第 30 页 · 三种变量选择方法比较

残差分析的重要性

假设讲完了,问题来了:怎么知道这些假设在数据里真的成立?答案全在「残差」里——它是模型预测完剩下的部分,像一面镜子,如实反映假设是否被违反。

残差的定义
观测值减去预测值:e_i = y_i − ŷ_i,是模型无法解释的「剩余」
残差承载假设
假设全成立时,残差应是零均值的纯噪声;任何系统性模式都暗示假设被违反
可诊断的维度
线性(同vs拟)、同方差(散度)、正态(Q-Q)、独立性、离群点与高杠杆点
核心诊断图
残差vs拟合值图查线性与同方差;Q-Q图查正态;杠杆图查强影响点
分析的边界
残差图是探索工具,发现疑点后须用形式检验(Breusch-Pagan、White 等)确认
医生读X光片对应 →残差分析诊断假设

X光把身体内部的结构异常显影,残差图把假设违反的结构异常显影——一图同时看多个维度

$e_i = y_i - \hat{y}_i$
31第 31 页 · 残差分析的重要性

残差图的解读

残差图是模型体检报告,从残差散布形态反向推断假设是否成立。

图解渲染中…
B1判断节点:决定后续诊断方向D2WLS即加权最小二乘,专治异方差D4可加入滞后项或改用GLS
32第 32 页 · 残差图的解读

标准化残差与学生化残差

残差图能诊断问题,但原始残差有隐疾:杠杆点处方差天然偏小,直接比较残差大小容易误判。要公平地衡量各点的异常程度,需要把残差'按位置缩放'——这正是标准化残差和学生化残差要解决的问题。

原始残差方差非齐
杠杆值 hᵢᵢ 越大,Var(eᵢ)=σ²(1−hᵢᵢ) 越小;x 越极端的样本,残差天然更小
标准化残差
zᵢ = eᵢ / √(MSE·(1−hᵢᵢ)),消除杠杆带来的方差差异,但 MSE 用到了该观测本身
外部学生化残差
rᵢ = eᵢ / √(MSE₍ᵢ₎·(1−hᵢᵢ)),剔除第 i 点后重估方差,对异常更敏感
适用场景
标准化残差用于残差图诊断;学生化残差精确服从 t(n−p−1),|rᵢ|>3 用于识别离群点
评分时是否把考生本人计入平均分对应 →标准化 vs 外部学生化残差

标准化用全样本 MSE 作分母(含该点),自我稀释异常;学生化先剔除该点重算方差,对异常更敏感

zi=eiMSE(1hii),ri=eiMSE(i)(1hii)z_i=\frac{e_i}{\sqrt{MSE(1-h_{ii})}},\quad r_i=\frac{e_i}{\sqrt{MSE_{(i)}(1-h_{ii})}}
33第 33 页 · 标准化残差与学生化残差

杠杆值与Cook距离

前面我们用残差揪'不服管'的点,但还有一种'安静的危险分子'——残差不大、看似乖巧,却因为 x 值本身偏得离谱,把整条拟合线悄悄往自己那边拽。杠杆值与Cook距离就是用来识别它的。

杠杆值 h_ii
只衡量 x 离 x̄ 的距离,反映'位置偏僻度',不看 y
高杠杆 ≠ 强影响
站得远但顺着趋势走(残差小)→ 拟合线基本不动
Cook距离 D_i
同时揉进杠杆和残差,量化'删点 i 后整条线挪多远'
经验阈值
h_ii > 2(p+1)/n 为高杠杆;D_i > 1 或 D_i > 4/n 为强影响
拔河比赛对应 →杠杆值与Cook距离

杠杆=支点到这人的力臂;Cook距离=把这人撤下后,全队重心被拉动多少

Di=1phii1hii(eis1hii)2D_i=\frac{1}{p}\cdot\frac{h_{ii}}{1-h_{ii}}\cdot\left(\frac{e_i}{s\sqrt{1-h_{ii}}}\right)^2
34第 34 页 · 杠杆值与Cook距离

多元回归的应用场景

残差分析确认模型可靠后,多元回归真正发挥威力——它在观察数据中实现实验做不到的事:同时'控制'多个混杂因素。下面三个场景展现它最常见的应用方向。

混杂因素控制
将可疑混杂变量纳入模型,估计目标暴露因素的'净效应',模拟对照实验
预测建模
多个预测变量联合提升精度,例:房价由面积、地段、房龄共同决定
病因探索
控制混杂后识别危险因素的独立作用,但相关≠因果,需机制佐证
随机对照实验的分组对应 →多元回归的混杂控制

随机化让混杂均匀分布;偏回归系数在观察数据上做同样的'平衡'

β^j=Y^XjXj=固定\hat{\beta}_j = \frac{\partial \hat{Y}}{\partial X_j}\bigg|_{X_{-j}=\text{固定}}
35第 35 页 · 多元回归的应用场景

回归系数解读的注意事项

上一页讲回归系数"像"偏效应,那还停在直觉层。这一页要拆一个更微妙的陷阱:同一组系数,放回原始尺度与放进标准尺度,说的根本不是同一件事。

原始系数 b 的含义
X 每变化 1 个原始单位,Y 平均变化 b 个原始单位;数值受 X、Y 的量纲与数量级直接影响
标准化系数 β 的含义
把 X 和 Y 都标准化为均值0、方差1 后的回归系数,反映 X 对 Y 的相对贡献,可跨变量直接比较
两者的换算公式
β = b · (Sx / Sy),Sx、Sy 为各自标准差;这是连接两个尺度的桥梁
解读时的两个陷阱
b 有业务含义但不可比;β 可比但模型相关——增删变量、变量变换都会让 β 改变排名
两种考试分数比较对应 →原始系数 vs 标准化系数

一个100分制、一个150分制,直接比分数不公平;换算成 Z 分后再比才合理——标准化做的事就是这个

β=bSxSy\beta = b \cdot \frac{S_x}{S_y}
36第 36 页 · 回归系数解读的注意事项

交互作用的考虑

前面讲多元回归时默认各变量效应可加——广告投放的影响是一个常数。但现实中经常不成立:促销越强,广告投放的边际回报反而越高。这种「效应跟着另一变量变」的现象,就是交互作用。

交互作用含义
一个自变量对Y的效应,随另一自变量水平不同而变化
乘积项表达
模型中加入 X1·X2 项,是数学上的标准做法
何时引入
理论预期有协同/拮抗,或残差图呈现规律性弯曲
系数解读变化
X1的系数变成「X2=0时的效应」,不再是固定边际效应
中心化技巧
对X做均值中心化,主效应等于均值处的效应
学习时间×是否请家教对应 →交互作用与乘积项

学习1小时的回报,在有家教时更大;不是简单加和

Y=β0+β1X1+β2X2+β3(X1X2)+εY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 (X_1 \cdot X_2) + \varepsilon
37第 37 页 · 交互作用的考虑

哑变量设置规则

上一页我们讨论了连续变量之间的交互作用。但如果自变量是「季节」「城市」「学历」这种分类变量——没有大小顺序,也不能直接当成数字用——该怎么塞进回归方程?

k类只需k-1个
包含截距项时,k个类别只需k-1个哑变量,否则设计矩阵奇异、完全共线性
参照类的选择
哪一类作基准会改变所有哑变量系数的解读,但不改变R²和预测值
两种主流编码
参考编码=相对参照类的差;效应编码=相对总均值的差,二者只是尺子不同
与连续变量交互
哑变量×连续变量=为每个类别估计各自的回归斜率,即分组斜率
典型陷阱
把k个哑变量全放进去会触发共线性;各类样本量悬殊时估计会极不稳
三选一的选择题对应 →哑变量设置

3个选项只需2个判断题:是A吗?是B吗?若都否,则只能是C——C就是参照类

Y=β0+β1D1+β2D2+ε,Di{0,1}Y = \beta_0 + \beta_1 D_1 + \beta_2 D_2 + \varepsilon,\quad D_i \in \{0,1\}
38第 38 页 · 哑变量设置规则

模型验证方法

内部验证与外部验证的必要性

模型验证方法
内部验证与外部验证的必要性
39第 39 页 · 模型验证方法

医学研究案例:糖尿病影响因素分析

糖尿病风险因素分析的完整工作流,按箭头方向从左读到右。

图解渲染中…
A3处理缺失值、异常值,统一变量编码A5检验线性、正态性、独立性、同方差性A7用逐步回归剔除不显著变量A8残差图、Cook距离诊断强影响点
40第 40 页 · 医学研究案例:糖尿病影响因素分析

案例中的模型检验与诊断

跑完糖尿病案例的回归,还要按这三步检验与诊断,确认模型靠谱。

1
整体F检验
先看所有自变量联合起来能否解释血糖
2
系数t检验
F检验通过后,逐个看哪些变量显著
3
残差诊断图
画残差图、QQ图检验线性、正态、同方差
41第 41 页 · 案例中的模型检验与诊断

章节自测

点击作答

多元回归中,回归方程整体F检验显著,但所有回归系数的t检验均不显著。最可能的原因是?

42第 42 页 · 章节自测

多元线性回归知识图谱

  • 假设是地基:六条假设每条都对应诊断方法
  • 估计-检验-选择构成迭代闭环,不是单向流水线
  • R²高不等于模型好,精简性同样关键
  • 残差诊断不可省略,杠杆与Cook距离决定稳健性
  • 系数解读要看场景:交互项与哑变量重塑其含义
延伸主题:岭回归与Lasso正则化广义线性模型扩展贝叶斯回归视角
43第 43 页 · 多元线性回归知识图谱

课后思考

请先合上书本独立思考,再点开参考答案对照思路。

1为什么加入更多自变量,R²总会上升,而调整R²有时反而下降?

参考答案R²只看拟合优度,机械随变量数增加而上升;调整R²对每新增变量施加惩罚,仅当新变量真正提升预测力时才上升。

2医学研究中怀疑两个因素存在交互作用,模型构建时应如何处理?

参考答案加入两变量的乘积项作为新自变量,用F检验或t检验验证其显著性;若显著,需对变量做中心化以合理解释主效应。

3残差图出现明显曲线趋势,模型一定失败吗?下一步该如何调整?

参考答案不一定是模型失败,但提示线性假设可能不满足;可尝试变量变换、加多项式项,或排查是否遗漏了重要解释变量。

44第 44 页 · 课后思考