多元线性回归分析
搞懂偏回归系数、共线性诊断与模型评价的完整逻辑
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
多元线性回归分析
搞懂偏回归系数、共线性诊断与模型评价的完整逻辑
从简单到多元:为什么需要多元回归
冰淇淋销量越高,溺水死亡越多——难道冰淇淋害死了人?夏天才是真正的元凶:它同时让两者都上升。单看一个变量,规律是被骗出来的。
单调一项照片失真,多参数联合调整才接近真实画面
多元回归的核心思想
上一页我们意识到:一个结果往往受多个因素共同作用。那要怎么把这'多个因素'同时塞进一个方程,让它们彼此配合、互不打架?这就是多元回归要回答的核心问题。
想知道盐对味道影响多大,光尝盐没用;要让糖、火候、时长不变,只动盐——这就是'控制其他变量'的思想
多元线性回归模型的基本形式
前面我们说,多个自变量会"合力"影响因变量。但"合力"究竟长什么样,必须落到方程上才说得清。这一页同时摆出两种方程——一个是"上帝视角"的真相,一个是"手里有数据"的估计。
靶心(β)固定但看不到;弹孔(b)能看见,但每枪都偏一点
回归系数的直观含义
从「所有变量一起变」出发,用「冻结其他变量」的思维,找到 X₁ 对 Y 的纯影响。
回归系数的矩阵表示
上页逐个理解了 β 的直觉含义。可当 p 个变量进来,每个系数都要重复列表达式,解起来还得联立 p 个偏导方程。能不能『打包』一次搞定?这就要请出线性代数。
p 个系数逐个解像每人单独点单;矩阵法把样本和系数列成表格,一次运算同时处理所有 β
回归方程的几何解释
上一页我们用矩阵把回归写得很紧凑。矩阵是抽象的——这一页换双眼睛:把方程"画"出来看。在几何视角下,回归就是在高维点云里拟合一张超平面。
玻璃板的倾角对应回归系数,点的上下偏移就是残差
多元回归六大基本假设概览
上一页从几何看到了 OLS 的优雅——投影意义下最优。但任何解法都有适用前提,多元回归的可靠性依赖 6 个假设同时成立。下面这一组,一一认识它们。
配比正确(线性可加)、不串味(独立)、火候稳定(同方差)、调味均匀(正态)、食材不重复(无共线性)
线性假设与可加性假设
上一页我们列出了六大假设的清单。现在挑前两条最容易被误解的来讲——很多同学以为'线性'就是散点图要画成一条直线,其实远不止这么简单。
每道菜定价固定(线性),总账=各菜价格之和(可加),点牛排不会让沙拉涨价(无交互)
独立性假设与正态性假设
上一页我们约束了 X 与 Y 的关系形态:线性、可加。但模型再漂亮,如果误差项本身出了问题——比如这次的误差记住了上次的——结论照样会崩。这一页看两条直接管住误差项的假设。
每发子弹独立瞄准(独立性),弹孔云以靶心为中心、远近呈钟形(同分布正态)
同方差性假设
误差方差恒定的意义与违背后果
多重共线性问题
前几页讨论的都是因变量 Y 的性质。但真正让系数估计崩盘的,往往不是 Y,而是自变量之间的纠缠——这就是多重共线性。
两人总是一起发力(高度相关),合力(整体预测)能算清,但谁的贡献(各自系数)分不清
最小二乘法原理回顾
前面我们讲了回归的六大假设,但还有一个根本问题没回答:面对一堆散点,凭什么画这条线而不是那条?最小二乘法就是回答「哪条直线最配这些点」的判据。
多次射击的弹孔离靶心越近越好——最小化所有弹孔到靶心距离的平方和
正规方程与参数求解
上节把最小二乘写成了矩阵语言。现在的问题是:损失函数的最低点在哪?参数 β 取什么值能让残差平方和最小?用微积分把它解出来。
一元只对一个方向求导令=0;多元对每个分量方向都求导令=0
矩阵形式的参数估计
正规方程已经写成 X'Xβ = X'Y,但 β 还裹在矩阵里。怎么把它单独拎出来?思路和解 ax=b 完全一样——两边乘逆。
都是「两边乘逆」把未知量隔离出来,只是未知量从数变成向量
最小二乘估计量的性质
从有限样本到大样本,看三大性质在高维下的成立逻辑。
假设检验的整体框架
前面的 OLS 让我们求出了系数,但这只是数字——这些数字到底有没有意义?统计学用「假设检验」来回答。这页拆开多元回归检验的两层结构。
先全身筛查(F)发现可疑项,再针对单项指标复查(t)
回归方程的显著性检验
上页我们搭好了假设检验的四步框架:提假设、构统计量、比临界值、做决策。现在把这套流程套到回归方程整体上——检验所有解释变量联合起来是否真有解释力。
t 检验逐项看指标是否超标,F 看综合分是否及格——单项正常不代表整体健康
F检验的详细步骤
F检验四步走:从平方和分解到显著性判断,每步数学依据清晰。
回归系数的显著性检验
上页 F 检验给了「整个方程是否有用」的结论,但它没回答:里面哪些变量是真出力、哪些只是凑数?这就要逐个拷问偏回归系数,主角换成 t 检验。
F 检验答「组里有没有能人」,t 检验追问「具体哪几位真出力」
t检验与F检验的关系
单个系数检验与整体模型检验的内在联系
决定系数R²的含义
F 检验通过后,我们知道模型「整体有用」,但还差一步:它到底把因变量解释得多好?这时需要一个衡量「解释力」的指标——决定系数 R²。
整块蛋糕=SST,你吃的=SSR,掉地的=SSE;R²=你吃的/整块
调整R²的必要性与计算
上一节我们看到了R²衡量模型解释力的优雅。但它有个致命缺陷——只要你往模型里塞变量,R²就只会涨不会跌。这就像一份只看总分不看效率的考核表。调整R²正是为了修补这个漏洞。
R²如总分,题越多分越高;调整R²按有效得分加权,新题没带来知识就扣分
R² vs 调整R²对比
两者都衡量拟合优度,但加入无效变量时反应截然相反——不区分会高估模型。
- 定义:解释方差占总方差的比例
- 加变量后:只升不降
- 不惩罚变量数量
- 适合:简单回归或粗评
- 定义:用自由度修正后的比例
- 加变量后:有价值才升
- 每加一变量都要付出代价
- 适合:多元回归模型选择
变量选择的意义与挑战
现实里影响房价的因素可能上百个——地段、学区、楼层、噪音……全部塞进模型,R²会接近1,但预测能力可能反而更差。这就是变量选择要面对的两难。
关键证据缺失破不了案(遗漏变量),无关线索全查拖慢调查(噪声干扰),老侦探知道追哪些
全子集回归与CP准则
上一节提到变量太多会引发过拟合、共线性等麻烦。那到底该留哪几个?最直接的办法是——把所有组合都试一遍,再用统一标准评判。Mallows 的 Cp 准则就是为此而生的。
厨师把所有食材组合都做一遍,评委用 Cp 打分,分数贴近配料数 p 说明搭配合理
前向逐步选择法
全子集回归要穷举所有变量组合,变量一多就算不动。前向逐步选择换思路:从一个变量都没有起步,每一步只挑一个最有用的加进来。
每轮在剩余候选人里选当下提升最大的那位,签下就不换
后向逐步剔除法
前向选择从空模型往里加,后向剔除反过来——先把所有候选变量都放进来,再一个一个把不显著的踢出去。
枝叶都长出来后,从最弱最不健康的开始剪,留下健壮的主干
逐步回归法(双向)
前向法只加不删,后向法只删不加。真实建模中,新加入的变量可能让老变量变冗余——双向逐步回归让两个方向同时动起来。
写稿时既补新内容、也删冗余句,每轮同步增减优化
三种变量选择方法比较
两种逐步法结构对称但方向相反,混淆会导致选错模型方向
- 起点:空模型起步,逐步加入显著变量
- 优点:变量极多时仍可用,可处理 p≥n
- 缺点:只看单个加入项,嵌套路径易陷局部最优
- 适用:候选变量池大、样本少
- 起点:全模型起步,逐步剔除不显著变量
- 优点:先看整体再精简,统计意义强
- 缺点:必须 p<n,否则全模型无法拟合
- 适用:变量数适中、关注模型整体显著性
残差分析的重要性
假设讲完了,问题来了:怎么知道这些假设在数据里真的成立?答案全在「残差」里——它是模型预测完剩下的部分,像一面镜子,如实反映假设是否被违反。
X光把身体内部的结构异常显影,残差图把假设违反的结构异常显影——一图同时看多个维度
残差图的解读
残差图是模型体检报告,从残差散布形态反向推断假设是否成立。
标准化残差与学生化残差
残差图能诊断问题,但原始残差有隐疾:杠杆点处方差天然偏小,直接比较残差大小容易误判。要公平地衡量各点的异常程度,需要把残差'按位置缩放'——这正是标准化残差和学生化残差要解决的问题。
标准化用全样本 MSE 作分母(含该点),自我稀释异常;学生化先剔除该点重算方差,对异常更敏感
杠杆值与Cook距离
前面我们用残差揪'不服管'的点,但还有一种'安静的危险分子'——残差不大、看似乖巧,却因为 x 值本身偏得离谱,把整条拟合线悄悄往自己那边拽。杠杆值与Cook距离就是用来识别它的。
杠杆=支点到这人的力臂;Cook距离=把这人撤下后,全队重心被拉动多少
多元回归的应用场景
残差分析确认模型可靠后,多元回归真正发挥威力——它在观察数据中实现实验做不到的事:同时'控制'多个混杂因素。下面三个场景展现它最常见的应用方向。
随机化让混杂均匀分布;偏回归系数在观察数据上做同样的'平衡'
回归系数解读的注意事项
上一页讲回归系数"像"偏效应,那还停在直觉层。这一页要拆一个更微妙的陷阱:同一组系数,放回原始尺度与放进标准尺度,说的根本不是同一件事。
一个100分制、一个150分制,直接比分数不公平;换算成 Z 分后再比才合理——标准化做的事就是这个
交互作用的考虑
前面讲多元回归时默认各变量效应可加——广告投放的影响是一个常数。但现实中经常不成立:促销越强,广告投放的边际回报反而越高。这种「效应跟着另一变量变」的现象,就是交互作用。
学习1小时的回报,在有家教时更大;不是简单加和
哑变量设置规则
上一页我们讨论了连续变量之间的交互作用。但如果自变量是「季节」「城市」「学历」这种分类变量——没有大小顺序,也不能直接当成数字用——该怎么塞进回归方程?
3个选项只需2个判断题:是A吗?是B吗?若都否,则只能是C——C就是参照类
模型验证方法
内部验证与外部验证的必要性
医学研究案例:糖尿病影响因素分析
糖尿病风险因素分析的完整工作流,按箭头方向从左读到右。
案例中的模型检验与诊断
跑完糖尿病案例的回归,还要按这三步检验与诊断,确认模型靠谱。
章节自测
多元回归中,回归方程整体F检验显著,但所有回归系数的t检验均不显著。最可能的原因是?
多元线性回归知识图谱
- ✓假设是地基:六条假设每条都对应诊断方法
- ✓估计-检验-选择构成迭代闭环,不是单向流水线
- ✓R²高不等于模型好,精简性同样关键
- ✓残差诊断不可省略,杠杆与Cook距离决定稳健性
- ✓系数解读要看场景:交互项与哑变量重塑其含义
课后思考
请先合上书本独立思考,再点开参考答案对照思路。
参考答案R²只看拟合优度,机械随变量数增加而上升;调整R²对每新增变量施加惩罚,仅当新变量真正提升预测力时才上升。
参考答案加入两变量的乘积项作为新自变量,用F检验或t检验验证其显著性;若显著,需对变量做中心化以合理解释主效应。
参考答案不一定是模型失败,但提示线性假设可能不满足;可尝试变量变换、加多项式项,或排查是否遗漏了重要解释变量。