一元线性回归模型及其应用

官方数学老师·16 页·深入(追求细节与边界)·0 次浏览·3 天前
最小二乘假设检验预测区间适用边界

一元线性回归模型及其应用

看清斜率与截距怎么估、显著性怎么判、未来值怎么预测

按 空格/→ 演示下一步

1 / 16 页

全部页面点击任意一页,跳回舞台从这页播放

最小二乘假设检验预测区间适用边界

一元线性回归模型及其应用

看清斜率与截距怎么估、显著性怎么判、未来值怎么预测

1第 1 页 · 一元线性回归模型及其应用

构建回归模型

上一页我们认识了「一元线性回归」是什么,但要让它真正派上用场,还得动手把模型搭出来。就像拿到一张地图——得把等高线、坐标、比例尺都标上,别人才能照着走。

回归方程形式
因变量 y 与自变量 x 之间用线性关系表达,并附带误差项 ε
参数经济含义
β₀ 是截距,β₁ 是斜率(x 每增一单位 y 的平均变化),ε 是随机扰动
OLS 最小二乘法
通过最小化残差平方和 RSS,估计出 β₀ 和 β₁ 的具体数值
四大基本假设
线性、独立、同方差、正态——任何一条被破坏都可能让结论失真
橡皮筋穿过一排散落的钉子对应 →OLS 拟合回归线

橡皮筋会停在「被拉得最均匀」的位置,等价于让残差平方和最小

y=β0+β1x+εy = \beta_0 + \beta_1 x + \varepsilon
2第 2 页 · 构建回归模型

残差图分析

模型建好了,先别急着下结论。就像体检一样,回归模型也得做一次回访——残差图就是它的体检报告,能看出模型哪里不对劲。

残差定义
残差 = 实际观测值 − 模型预测值,记作 eᵢ,衡量单点的预测偏差
残差图
横轴取拟合值或自变量,纵轴取残差的散点图,是模型诊断的可视化工具
理想形态
残差在 0 附近随机均匀散布,无明显趋势、弯曲或扇形展开
问题诊断
漏斗形 → 异方差;曲线形 → 非线性;离群点 → 异常值或强影响点
射击后看弹孔分布对应 →残差图散点形态

弹孔随机围靶心 = 模型准;朝某方向偏移 = 模型存在系统偏差

ei=yiy^ie_i = y_i - \hat{y}_i
3第 3 页 · 残差图分析

线性相关

上一节用残差图检验模型是否合理,前提是变量间存在'线性相关'。这一页回到基础——什么叫线性相关?方向和强度怎么衡量?只看散点图够不够?

定义
两个变量间的关系能用一条直线近似描述
方向
正相关:一增俱增;负相关:一增一减
强度
用相关系数 r 衡量,|r|≤1,越接近 1 关系越强
判断方法
散点图看形状定方向,相关系数定量强度
边界
相关≠因果,要警惕第三变量(混杂因素)
两人并肩走路对应 →正线性相关

方向相同、步幅越接近→正相关越强;反方向走即负相关

r=i=1n(xixˉ)(yiyˉ)i=1n(xixˉ)2i=1n(yiyˉ)2r = \frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum_{i=1}^{n}(x_i-\bar{x})^2 \cdot \sum_{i=1}^{n}(y_i-\bar{y})^2}}
4第 4 页 · 线性相关

一元线性回归模型

上一页我们用相关系数量化了两变量线性关联的强弱,但「相关」只回答「像不像一条线」,不回答「这条线长什么样」。要把 x 用来预测 y,得真正把这条线画出来——这就轮到回归模型上场。

模型本质
用一条直线刻画 y 随 x 的平均变化,把「相关」落地成可预测的方程
三项构成
y = β₀ + β₁x + ε:系统项描述规律,ε 描述无法解释的随机波动
参数含义
β₁ 斜率:x 每增 1 单位 y 的平均变化量;β₀ 是 x=0 处的均值锚点
与相关的区别
相关是对称度量,回归是 y 对 x 的单向依赖结构,不能互换位置
经典假定 LINE
线性 L、独立 I、等方差 E、正态 N;四条任一破,推断就不再可靠
两人走路步调一致对应 →相关 vs 回归

步调一致是双向默契(相关对称),其中一人跟着另一人走是单向跟随(回归有方向)

y=β0+β1x+ε,εN(0,σ2), cov(εi,εj)=0y = \beta_0 + \beta_1 x + \varepsilon,\quad \varepsilon \sim N(0,\sigma^2),\ \text{cov}(\varepsilon_i,\varepsilon_j)=0
5第 5 页 · 一元线性回归模型

因变量和自变量

你出门带不带伞,取决于天气预报——天气是「原因」,带伞是「结果」。在回归分析里,这种「谁解释谁」的角色分配,就对应因变量和自变量。

因变量(响应变量)
回归模型要预测的目标量,记作 Y,如销售额、身高
自变量(解释变量)
用来解释因变量变化的量,记作 X,如广告投入、年龄
角色由研究目的决定
并非数学固定,同一变量在不同模型里身份可互换
一元回归的限制
自变量恰好 1 个;「线性」指参数线性,不要求 X 本身线性
天气与带伞决策对应 →自变量与因变量

天气先变(自变量)→决定带伞(因变量);预报错了就淋雨(残差)

6第 6 页 · 因变量和自变量

随机误差

随机误差:定义、要点与典型应用

随机误差
随机误差:定义、要点与典型应用
7第 7 页 · 随机误差

最小二乘法

上一页我们看到随机误差让观测点散落在真实直线周围。那手里只有一堆散点,怎么把'最佳直线'找出来?这就要请出最小二乘法——回归里最经典、也最常用的估计方法。

核心思想
让所有观测点到拟合直线的垂直距离平方和最小
残差定义
eᵢ = yᵢ − ŷᵢ,观测值与拟合值之差,刻画单点偏离
目标函数
Q(β₀,β₁)=Σeᵢ²,衡量整条直线对全部点的总偏离
求解结果
对 β₀、β₁ 求偏导令为 0,得到 β̂₁、β̂₀ 的闭式解
适用前提
误差零均值、等方差、不相关(高斯-马尔可夫条件)
调整一根杆子穿过钉子群对应 →最小二乘拟合直线

钉子是数据点,杆子是拟合直线;垂直距离平方和最小,杆子最'居中'最稳

Q=i=1n(yiβ0β1xi)2,β^1=(xixˉ)(yiyˉ)(xixˉ)2,β^0=yˉβ^1xˉQ = \sum_{i=1}^{n}(y_i-\beta_0-\beta_1 x_i)^2, \quad \hat{\beta}_1 = \frac{\sum(x_i-\bar{x})(y_i-\bar{y})}{\sum(x_i-\bar{x})^2}, \quad \hat{\beta}_0 = \bar{y}-\hat{\beta}_1\bar{x}
8第 8 页 · 最小二乘法

经验回归方程

经验回归方程:定义、要点与典型应用

经验回归方程
经验回归方程:定义、要点与典型应用
9第 9 页 · 经验回归方程

残差

上一页我们用最小二乘法求出经验回归方程,但每个数据点「不会」正好落在直线上——这些点和直线之间的纵向距离,今天有个正式名字:残差。

定义与公式
残差 e_i = y_i - ŷ_i,即观测值与拟合值的差
残差 vs 误差
残差是样本量、可知;误差是总体量、不可知;残差是误差的估计
平方和最小
最小二乘法让所有残差平方和 Σe_i² 取最小,这是拟合的判据
符号含义
e_i>0 表示低估实际值,e_i<0 表示高估;绝对值越大偏离越远
打靶弹孔到靶心的距离对应 →残差

靶心=拟合值,弹孔=观测值,距离有方向:偏上为正、偏下为负

ei=yiy^i=yi(b^0+b^1xi)e_i = y_i - \hat{y}_i = y_i - (\hat{b}_0 + \hat{b}_1 x_i)
10第 10 页 · 残差

残差分析

前页用残差图粗看了模型表现,但「残差分析」不止一张图——它是一套诊断工具箱:系统检验线性、等方差、正态性三大假设,并揪出影响模型稳健性的异常观测。

残差定义
e_i = y_i - ŷ_i,观测值与拟合值之差,是一切诊断的起点
线性假设
残差对拟合值散点图不应有曲线或漏斗形,否则说明线性关系可能不成立
等方差假设
残差波动幅度不应随拟合值系统性变化;喇叭口即异方差,需考虑加权回归
正态假设
用 QQ 图看残差分布,若偏离直线过多,区间预测与显著性检验会失真
异常点识别
|r_i| > 2 或 3 的点需排查;区分异常值(y 偏离)与高杠杆点(x 偏离)
汽车异响排查对应 →残差分析

车能跑(拟合直线)不代表没毛病,听异响(残差)才能发现发动机(模型)的隐患

ei=yiy^iri=eis1hiie_i = y_i - \hat{y}_i \quad r_i = \frac{e_i}{s\sqrt{1-h_{ii}}}
11第 11 页 · 残差分析

非线性回归

残差图分析那页我们提到——如果残差不是随机散布,而是有规律地弯曲,就说明直线模型抓不住真实关系。这时候,得换能弯曲的工具。

定义
因变量与自变量之间呈曲线(非直线)关系的回归模型
常见形态
多项式、指数、对数、Logistic、S 形曲线等
参数非线性边界
y=a·e^(bx) 看似简单,但参数非线性,无闭式解
估计方法
多用迭代法(Newton-Raphson、高斯-牛顿)求解
选型依据
看散点图走势,结合领域知识,不能凭感觉拍脑袋
直尺 vs 曲线板/圆规对应 →线性回归 vs 非线性回归

直尺只能画直线,曲线板能拟合弯曲趋势——工具决定形状

y=β0+β1x+β2x2++βkxk+εy = \beta_0 + \beta_1 x + \beta_2 x^2 + \cdots + \beta_k x^k + \varepsilon
12第 12 页 · 非线性回归

对数变换

上次讲非线性回归能拟合任意曲线。但很多所谓的'曲线'其实是一道翻译题——给数据换把尺子,弯的就能变直,根本用不到复杂的迭代算法。

变换定义
对自变量或因变量取对数(底数常为 e 或 10),把数据映射到新尺度
核心作用
把指数、幂函数等非线性关系转化为线性,可直接套用最小二乘
适用场景
散点呈曲线、残差图呈喇叭口(异方差)、数据严重右偏时优先考虑
常见形式
log y~x 对应指数关系;log y~log x 对应幂函数关系
地震里氏震级对应 →对数变换

能量跨好几个数量级;取对数后映射成 1-9 均匀震级,指数级变化在视觉上变成线性

y=abxloglogy=loga+xlogby = a \cdot b^x \xrightarrow{\log} \log y = \log a + x \log b
13第 13 页 · 对数变换

决定系数R²

我们已经用最小二乘法拟合出了一条回归线——但这只是「画出来」了。这条线到底有多靠谱?考试有分数,回归模型也需要一个「得分」来衡量拟合优度。

定义
R²=1-SSE/SST,SSE是残差平方和,SST是总离差平方和,衡量模型解释了多少y的波动
取值范围
一元回归中0≤R²≤1,且R²等于相关系数r的平方,r的正负号在这里被丢掉
解读方式
R²=0.82表示模型解释了82%的因变量变异,剩下18%来自其他因素或随机误差
边界与陷阱
R²高≠因果;样本量过小时R²会虚高;强非线性下R²也可能很高但模型本身错了
考试得分占总分的比例对应 →决定系数R²

SST是试卷满分,SSE是扣掉的分;得满分即模型完美解释y的全部波动

R2=1SSESST=1i=1n(yiy^i)2i=1n(yiyˉ)2R^2 = 1 - \frac{SSE}{SST} = 1 - \frac{\sum_{i=1}^n (y_i - \hat{y}_i)^2}{\sum_{i=1}^n (y_i - \bar{y})^2}
14第 14 页 · 决定系数R²

本节要点

  • 线性回归建模:散点→参数→残差→拟合度
  • 最小二乘最小化残差平方和,求参数
  • R² 与残差图合力判断模型好坏
  • 非线性先对数变换,线性化再回归
  • 误差随机假设破坏,结论则失真
延伸主题:多元线性回归建模策略回归假设检验与置信区间线性回归的预测区间估计
15第 15 页 · 本节要点

课后思考

先自己想,再对照参考答案看思路——重点不是答对,而是想得深。

1最小二乘法的「残差平方和最小」为什么是合理目标?换成最小化绝对值会怎样?

参考答案最小二乘等价于误差正态假设下的最大似然估计。换绝对值对应中位数回归,对异常值更稳健,但求解和统计性质不同。

2研究广告投入对销售额的影响,R²很高但残差图呈U形,你会怎么调整模型?

参考答案U形残差说明线性假设不成立。尝试加二次项、做对数变换或换函数形式重新拟合,看R²和残差图是否改善。

3面对房价这种受面积、地段、楼层多因素影响的问题,一元线性回归为什么不够用?

参考答案单自变量会遗漏关键因素,系数估计产生遗漏变量偏误。需要扩展为多元线性回归,同时控制多个自变量。

16第 16 页 · 课后思考
一元线性回归模型及其应用 · 知识图解