正态分布

官方数学老师·11 页·深入(追求细节与边界)·0 次浏览·3 天前
正态分布概率论统计推断中心极限定理

正态分布

搞懂正态分布的密度结构、变换不变性,以及它在中心极限定理里的核心地位

按 空格/→ 演示下一步

1 / 11 页

全部页面点击任意一页,跳回舞台从这页播放

正态分布概率论统计推断中心极限定理

正态分布

搞懂正态分布的密度结构、变换不变性,以及它在中心极限定理里的核心地位

1第 1 页 · 正态分布

利用样本估计正态分布参数

正态分布由均值 μ 和方差 σ² 决定,但现实中我们几乎拿不到全部数据,只能从一小撮样本里去“猜”这两个参数。怎么猜才猜得准?这就是参数估计要做的事。

样本均值 x̄
用样本的算术平均作为总体均值 μ 的点估计
样本方差 s²
除以 n−1 的样本方差,对 σ² 是无偏估计
最大似然估计
让“观测到当前样本的概率最大”的参数取值
自由度 n−1
分母减 1 修正系统低估,因为均值已占用一个自由度
班级平均分猜全校对应 →样本统计量估计总体参数

一个班不代表全校,但样本越大越接近真实均值

xˉ=1ni=1nxi,s2=1n1i=1n(xixˉ)2\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i,\quad s^{2}=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})^{2}
2第 2 页 · 利用样本估计正态分布参数

连续型随机变量

投骰子只能出 1~6;量身高则能取 1.70、1.701、1.7001 等任意精度。这种可无限细分的变量,就是连续型随机变量。

取值连续不可数
在区间内可取任意实数,找不到「下一档」
单点概率恒为零
P(X=x)=0,因为「恰好等于」概率为零
用密度函数刻画
概率密度 f(x) 描述分布形态
面积等于区间概率
P(a≤X≤b) 等于 f(x) 在 [a,b] 下的面积
密度曲线积分为一
负无穷到正无穷下总面积恒等于 1
沙堆的密度对应 →概率密度

问一粒沙无意义,要问一整片沙的「量」;整堆沙量归一为 1

P(aXb)=abf(x)dxP(a \leq X \leq b) = \int_a^b f(x)\,dx
3第 3 页 · 连续型随机变量

正态分布

为什么身高、考试分数、测量误差——这些看起来毫无关联的现象,都呈现'中间高、两端低'的钟形?答案藏在它们共同的成因里。这页我们先把这条曲线本身看清楚。

概率密度函数
对称钟形曲线,由μ和σ两个参数唯一确定
两个参数
μ是位置参数,决定对称中心;σ是尺度参数,决定胖瘦
标准化变换
令Z=(X-μ)/σ,任何正态都化为标准正态N(0,1)
经验法则
约68%/95%/99.7%的值落在±1σ/±2σ/±3σ区间
适用与边界
适合对称单峰、尾部指数衰减;不适用于有界数据、肥尾
工厂批量生产零件对应 →正态分布

μ是目标尺寸,σ是工艺精度。精度越高(σ越小),零件越集中在μ附近,形成中间高两端低的钟形

f(x)=1σ2πexp((xμ)22σ2)f(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)
4第 4 页 · 正态分布

正态密度函数

前面我们聊到正态分布像一口钟形对称的曲线,对连续变量而言,概率不再是某个点的取值,而是某段区间下的面积。今天我们把这口钟背后的数学函数拆开来看。

密度函数表达式
f(x)=1/(σ√(2π))·exp(-(x-μ)²/(2σ²)),定义在全体实数上
两个参数
μ 控制钟的中心位置,σ 控制钟的胖瘦;两者确定,曲线唯一
概率等于面积
[a,b] 内的概率 = 密度曲线在该区间下方的积分面积
关键标志点
峰高 1/(σ√(2π));拐点位于 μ±σ;对称轴 x=μ
地形海拔图对应 →正态密度曲线

海拔高低不等于水量,要看覆盖面积;曲线高度也不是概率,要看区间面积

f(x)=1σ2πexp ⁣((xμ)22σ2)f(x) = \frac{1}{\sigma\sqrt{2\pi}} \exp\!\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)
5第 5 页 · 正态密度函数

标准正态分布

前面见过各种正态分布——均值为170的身高、方差为5的误差。每条钟形曲线都不一样,查概率总不能为每条都造一张表。数学家把所有正态曲线都'翻译'到同一个标准上,问题就解决了。

标准正态 N(0,1)
均值为0、方差为1的正态分布,是整个正态家族的'参照原点'
标准化变换
X~N(μ,σ²) 时 Z=(X-μ)/σ 必为 N(0,1);曲线形状不变,只换坐标
对称性质
曲线关于 z=0 对称,Φ(-z)=1-Φ(z),右侧查表即可
万能概率表
任意正态的概率都先标准化,再查这张唯一的标准正态分布表
典型应用
Z检验、置信区间、异常值判定(|Z|>2 视为罕见)
货币兑换(换算到美元)对应 →标准化变换

不同国家物价不能直接比,先换算到同一货币;不同正态的概率也先标准化再查表

Z=Xμσ,φ(z)=12πez2/2Z = \frac{X - \mu}{\sigma}, \quad \varphi(z) = \frac{1}{\sqrt{2\pi}} e^{-z^2/2}
6第 6 页 · 标准正态分布

正态分布参数 μ 和 σ

标准正态只是一条特殊曲线——中心在 0、宽度固定。现实里每条钟形曲线的「位置」和「胖瘦」各不相同,这就靠 μ 和 σ 两个参数来调控。

μ 均值
位置参数,决定曲线对称轴 x=μ 所在的位置
σ 标准差
尺度参数,控制数据散布;σ 越大曲线越扁宽
取值约束
μ 可为任意实数;σ 必须严格 >0,σ=0 退化为点
独立调节
μ 只平移、σ 只缩放,互不耦合——两个独立旋钮
典型应用
测量误差、产品尺寸、考试分数等「中心+波动」场景
射击打靶对应 →μ 与 σ 的调控

μ 是靶心位置(瞄准往哪打),σ 是散布半径(手稳不稳)

f(x)=1σ2πe(xμ)22σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x-\mu)^2}{2\sigma^2}}
7第 7 页 · 正态分布参数 μ 和 σ

3σ原则

上一页用标准正态分布的 Z 分数衡量偏离。把 z=(x−μ)/σ 放回 X 的尺度,就是看数据离均值几个标准差;长期观察由此形成一组稳定比例。

经验背景
它不是普适定理,而是近似正态数据在长期观察中呈现的覆盖率。
一倍 σ
正态分布下,μ±σ 内约有 68.27% 的概率质量。
两倍 σ
μ±2σ 内约有 95.45%,两端合计约 4.55%。
三倍 σ
μ±3σ 内约有 99.73%,每侧尾部约 0.135%;越界应排查。
非正态边界
均值与方差存在时,切比雪夫不等式保证三σ内至少 8/9。
生产线三道警戒线对应 →1σ、2σ、3σ 区间

越靠外的事件越少见;越出 3σ,越值得检查,但不等于判错。

P(Xμ<kσ)={0.6827,k=10.9545,k=20.9973,k=3P(Xμ<3σ)89P(|X-\mu|<k\sigma)=\begin{cases}0.6827,&k=1\\0.9545,&k=2\\0.9973,&k=3\end{cases}\qquad P(|X-\mu|<3\sigma)\geq\frac{8}{9}
8第 8 页 · 3σ原则

概率密度与概率面积关系

统计老师把钟形曲线下的地面分成窄条,问“60到80分占总体多少”——关键不是某处有多高,而是把这一段所有窄条的面积加起来。

密度是高度
f(x)描述x附近单位宽度的概率集中程度;可大于1,但不是概率
概率是面积
X落在[a,b]的概率,等于密度曲线在该区间与横轴围成的面积
单点没有面积
单点没有宽度,所以P(X=x₀)=0;应讨论包含x₀的小区间
总面积为1
曲线从−∞到+∞的面积恒为1,代表全部结果的总概率
正态区间应用
已知μ、σ和端点a、b,就可计算区间占比,如产品不合格率
宽度变化的纸条对应 →正态分布区间概率

纸条宽度对应该区间,涂色高度对应f(x),色块面积对应该区间概率

P(aXb)=abf(x)dx=Φ ⁣(bμσ)Φ ⁣(aμσ)P(a\le X\le b)=\int_a^b f(x)\,dx=\Phi\!\left(\frac{b-\mu}{\sigma}\right)-\Phi\!\left(\frac{a-\mu}{\sigma}\right)
9第 9 页 · 概率密度与概率面积关系

本节要点

  • 密度函数值≠概率,面积才是概率
  • μ决定位置,σ决定离散程度
  • 标准化后任意正态都化为标准正态
  • 3σ范围内几乎覆盖全部数据
  • 样本均值与方差是μ和σ²的无偏估计
延伸主题:中心极限定理正态性检验对数正态分布
10第 10 页 · 本节要点

课后思考

先独立思考,再对照参考答案。三道题分别检验回顾、应用与迁移能力。

1为什么现实中大量随机现象都呈现钟形分布?仅仅是巧合,还是背后有更深的规律?

参考答案中心极限定理给出答案:大量独立微小随机因素的叠加,无论各自分布如何,总和趋向正态分布。这不是巧合,而是数学规律。

2若总体不是正态分布,样本均值的抽样分布还能用正态分布近似吗?条件是什么?

参考答案可以。中心极限定理保证:无论总体分布如何,独立同分布随机变量的均值随样本量n增大趋近正态,通常n≥30即可近似使用。

3数据有明显的厚尾或偏态时,仍按正态分布建模会带来什么隐患?用什么方法识别?

参考答案厚尾会严重低估极端事件概率(如金融黑天鹅);偏态导致均值与中位数错位,3σ原则失效。识别方法:QQ图、计算偏度与峰度、正态性检验。

11第 11 页 · 课后思考