统计学的基础知识

官方工学老师·20 页·深入(追求细节与边界)·0 次浏览·2 天前
核辐射探测统计推断能谱分析置信区间

统计学的基础知识

搞懂每一步统计判断背后的物理意义与数学边界

按 空格/→ 演示下一步

1 / 20 页

全部页面点击任意一页,跳回舞台从这页播放

核辐射探测统计推断能谱分析置信区间

统计学的基础知识

搞懂每一步统计判断背后的物理意义与数学边界

1第 1 页 · 统计学的基础知识

什么是伯努利实验

上页我们谈了统计学的对象——充满不确定性的世界。最简单的不确定性,莫过于「是或否」:这次试验,结果就两个可能。我们就从一个硬币开始,看看这种最朴素的随机试验在数学上是什么样子。

两种互斥结果
每次试验只有「成功」或「失败」两种可能,二者必居其一
概率恒定为 p
成功的概率 p 在每次试验中不变,p∈[0,1]
试验相互独立
前一次的结果不影响后一次的概率分布
单次即成立
伯努利实验指单次试验;多次独立重复构成伯努利过程
抛硬币看正反对应 →伯努利实验

正面=成功、反面=失败,概率固定且互不影响——但硬币只是 p=1/2 的特例

XBernoulli(p),P(X=1)=p,P(X=0)=1pX \sim \text{Bernoulli}(p),\quad P(X=1)=p,\quad P(X=0)=1-p
2第 2 页 · 什么是伯努利实验

伯努利实验的完整结构

用时序图展示单次试验的两结果与概率关系

伯努利实验的完整结构
用时序图展示单次试验的两结果与概率关系
3第 3 页 · 伯努利实验的完整结构

从伯努利实验到二项分布

上页我们把伯努利实验拆成了四要素:单次、二值、稳定p、可重复。现在把「可重复」这一步放大——同样的实验独立做 n 次,数成功次数 X 的规律,就是二项分布。

n 重伯努利试验
每次独立、每次成功概率恒为 p、整体重复 n 次
二项分布 X~B(n,p)
刻画 n 次试验里成功次数 X 的概率分布
概率质量函数
P(X=k)=C(n,k)·p^k·(1-p)^(n-k),k=0…n
数字特征
期望 E(X)=np,方差 D(X)=np(1-p)
适用边界
独立 / 等概率 / 二值结果缺一不可,否则不再是二项分布
连续抛 n 次硬币数正面对应 →n 重伯努利试验

每次投掷独立,正面概率恒为 0.5,正面次数 X 服从 B(n,0.5)

P(X=k)=(nk)pk(1p)nk,k=0,1,,nP(X=k)=\binom{n}{k}p^{k}(1-p)^{n-k},\quad k=0,1,\dots,n
4第 4 页 · 从伯努利实验到二项分布

二项分布的公式推导

用组合计数与独立事件的乘积原理,一步步推出二项分布的公式。

1
定单次结果
每次伯努利实验只分成功与失败,对应概率p与1-p
2
选k次成功
从n次实验中挑出哪k次成功,共C(n,k)种位置选法
3
算序列概率
独立性下,该序列概率等于p^k乘以(1-p)^(n-k)
4
求和得公式
把C(n,k)种序列的概率全部相加,得到二项分布PMF
5第 5 页 · 二项分布的公式推导

二项分布的图像特征

从两个参数 n 和 p 出发,看分布形态怎么变,期望方差怎么算。

图解渲染中…
Ep 与 0.5 比大小决定偏斜方向Dn 越大分布越对称,趋近正态I期望等于 n 乘 pJq=1-p,方差等于 npq
6第 6 页 · 二项分布的图像特征

二项分布在核辐射中的应用

想象一下:把一块放射源贴近探测器,你以为每颗原子核衰变都会被记录下来吗?现实远比这复杂——而这里的随机性,正好由二项分布描述。

衰变 ≠ 探测
原子核是否衰变是物理过程,探测器是否响应是独立的概率事件
探测效率 ε
几何、本征、死时间三类因子乘积,每次响应独立
计数 B(N, ε)
N 次独立衰变里探测到 k 次,概率由二项公式直接给出
均值与方差
E(X)=Nε 是无偏估计,Var(X)=Nε(1−ε) 决定计数涨落
泊松近似边界
N 大且 ε 小时 B(N,ε)→P(λ=Nε);ε 不小时必须保留精确二项
渔网捕鱼对应 →探测器接收粒子

网眼大小固定效率 ε,鱼群规模 N,捞到几条就是二项抽样结果

P(X=k)=(Nk)εk(1ε)Nk,  E(X)=Nε,  Var(X)=Nε(1ε)P(X=k)=\binom{N}{k}\varepsilon^k(1-\varepsilon)^{N-k},\; E(X)=N\varepsilon,\; \mathrm{Var}(X)=N\varepsilon(1-\varepsilon)
7第 7 页 · 二项分布在核辐射中的应用

泊松分布的引入场景

核辐射那页,n 很大、p 极小——直接套二项分布计算很笨重。我们需要一个专门处理『稀有事件计数』的轻量工具。

两大极端条件
n 要足够大(机会很多),p 要足够小(每次几乎不会发生)
只关心计数 k
不追第几次成功,只算指定区间内稀有事件总共出现几次
二项的极限形态
固定 λ=np,让 n→∞、p→0,二项分布收敛为泊松分布
急诊室统计罕见病每日确诊数对应 →泊松分布的稀有事件计数

每日接诊量极大,罕见病发病概率极低,只关心每天确诊几例

λ=np\lambda = np
8第 8 页 · 泊松分布的引入场景

从二项分布到泊松分布的推导

把二项分布塞进极限过程,一步步化简出泊松分布。

1
写出二项公式
从 n 次独立伯努利试验出发,得到 P(X=k)=C(n,k)·p^k·(1-p)^(n-k)
2
设定 p=λ/n
固定 λ 不变,令 p=λ/n,让 n→∞、p→0 同时满足——连接两分布的桥梁
3
代入并展开
把 p=λ/n 代入公式,把 C(n,k)、p^k、(1-p)^(n-k) 各归各位,拆成可取极限的乘积
4
取 n→∞ 极限
利用 (1-λ/n)^n→e^(-λ),以及 n!/(n-k)!·n^(-k)→1,组合项化简为 λ^k/k!
5
得到泊松公式
最终 P(X=k)=(λ^k/k!)·e^(-λ),组合消失、指数登场,泊松分布正式落定
9第 9 页 · 从二项分布到泊松分布的推导

泊松分布的图像与参数λ

从泊松分布这个根节点出发,看λ如何决定图像形态,再看核心性质与辐射应用。

图解渲染中…
C1如λ=1,概率集中在k=0、1附近C2如λ=4,峰值出现在k=λ附近C3如λ≥10,形态趋近正态分布E1Δt为观测时间窗口长度
10第 10 页 · 泊松分布的图像与参数λ

二项分布 vs 泊松分布

n 次试验中 k 次成功的概率,与单位时间事件发生 k 次的概率,常被混用。

二项分布 B(n,p)
  • n 次独立伯努利试验
  • 两个参数:n 与 p
  • 每次只有成功或失败
  • p 固定,n 可大可小
泊松分布 P(λ)
  • 时间或空间上的稀有事件
  • 一个参数:λ = np
  • 事件可发生任意次
  • n→∞ 且 p→0 的极限
n 大且 p 小时泊松近似;否则坚持用二项精确解。
11第 11 页 · 二项分布 vs 泊松分布

高斯分布(正态分布)概述

二项、泊松处理的都是离散事件——「几次」。但身高、温度、测量长度这些连续量,反复测并不会得到同一个数,而是围绕真值散开。这种散开形态,自然界反复出现。

钟形对称曲线
中间高、两边对称衰减,越偏离中心越稀有
两个参数决定形状
μ 决定中心位置,σ 决定宽窄
概率密度而非概率
曲线下面积才是概率,y 轴高度无意义
中心极限定理的产物
大量独立微小因素叠加,结果趋向高斯
尾巴渐近但不归零
偏离 6σ 仍有 ~10⁻⁹ 概率,无硬边界
反复测量同一长度对应 →高斯分布的形态

真值≈μ,误差围绕它对称分布,偏差越大越罕见

f(x)=1σ2πe(xμ)22σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-\mu)^2}{2\sigma^2}}
12第 12 页 · 高斯分布(正态分布)概述

中心极限定理的核心思想

把大量微小独立因素加在一起,无论它们各自原本长什么样,总和都会趋于钟形曲线。

1
独立因素就位
成千上万的随机因素各自独立,谁也不影响谁
2
单个贡献微小
每个因素的影响都很小,没有谁主导总体
3
求和叠在一起
把这些微小贡献全部加起来,得到一个总和
4
n 不断增大
样本量越来越大,独立因素个数持续增长
5
收敛至正态
无论原始分布是什么,总和的形状都趋向钟形
13第 13 页 · 中心极限定理的核心思想

高斯分布的概率密度函数

μ与σ的几何意义、钟形曲线的形成机制

高斯分布的概率密度函数
μ与σ的几何意义、钟形曲线的形成机制
14第 14 页 · 高斯分布的概率密度函数

正态分布 vs 泊松分布

钟形外观易混,但一个数'次数'(离散),一个量'大小'(连续)。

正态分布
  • 连续分布,取值为整个实数轴
  • 两参数:μ定位置,σ²定宽度
  • 描述身高、测量误差等连续量
  • 独立随机变量之和的极限(CLT)
泊松分布
  • 离散分布,取值为非负整数
  • 单参数:λ同时是均值和方差
  • 描述单位时间/空间内事件计数
  • 二项分布n→∞,p→0的极限
稀疏计数→泊松,连续叠加量→正态。别被钟形外观骗了。
15第 15 页 · 正态分布 vs 泊松分布

串级变量的定义

上一节我们看到,独立随机变量相加后会逼近高斯分布。但『多个独立变量相加之后形成的新变量』,其实我们一直在用。现在给它一个正式名字。

正式定义
Y=X₁+X₂+⋯+X_K,各分量 X_i 相互独立
核心前提
独立:联合分布可拆为各分量边缘分布之积
贯穿全章
二项=多个伯努利的串级;CLT 描述 K→∞ 时的极限
多条小河汇成一条大江对应 →独立随机变量串级相加

每条支流水量独立波动,汇成总流量后又有自己的分布

Y=X1+X2++XKY = X_1 + X_2 + \cdots + X_K
16第 16 页 · 串级变量的定义

串级变量的概率分布推导

分布卷积与核辐射探测器信号合成

串级变量的概率分布推导
分布卷积与核辐射探测器信号合成
17第 17 页 · 串级变量的概率分布推导

核心概念自测

点击作答

将两个相互独立的随机变量 X₁ 和 X₂ 进行串级,所得串级变量 Y 的概率分布由什么决定?

18第 18 页 · 核心概念自测

统计学基础总结

  • 稀有事件选泊松,频繁事件选二项,大量叠加归高斯
  • 泊松是二项的极限,高斯又从独立叠加中涌现
  • 串级过程必然展宽谱线,分辨率损失是物理代价
  • 选分布看条件:稀有性、计数规模、独立因素数
延伸主题:拟合优度检验置信区间与误差棒低计数统计修正
19第 19 页 · 统计学基础总结

课后思考

先凭直觉写下你的想法,再对比参考答案——开放问题没有标准答案,重要的是思考路径。

1中心极限定理说,大量独立随机变量之和会趋近正态分布。如果这些变量之间存在一点点相关,结论还成立吗?

参考答案弱相关下 CLT 仍部分成立(Berry-Esseen 等定理给出收敛速度),但若相关过强或分布有重尾,结论可能崩塌。'独立性'假设的边界,是统计建模永恒的话题。

2核辐射计数实验中我们用泊松分布描述粒子到达。如果探测器能精确记录每个粒子的到达时刻,这个模型还适用吗?

参考答案仍然适用,但要升维:泊松过程同时给出「某段时间内的计数」(泊松分布)和「相邻事件的时间间隔」(指数分布),从'有多少'升级到'何时发生'。

3二项分布的每次伯努利试验都要求独立。如果相邻试验存在微弱关联(比如瘟疫在相邻村庄接连爆发),该如何修正这个模型?

参考答案二项分布的根基是独立性。放弃它就要重写联合概率:一种思路是用条件概率——把每一次试验写成'给定前面所有结果'的条件分布,再递推或穷举。

20第 20 页 · 课后思考