二项分布与超几何分布

官方数学老师·11 页·深入(追求细节与边界)·0 次浏览·3 天前
抽样机制方差修正极限收敛

二项分布与超几何分布

搞清有放回与无放回的本质差异,看懂方差修正与极限收敛的完整图景

按 空格/→ 演示下一步

1 / 11 页

全部页面点击任意一页,跳回舞台从这页播放

抽样机制方差修正极限收敛

二项分布与超几何分布

搞清有放回与无放回的本质差异,看懂方差修正与极限收敛的完整图景

1第 1 页 · 二项分布与超几何分布

建立二项分布模型

工厂产线稳定,次品率固定为 2%。质检员每抽 1 件产品判合格或不合格,这便是单次伯努利试验。连续抽 20 件,次品数 X 该用什么分布描述?

伯努利试验
单次试验仅有两个互斥结果:成功或失败
n 次独立重复
每次抽样互不影响,结果不传递
成功概率 p 不变
每次判为'成功'的概率恒定,0<p<1
记号 X ~ B(n, p)
三条件齐备,X 服从参数为 n、p 的二项分布
工厂逐件抽检对应 →二项分布建模

每件产品就是一次伯努利试验,合格/不合格对应失败/成功

P(X=k)=(nk)pk(1p)nk,k=0,1,,nP(X=k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k=0,1,\dots,n
2第 2 页 · 建立二项分布模型

建立超几何分布模型

上一节我们用二项分布处理「放回抽样」的问题。但现实里很多场景样本抽走就回不来了——质检中产品被抽走就报废,摸奖时彩票不会塞回去。这正是超几何分布要解决的问题。

不放回抽样
每次抽到的样本不再放回,下一次从剩余中取
有限总体
总体大小 N 已知且有限,不能当成无穷
抽样依赖
各次抽取相互影响,每次成功概率都在变
三个核心参数
N(总体)、K(其中成功数)、n(抽取数)
组合计数
用 C(N,n) 种抽取方式中恰好含 k 个成功的比例
从一副扑克里抽 5 张对应 →超几何分布

每抽走一张,剩余牌的花色构成就变,下一张抽到指定花色的概率跟着变

P(X=k)=(Kk)(NKnk)(Nn)P(X=k) = \dfrac{\binom{K}{k}\binom{N-K}{n-k}}{\binom{N}{n}}
3第 3 页 · 建立超几何分布模型

伯努利试验

前几页讲的都是怎么用二项分布、超几何分布建模型,这一页回到这些模型的起点——伯努利试验。把它当作所有二项/超几何分布共享的「原子」,看清它的三条硬约束。

双重结果
每次试验只有「成功」或「失败」两种互斥结果
概率恒定
每次成功的概率 p 保持不变,失败概率为 1-p
相互独立
任一次试验的结果都不影响其他次
可重复条件
在相同环境下可以反复进行同一试验
工厂流水线质检对应 →伯努利试验

每个产品只有合格/不合格;同产线标准不变 p;一个产品不影响另一个

P(X=1)=p,    P(X=0)=1pP(X=1)=p,\;\;P(X=0)=1-p
4第 4 页 · 伯努利试验

n重伯努利试验

上一页我们讲了「一次伯努利试验」:单次、两种结果、概率p稳定。如果把这样一次试验独立地重复n次,就得到n重伯努利试验——它是二项分布的直接来源。

n次独立重复
把同一个伯努利试验在相同条件下独立做n遍
每次两结果
每次仍是「成功/失败」二选一,结构与单次一致
概率p不变
每次成功的概率都是同一个p,不随次数而变
指向二项分布
n次中成功次数k就服从二项分布B(n,p)
流水线有放回抽检对应 →n重伯努利试验

源源不断的产线上抽n件,每件次品率p稳定且互不影响

X=X1+X2++Xn,XiiidB(1,p)X = X_1 + X_2 + \cdots + X_n,\quad X_i \overset{iid}{\sim} B(1,p)
5第 5 页 · n重伯努利试验

二项分布

从n重伯努利试验出发——我们已经知道每次试验独立、只分两种结果。现在追问:n次试验里「成功」出现了几次?这个随机变量就服从二项分布。

定义与记号
成功次数X的分布,记作X~B(n,p),由n与p两参数确定
三个前提
独立重复、仅两结果、成功概率p始终不变
取值范围
k=0,1,...,n,共n+1种可能取值
期望与方差
E(X)=np,Var(X)=np(1-p)
抛硬币n次对应 →二项分布

正面=成功,反面=失败;数正面出现次数就是X的取值

P(X=k)=(nk)pk(1p)nk,k=0,1,,nP(X=k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k=0,1,\ldots,n
6第 6 页 · 二项分布

二项分布的均值与方差

你已经知道二项分布 B(n,p) 描述 n 次独立伯努利试验的成功次数。单次试验的均值是 p、方差是 p(1-p),把它们累加起来会得到什么?

均值
E(X) = np,等于次数 n 乘以单次成功概率 p
方差
D(X) = np(1-p),独立试验的方差可直接累加
标准差
σ = √(np(1-p)),刻画 X 偏离均值的幅度
边界情形
p=0 或 p=1 时方差为 0,结果退化为必然事件
典型应用
抽样检验区间估计、保险精算、A/B 测试样本量计算
按天计件打零工,每天独立对应 →独立随机变量求和

每天收入独立,n 天总收入均值 = n·日均,方差也按天数累加

E(X)=np,D(X)=np(1p),σ=np(1p)E(X) = np,\quad D(X) = np(1-p),\quad \sigma = \sqrt{np(1-p)}
7第 7 页 · 二项分布的均值与方差

超几何分布

二项分布建立在 n 重独立伯努利试验上——也就是「有放回」地抽。但现实质检里,我们往往一次性从一批产品中抽若干件,抽完不放回。这时各次试验不再独立,就要换工具:超几何分布。

模型设定
从 N 件产品中抽 n 件,不放回,X 为其中次品数
概率公式
C(K,k)·C(N-K,n-k) / C(N,n),不放回导致不能直接乘概率
与二项的差异
不放回 → 抽样不独立;总体有限 → 每次概率都在变化
近似条件
当 n/N 很小(通常 < 5%)时,超几何 ≈ 二项
典型应用
批量质检、扑克摸牌、生态调查中的不放回抽样
玩扑克摸牌对应 →超几何分布

牌堆有限,摸出一张后剩下的牌变少,每张牌被摸到的概率都在动态变化

P(X=k)=(Kk)(NKnk)(Nn)P(X=k)=\dfrac{\binom{K}{k}\binom{N-K}{n-k}}{\binom{N}{n}}
8第 8 页 · 超几何分布

超几何分布的均值

上页我们建立了超几何分布:从 N 件产品里无放回抽 n 件,数其中红球数 X。这个 X 平均是多少?怎样推导出来的?

均值公式
E(X) = nK/N,N 总体、K 红球、n 抽样量
指示变量推导
X = ΣXi(Xi=1 表示第 i 件是红球),E(Xi)=K/N,故 E(X)=nK/N
比例守恒直觉
红球占总体 K/N,随机抽 n 个,期望抽到 n·(K/N) 个
二项均值的极限
n/N → 0 时不放回≈放回,E(X) → np,超几何趋近二项
典型应用
批量质检:从 N 件产品抽 n 件,估计次品数期望
袋里抓一把糖对应 →超几何均值 nK/N

10 颗红糖混在 30 颗里,抓 6 颗约 6×(10/30)=2 颗红糖

E(X)=nKNE(X) = n \cdot \frac{K}{N}
9第 9 页 · 超几何分布的均值

本节要点

  • 有放回取样用二项,无放回归超几何
  • 均值均与成功概率及试验次数成正比
  • 总体N远大于n时,超几何逼近二项
  • 超几何方差多修正因子(N-n)/(N-1)
  • 判断流程:看抽样方式→选模型→套公式
延伸主题:泊松分布:二项分布的极限几何分布与负二项分布有限总体抽样的实际应用
10第 10 页 · 本节要点

课后思考

三个问题分别落在核心回顾、应用拓展、边界思考。建议先独立想,再对照参考答案。

1二项分布假设每次试验独立且成功概率恒定——'不放回抽样'破坏的究竟是哪一个?为什么?

参考答案破坏的是'概率恒定'。不放回时每次抽中指定类的概率是条件概率,依赖前几次抽取结果。

2若抽样规则是'抽到第 k 个不合格品就停止'——样本量不固定了,二项和超几何还适用吗?

参考答案不适用。这是负二项分布的领地:试验次数随机,关心第 k 次成功何时出现。

3总体 N 很大、样本 n 很小时,超几何趋近谁?这种近似的直觉和数学边界分别是什么?

参考答案趋近二项。直觉是总体太大,几乎抽不到同一个体;数学上 n/N→0 时严格成立。

11第 11 页 · 课后思考