几种离散型变量的分布及其应用

官方医学老师·25 页·深入(追求细节与边界)·0 次浏览·2 天前
离散分布二项分布泊松分布概率建模

几种离散型变量的分布及其应用

搞懂二项与泊松分布的构造、场景与适用边界

按 空格/→ 演示下一步

1 / 25 页

全部页面点击任意一页,跳回舞台从这页播放

离散分布二项分布泊松分布概率建模

几种离散型变量的分布及其应用

搞懂二项与泊松分布的构造、场景与适用边界

1第 1 页 · 几种离散型变量的分布及其应用

二项分布从何而来

上页列了几种离散分布,二项是出场率最高的一个。它的源头很朴素:把同一件'非此即彼'的事反复做n次——罚球、抛硬币、产品抽检都符合。但什么样的'重复'才算数?这才是关键。

试验次数n固定
预先确定做几次,不是做到停
每次结果二元
只有成功或失败,没有第三种
各次试验独立
上一次结果不改变下一次概率
成功概率p不变
每次成功的概率都是同一个常数
反复抛同一枚均匀硬币对应 →n次独立重复试验

每次互不影响,正面概率恒为1/2,是最经典的二项场景

2第 2 页 · 二项分布从何而来

二项分布的构成要素

从中心向外辐射,先抓三块构件(n、p、X),再看清每块的约束。

图解渲染中…
X属于BnpX服从参数n、p的二项分布,记为B(n,p)。概率公式P(X=k)=C(n,k)p^k(1-p)^(n-k),下页展开。单次二值结果每次试验只有成功或失败两种结局。每次独立各次试验结果互不影响。
3第 3 页 · 二项分布的构成要素

二项分布的概率公式

上一页我们把二项分布拆成三个要素:固定 n 次试验、每次成功率 p、只关心成功次数 k。现在把它们组装起来,就能写出「恰好成功 k 次」的精确概率。

C(n,k) 是组合数
从 n 次试验中挑出 k 次作为「成功」,共有多少种不同的挑法
特定排列的概率
指定某 k 次成功、其余 n-k 次失败这一种安排的发生概率
相乘的逻辑
C(n,k) 种成功位置互不相交(概率可加),每种位置内各次试验独立(概率可乘)
公式的适用前提
n 次试验相互独立、每次成功概率恒为 p、只有成功/失败两种结果
n 个独立射击点要命中 k 个对应 →P(X=k) 公式的两步拆解

先数 C(n,k) 种命中位置组合,再乘每种组合恰好发生的概率

P(X=k)=(nk)pk(1p)nkP(X=k) = \binom{n}{k} p^k (1-p)^{n-k}
4第 4 页 · 二项分布的概率公式

二项分布的特征可视化

固定一个参数、调另一个参数,看形状怎么变。两条主线:变p看偏度,变n看钟形化。

图解渲染中…
B1p小时多数试验失败,分布堆在左侧B2p=0.5时分布完全对称B3p大时多数成功,对称地偏向右侧C3n→∞时由中心极限定理趋近正态
5第 5 页 · 二项分布的特征可视化

二项分布的期望E(X)

上一页的分布图告诉我们 X 取什么值、各自概率多大。但还有个问题没答:它'大概'落在哪儿?这就要请出期望 E(X)。

期望公式
E(X) = np,仅由试验次数 n 与单次成功概率 p 决定
推导关键
用恒等式 k·C(n,k) = n·C(n-1,k-1),把 k 从求和号里提出
实际意义
长期重复试验时 X 的'重心'位置,围绕 np 上下波动
边界提醒
期望是平均,不是'必取值'——np 处概率可能为 0
种一片林子,预估成活数对应 →二项分布期望 np

成活率 × 总棵树,不必逐棵去数

E(X)=k=0nk(nk)pk(1p)nk=npE(X) = \sum_{k=0}^{n} k \binom{n}{k} p^{k}(1-p)^{n-k} = np
6第 6 页 · 二项分布的期望E(X)

二项分布的方差Var(X)

方差的推导与离散程度

二项分布的方差Var(X)
方差的推导与离散程度
7第 7 页 · 二项分布的方差Var(X)

期望与方差的关系图解

np与np(1-p)的几何意义

期望与方差的关系图解
np与np(1-p)的几何意义
8第 8 页 · 期望与方差的关系图解

为什么需要区间估计

点估计的局限与区间估计的优势

为什么需要区间估计
点估计的局限与区间估计的优势
9第 9 页 · 为什么需要区间估计

总体率区间估计的步骤

从一次抽样到给出总体率的可信区间,标准做法分六步,每步都有它存在的理由。

1
明确问题与置信水平
确定要估计的总体率 p,选定置信水平 1-α(常取 95%)
2
随机抽样并计数
抽取样本量 n,记录其中"成功"的次数 X
3
计算样本率
p̂ = X/n,作为总体率 p 的点估计
4
检验正态近似条件
np̂≥5 且 n(1-p̂)≥5,否则正态近似失效
5
计算标准误
SE = √(p̂(1-p̂)/n),刻画 p̂ 的抽样波动
6
构造置信区间
p̂ ± z_{α/2}·SE,给出 p 的可信范围
10第 10 页 · 总体率区间估计的步骤

置信区间的公式推导

上一页我们按五步走完得到区间,但边界数字是怎么算出来的?今天补上这一步。重点回答两个「为什么」:为什么上下界是 ±Zα/2,为什么标准误 SE 里是 p̂ 而不是 p。

正态近似成立
由 CLT,样本量足够大时样本比例 p̂ 近似服从 N(p, p(1-p)/n)
构造标准正态量
将 p̂ 减 p、除以其标准差,所得 Z 统计量近似服从 N(0,1)
写出概率等式
P(|Z| < Zα/2) = 1-α,描述 p̂ 落在真值附近的频率
解出 p 的区间
反向求解不等式,p 落在 p̂ ± Zα/2·SE 之间
用 p̂ 替 p
总体率 p 未知,SE 中的 p 用样本率 p̂ 代替(大样本近似代价)
蒙眼猜方向对应 →样本率估总体率

多次蒙眼指方向,落点围绕真值正态散布;取 95% 范围作置信区间,Zα/2 是落点到中心的距离尺

P ⁣(p^p<Zα/2p(1p)n)=1αP\!\left(|\hat p-p|<Z_{\alpha/2}\sqrt{\frac{p(1-p)}{n}}\right)=1-\alpha
11第 11 页 · 置信区间的公式推导

大样本与小样本估计差异

区间估计该用精确公式还是近似公式?边界条件常被忽略,结果可能严重失真。

精确法(小样本)
  • 直接基于二项分布累积概率
  • 适用:np<5 或 n(1-p)<5
  • 计算繁琐,依赖软件
  • 结果精确,无近似误差
正态近似法(大样本)
  • 用正态分布近似替代
  • 适用:np≥5 且 n(1-p)≥5
  • 公式简洁,可查Z表
  • n越大越准,p极小时失真
金标准:np 与 n(1-p) 同时≥5 才用近似法;否则必须用精确法,不能只看 n 的大小。
12第 12 页 · 大样本与小样本估计差异

假设检验的基本思想

区间估计回答'参数大概是多少',但很多问题真正想问的是另一个——'参数是否等于某个值?'。从'估计'走向'判断',就进入了假设检验的世界。

原假设 H0
默认的'无差异/无效'状态,是需要被证据反驳的保守命题
备择假设 H1
与H0对立的命题,代表研究者真正希望证实的方向
检验方向
关心'是否有差异'选双侧;关心'是否更大/更小'选单侧
法庭审判对应 →假设检验

H0如'无罪推定',证据足够强才能'定罪'(拒绝H0);H1是检方主张

H0:θ=θ0 vs H1:θθ0(双侧);H1:θ>θ0 或 θ<θ0(单侧)H_0:\theta=\theta_0\text{ vs }H_1:\theta\neq\theta_0\text{(双侧)}; H_1:\theta>\theta_0\text{ 或 }\theta<\theta_0\text{(单侧)}
13第 13 页 · 假设检验的基本思想

率的两侧检验流程

两侧检验分五步走,从立假设到下结论,每一步都是下一步的前提。

1
建立假设
H0: p=p0,H1: p≠p0,先把靶子立好
2
定显著性水平
通常 α=0.05,画一条犯错的容忍红线
3
算检验统计量
z = (p̂−p0)/√(p0(1−p0)/n),大样本近似
4
找拒绝域
|z|>z_{α/2} 时拒绝 H0,左右对称各占 α/2
5
下结论
落拒绝域则拒绝 H0,否则不拒绝
14第 14 页 · 率的两侧检验流程

率的单侧检验流程

单侧检验只盯一个方向的偏离,临界值和拒绝域都得往一侧偏。

1
立假设定方向
明确H₁是p>p₀还是p<p₀,把目光锁定在单侧
2
查单侧临界值
拒绝域只在分布一侧,所以用u_α而非u_(α/2)
3
算检验统计量
公式不变:u=(p̂-p₀)/√(p₀(1-p₀)/n)
4
比对落入拒绝域
只与单侧临界值比较,方向不匹配直接不拒绝
5
下专业结论
拒绝则方向必与H₁一致,措辞要带方向词
15第 15 页 · 率的单侧检验流程

检验中的两类错误

决策树:上为现实状态(H0 成不成立),中为统计决策(拒绝/接受),下为四类结果。

图解渲染中…
C1弃真:H0 成立却拒绝C4取伪:H0 不成立却接受C3检验功效:正确拒绝 H0 的能力C2置信度:正确接受 H0 的概率
16第 16 页 · 检验中的两类错误

泊松分布的生活原型

二项分布有n次试验、成功概率p。但现实中更常问:某段时间内某稀有事件发生了多少次。奶茶店一小时来几位顾客、路口一天几次事故——这种稀有事件计数问题二项分布算不动,需要泊松分布。

稀有事件
单次发生概率极小,但样本空间很大
独立发生
一次事件不影响另一次是否发生
固定区间
观察的时间段或空间区域是确定的
平均率λ
区间内平均发生次数稳定,是分布核心参数
奶茶店1小时来客数对应 →泊松分布

每位顾客到访=稀有事件是否发生;平均每小时λ位=分布参数λ

P(X=k)=λkeλk!P(X=k) = \dfrac{\lambda^k e^{-\lambda}}{k!}
17第 17 页 · 泊松分布的生活原型

泊松分布的推导过程

沿主链固定 k,再令 n 增大、p 减小且 np 固定为 λ;分看两项因子的极限。

图解渲染中…
a1q=1-p,表示 n 次试验中恰有 k 次成功。a4λ 为固定常数,np 在极限中保持有限。a6固定 k 时,修正项 (1-p)⁻ᵏ 趋于 1。a9所得即泊松分布的概率质量函数。
18第 18 页 · 泊松分布的推导过程

泊松分布的概率公式

前页把固定窗口内的事件看成彼此独立、稳定的随机到达;现在把“平均发生次数 λ”和“恰好出现 k 次”对上号,逐项读懂概率公式。

平均次数 λ
固定窗口内 X 的期望;λ>0,窗口扩大 c 倍且速率不变时,λ 也扩大 c 倍
目标次数 k
计算“恰好发生 k 次”的概率,k 只能取 0、1、2、…
λ^k 与 e^{-λ}
λ^k 是平均次数 λ 连乘 k 次的量;e^{-λ} 等于恰好 0 次的概率
阶乘 k!
分母去除 k 个事件不同先后顺序造成的重复计数
给 k 个到达时刻排序对应 →公式中的 k!

题目只问“发生了几次”,不追问先后;k! 个排列其实是同一种计数结果,因此要除以 k!。

P(X=k)=λkeλk!,k=0,1,2,,λ>0P(X=k)=\frac{\lambda^k e^{-\lambda}}{k!},\quad k=0,1,2,\ldots,\quad \lambda>0
19第 19 页 · 泊松分布的概率公式

泊松分布的期望与方差

上页我们认识了泊松分布的概率公式。这个 λ 究竟意味着什么?它同时承担「平均事件数」与「波动幅度」两个角色——这正是泊松分布最简洁优雅的性质。

E(X) = λ
期望就是参数本身,λ 直接等于单位时间内的平均事件数
Var(X) = λ
方差也等于 λ,与期望数值恰好相同,构成最特别的巧合
D(X) = √λ
标准差是 λ 的平方根,描述典型波动幅度
建模判据
若样本均值与方差接近,可优先尝试泊松分布
天平的左右两盘对应 →泊松的期望与方差

天平通常左右不等重,泊松里两盘恰好等重——都等于 λ

E(X)=Var(X)=λE(X) = \text{Var}(X) = \lambda
20第 20 页 · 泊松分布的期望与方差

不同λ值下的分布形态

先找λ变化节点,再分左右两栏读:小λ→右偏,大λ→正态。

图解渲染中…
d1概率集中在0附近,右侧拖长尾d5形状趋近正态钟形曲线
21第 21 页 · 不同λ值下的分布形态

二项分布vs泊松分布

两者都是离散计数分布,但适用场景截然不同;混用会让模型与数据错位。

二项分布
  • n次独立试验中成功的次数
  • 试验次数n与成功概率p均固定
  • 有限次试验,每次结果独立
  • n大p小时近似为泊松分布
泊松分布
  • 单位区间内稀有事件的发生次数
  • 由平均发生率λ刻画
  • 事件独立且单次概率极小
  • 二项在n→∞、p→0下的极限
稀有事件计数用泊松;有限次试验的成功计数用二项;n大p小时二者可近似互换。
22第 22 页 · 二项分布vs泊松分布

离散型分布知识图谱

  • 分布形态由试验结构决定,二项看n次成败,泊松看稀疏事件流频次
  • np=λ 把二项推成泊松,两者是同一现象在不同视角下的极限
  • 推断三步走:点估计→区间估计→假设检验,样本连向总体的链条
  • α控拒真、β控纳伪,此消彼长;样本量与效应大小决定检验功效
延伸主题:中心极限定理:连接离散与连续正态分布与连续型变量实务落地:A/B 测试与率检验
23第 23 页 · 离散型分布知识图谱

自测检验

点击作答

用泊松分布建模某现象,参数 λ=4。下列关于随机变量 X 的描述必然正确的是:

24第 24 页 · 自测检验

课后思考

先合上笔记自己想三分钟,再对照参考答案——重点不是'答对',而是看自己的思路差在哪一环。

1二项分布和泊松分布的方差公式为什么都等于 np 和 λ?这种巧合背后有什么共同的数学机制?

参考答案两者都源自独立伯努利试验求和,方差可加性让总方差等于'次数×单次方差'。泊松是 n→∞、p→0 时 np=λ 的极限,公式同形不奇怪。

2假设一家奶茶店周末平均每小时卖 15 杯,店长想判断今天某小时卖出 25 杯是否异常,你会怎么用今天学到的工具帮他?

参考答案用泊松分布算 P(X≥25)。若远小于 0.05 可判为异常,否则属于正常波动。先估 λ=15,再算累积概率,最后下结论。

3今天所有分布都默认事件相互独立。当事件存在传染性或聚集性(如传染病病例、机器连续故障),二项/泊松模型还能直接套用吗?

参考答案不能。直接套用会低估极端事件概率。应改用负二项分布(方差>均值,允许过度离散),或考虑时空相关性模型——核心假设被破坏,参数估计本身就要重审。

25第 25 页 · 课后思考