频率与概率

官方数学老师·12 页·深入(追求细节与边界)·0 次浏览·3 天前
频率概率统计定义古典概型适用边界

频率与概率

厘清频率收敛概率的逻辑,看懂统计定义与古典概型的适用边界

按 空格/→ 演示下一步

1 / 12 页

全部页面点击任意一页,跳回舞台从这页播放

频率概率统计定义古典概型适用边界

频率与概率

厘清频率收敛概率的逻辑,看懂统计定义与古典概型的适用边界

1第 1 页 · 频率与概率

用频率估计概率

上页我们区分了频率与概率:频率是已发生的结果,概率是未发生前的判断。但许多实验根本算不出理论概率——比如掷一块形状不规则的橡皮。这时该怎么办?答案藏在「重复」二字里。

核心思路
概率难以推导时,用大量重复试验所得频率作为估计值
稳定性来源
试验次数越多,频率越稳定地收敛到某个常数——大数定律
估计而非等于
频率是概率的近似,两者永远有偏差,次数越多偏差越小
典型应用
Monte Carlo 模拟、统计推断、机器学习随机采样的共同基石
反复称量未知重量对应 →用频率估计概率

概率是物体的真实重量,频率是一次次加上的砝码——加得越多越接近真实,但永远不重合

$$P(A) \approx \dfrac{n_A}{n}$$
2第 2 页 · 用频率估计概率

构建随机模拟模型

上一页我们用真实试验发现:次数够多时,频率会稳定在概率附近。但很多场景没法真去抛——比如预测明年洪水概率。此时让计算机替我们抛。这套方法就是随机模拟模型。

模型定义
用伪随机数复现随机过程的计算框架
四大要素
随机源、概率分布映射、大量重复、结果统计
理论根基
锚定上一页:大数定律保证频率收敛于概率
典型应用
Monte Carlo、风险预测、排队系统、可靠性分析
飞行模拟训练对应 →随机模拟模型

真飞贵且险,用模拟器造随机气流;真实实验慢且险,用计算模型生成随机样本

p^=1Ni=1NI(XiA)\hat{p}=\frac{1}{N}\sum_{i=1}^{N}I(X_i\in A)
3第 3 页 · 构建随机模拟模型

概率

上一页我们用频率去逼近概率,但频率盯的是过去,概率究竟指什么?它和频率差在哪?这一页把概率本身拆开看清楚。

概率
量化随机事件发生可能性的数,值域[0,1]
三条公理
非负性P≥0;规范性P(必然)=1;可加性:互斥事件概率可相加
方向不同
频率统计过去已发生的事实,概率预测未来未发生的可能
典型应用
风险定价、医学诊断、推荐系统、博弈决策
天气预报与气候记录对应 →概率与频率

预报说'明天降水概率60%'面向未来;记录'过去下了60天'回顾过去

P(A)0, P(Ω)=1, P(iAi)=iP(Ai)P(A) \ge 0,\ P(\Omega)=1,\ P\left(\bigcup_i A_i\right)=\sum_i P(A_i)
4第 4 页 · 概率

频率

前页我们用「次数÷总次数」来估计概率——这个比值就是频率本身。现在单独拎出来看清:它是什么、边界在哪、和概率到底差在哪。

定义
n次重复试验中,事件A出现k次,k/n就是A的频率
值域
频率必落在[0,1],0代表从未发生,1代表每次都发生
稳定性
试验次数n越大,频率波动越小,会向某个常数收敛
非概率
频率是试验后的统计量,不是先验的理论值,但可用来估计概率
投票支持率对应 →事件频率

100人投票65人支持=频率0.65;不同次民调结果会有波动,但样本越大越稳

f(A)=kn,0f(A)1f(A)=\dfrac{k}{n},\quad 0\le f(A)\le 1
5第 5 页 · 频率

频率的稳定性

抛硬币 10 次,可能 7 正 3 反——你直觉会怀疑硬币有问题;但抛 1000 次,正面比例几乎总在 0.5 附近。'次数越多,比例越稳',这就是频率的稳定性。

定义
相同条件下大量重复试验,事件频率围绕某常数小幅波动
稳定值
这个常数恰好是事件本身的概率,是频率与概率的桥梁
稳定≠恒等
波动始终存在,只是振幅随试验次数增加而不断衰减
经验属性
由大量实验观察总结,不能由纯数学公理体系严格证明
典型应用
抽样调查估算支持率、机器学习频率统计、随机模拟验证模型
用同一把尺反复量桌子长度对应 →频率稳定在概率附近

尺有误差,每次读数小幅不同,但都贴近真实长度——和频率围绕概率收敛是同一种感觉

fn(A)nP(A)f_n(A) \xrightarrow{n \to \infty} P(A)
6第 6 页 · 频率的稳定性

随机模拟

你已经会用频率估计概率,也亲手搭过模拟模型。现在退一步,把「随机模拟」四个字放进数学语境——它是什么、靠什么成立、又在哪里失效。

定义
用计算机重复生成随机结果,从统计量中估计难以直接求解的目标值
理论根基
依赖大数定律:试验次数足够多时,频率依概率收敛到真实概率
适用边界
解析法无解或代价过高时最有效;前提是模型能正确刻画现实
典型场景
不规则图形面积、高维积分、金融定价、粒子输运、排队系统
抽样调查推断总体对应 →随机模拟

调查不挨个问所有人,随机抽一批人推断整体;模拟不算解析解,靠大量随机试验逼近真值

limNP ⁣(nANp<ε)=1\lim_{N \to \infty} P\!\left(\left|\frac{n_A}{N} - p\right| < \varepsilon\right) = 1
7第 7 页 · 随机模拟

伪随机数

上一页我们用计算机模拟了上千次抛硬币,但电脑是台按指令运行的机器——它怎么就'随机'起来了?这就要聊聊伪随机数。

确定性的计算机
计算机按指令运行,本身无法产生真随机
算法造随机
用线性同余等确定性公式生成看似随机的数列
种子即命运
初始值决定整个序列,同种子必出同结果
统计上像随机
频率、均匀性等统计特征逼近真随机分布
边界:需真随机的场景
密码学、安全抽奖等场合伪随机数可被破解
音乐App的'随机播放'对应 →伪随机数生成

同一首歌开始播放,曲序看似随机,实则由算法和初始状态决定

Xn+1=(aXn+c)modmX_{n+1} = (aX_n + c) \bmod m
8第 8 页 · 伪随机数

随机现象

抛一枚硬币之前,你能断言它落地是正是反吗?不能。这并非算力不足——而是它客观上就没有唯一答案。这正是前几页频率与概率讨论的共同前提。

不可预知性
单次试验前,结果无法唯一确定——非信息不足,而是本质如此
结果多值性
同一条件下,至少有两种以上不同结果均可能发生
个体随机 整体规律
单次不可预测;大量重复下呈统计规律——前几页讲的频率稳定性正源于此
本质 vs 边界
区分'本质上随机'与'只是暂时不可预知'——行星轨道在牛顿力学下其实可算
抛硬币对应 →随机现象

单次不可预知(个体随机) ↔ 万次近半(整体规律)

9第 9 页 · 随机现象

古典概型不可用的情形

前几页我们用频率估概率,那是从数据出发的经验法。要从理论上精确算概率,古典概型(每个基本事件等可能)是最经典的工具——但它的使用条件相当苛刻,任何一条不满足都直接失效。

前提一·有限样本空间
所有可能结果总数必须有限可列,不能是连续区间或无穷序列
前提二·基本事件等可能
每个基本事件发生的机会严格相等,需用对称性论证而非主观判断
情形一·样本空间无限
结果连续无穷,如在 [0,1] 区间随机取点,无法用 |A|/|Ω| 计算
情形二·基本事件不等可能
概率分配缺乏对称依据,如偏硬币、非均匀骰子、明日天气
抽奖箱里摸大小相同的球对应 →古典概型的两个前提

球数有限+大小一致才等可能;换成掷飞镖(无限点位)或轻重不一的球,古典公式就报废

P(A)=AΩ,仅当 Ω< 且基本事件等可能时成立P(A)=\dfrac{|A|}{|\Omega|},\quad\text{仅当 }|\Omega|<\infty\text{ 且基本事件等可能时成立}
10第 10 页 · 古典概型不可用的情形

本节要点

  • 频率记实况,概率判趋势,靠大数定律连通
  • 古典概型失效时,模拟把不可算的概率转为可观测的频率
  • 伪随机数的「伪」,是模拟可重复的代价,也是边界所在
  • 频率的稳定性是统计规律,不是精确等式——大样本才逼近
延伸主题:大数定律的严格陈述用蒙特卡洛方法计算定积分真随机数与伪随机数的差异
11第 11 页 · 本节要点

课后思考

先合上屏幕,用笔写下你的想法;再看参考答案,比对思路而非抄写结论。

1为什么可以用大量重复试验的频率来估计概率?这背后藏着什么关键假设?

参考答案关键假设是试验可重复且结果独立,每次发生的概率保持不变。频率依大数定律收敛于概率,但这需要试验次数足够多、条件始终稳定。

2抛硬币 10 次出现 8 次正面,能否断定这枚硬币不均匀?你会怎样验证?

参考答案不能。10 次样本太小,波动落在正常范围。应继续大量重复,若频率长期稳定偏离 0.5,才有理由怀疑硬币偏倚。

3把「频率估计概率」搬到哪些场景会失灵或变得不可靠?为什么?

参考答案试验次数极少、单次不可重复、条件在试验中不断变化、或真实概率极小时,频率都无法稳定逼近概率,此时需另寻他法。

12第 12 页 · 课后思考