离散型随机变量的数字特征

官方数学老师·12 页·深入(追求细节与边界)·0 次浏览·3 天前
数字特征期望方差概率论矩与协方差

离散型随机变量的数字特征

从定义到性质,搞懂期望、方差、矩的推导逻辑与适用边界

按 空格/→ 演示下一步

1 / 12 页

全部页面点击任意一页,跳回舞台从这页播放

数字特征期望方差概率论矩与协方差

离散型随机变量的数字特征

从定义到性质,搞懂期望、方差、矩的推导逻辑与适用边界

1第 1 页 · 离散型随机变量的数字特征

从分布列计算期望

上页我们认识了几种「数字特征」,其中第一个、最常用的就是期望。它是把分布列「算平均」得到的代表值:每个取值按概率加权。这一页,我们把它的定义、边界、关键用法一层层展开。

定义式
把每个取值 xᵢ 乘以它出现的概率 pᵢ,对所有可能结果求和
本质:加权平均
把每个可能值按概率当权重平均,得到分布的「代表值」
存在性边界
若 Σ|xᵢ|pᵢ 不收敛(不绝对收敛),期望视为不存在
线性是计算利器
E(aX+bY+c) = aE(X)+bE(Y)+c,X、Y 之间不用独立
学分加权平均分(GPA)对应 →离散随机变量的期望

都是加权平均,权重一个看学分(先验给定),一个看概率(分布列自带)

E(X)=ixipi(级数绝对收敛时)E(X) = \sum_{i} x_i p_i \quad (\text{级数绝对收敛时})
2第 2 页 · 从分布列计算期望

从分布列计算方差

上页用 Σxᵢpᵢ 算出了期望 EX,它告诉我们随机变量的『平均位置』。但光知道位置还不够——还需要知道数据绕这个位置『散开』了多远,这就是方差。

定义式
D(X)=Σ(xᵢ−EX)²pᵢ,离均差平方的加权平均
简化公式
D(X)=E(X²)−(EX)²,平方的期望减期望的平方
线性性质
D(aX+b)=a²D(X),常数 b 不影响离散度,系数要平方
非负性
D(X)≥0,等号成立当且仅当 X 是常数随机变量
典型应用
0-1 分布 D(X)=p(1−p);二项分布 B(n,p) D(X)=np(1−p)
射击靶上的弹孔对应 →方差

均值是靶心位置,方差衡量弹孔绕靶心散开的平均平方距离

D(X)=i(xiEX)2pi=E(X2)(EX)2D(X)=\sum_i(x_i-EX)^2 p_i = E(X^2)-(EX)^2
3第 3 页 · 从分布列计算方差

离散型随机变量的均值(数

前两页我们按分布列算出了那个『数』——可它到底代表什么?为什么叫『期望』?为什么有时算出来的值,X 永远取不到?这一页把概念本身拆开看。

加权平均
E(X) 是把每个取值 x_i 按概率 p_i 加权求和——权重是概率,不是频数
不必可取到
E(X) 不必是 X 的可能取值:均匀骰子的期望是 3.5,但 3.5 永远掷不出
线性可加
E(aX+b)=aE(X)+b,无关独立性——这是期望最锋利的计算工具
不唯一刻画
不同分布可有相同均值;E(X) 只反映中心位置,无法反推整个分布
班级考试平均分对应 →数学期望

每个分数按出现概率加权;班里可能没人考到那个『平均分』

E(X)=ixipiE(aX+b)=aE(X)+bE(X)=\sum_i x_i p_i\quad E(aX+b)=aE(X)+b
4第 4 页 · 离散型随机变量的均值(数

两点分布的期望

上一节我们用定义式 E(X)=Σxᵢpᵢ 算期望,现在把它套到最简单的离散分布上——两点分布,看公式能简化成什么。

分布列
X 取 1 概率 p,取 0 概率 1-p,是最简的非退化离散分布
期望公式
E(X) = 1·p + 0·(1-p) = p,期望就等于事件发生的概率
方差公式
D(X) = p(1-p),p=0.5 时方差最大为 1/4
边界行为
p=0 或 p=1 时 X 退化为常数,方差都为 0
典型应用
单次伯努利试验:抛硬币、产品合格判定、一次射击命中
抛一次硬币对应 →两点分布的一次实现

正面记 1、反面记 0,p 就是硬币正面朝上的概率

E(X)=1p+0(1p)=pE(X) = 1\cdot p + 0\cdot(1-p) = p
5第 5 页 · 两点分布的期望

期望的线性性质

你已经会算单个变量的期望了。但遇到 X+Y、3X-2Y 这种组合,硬算联合分布列太麻烦。期望有个代数性质能直接秒杀。

线性性质公式
E(aX+bY+c)=aE(X)+bE(Y)+c,X、Y 可任意
不要求独立
X 与 Y 是否相关、是否独立都成立,这点和方差相反
多变量推广
有限个变量的线性组合,期望等于期望的线性组合
指示变量法
把复杂计数拆成 0/1 变量之和,绕过联合分布列
月底算到手工资对应 →期望的线性性质

底薪+提成+补贴直接相加,不必管它们之间有没有联动

E(i=1naiXi)=i=1naiE(Xi)E\left(\sum_{i=1}^{n} a_i X_i\right) = \sum_{i=1}^{n} a_i E(X_i)
6第 6 页 · 期望的线性性质

离散型随机变量的方差

离散型随机变量的方差:定义、要点与典型应用

离散型随机变量的方差
离散型随机变量的方差:定义、要点与典型应用
7第 7 页 · 离散型随机变量的方差

方差计算简化公式

用定义 D(X)=Σ(xᵢ−μ)²·pᵢ 算方差,每一项都要先减去期望再平方。有没有更省事的办法?这页就拆方差计算中一个常用的简化公式。

简化公式
D(X)=E(X²)−[E(X)]²,即「X 平方的期望」减去「期望的平方」
推导思路
展开 (X−μ)²,交叉项因期望线性性自然消去,剩下 E(X²)−μ²
操作步骤
①算 μ=E(X);②把 xᵢ²·pᵢ 求和得 E(X²);③相减即得 D(X)
典型场景
两点分布直接得 D(X)=p(1−p),不用列 (0−p)²+(1−p)²
逐个减 μ 再平方求和对应 →整体 E(X²) 再减 [E(X)]²

避开每项减均值的繁琐,两法完全等价但计算量显著降低

D(X)=E(X2)[E(X)]2=ixi2pi(ixipi)2D(X)=E(X^2)-[E(X)]^2=\sum_i x_i^2 p_i-\left(\sum_i x_i p_i\right)^2
8第 8 页 · 方差计算简化公式

方差的性质

前面用偏离均值的平方和定义了方差,也得到了简化公式。现在继续追问:随机变量平移、缩放或相加时,方差怎样变化?

非负性
D(X)≥0;等号成立当且仅当 X 几乎处处等于其期望
平移伸缩
D(aX+b)=a²D(X):加减常数不改变方差,乘 a 后方差变为 a² 倍
常量的方差
D(c)=0,因为常量没有随机波动,而非零方差说明存在波动
独立可加性
若 X、Y 独立,则 D(X+Y)=D(X)+D(Y);不独立时还多出协方差项
标准化应用
用 (X−EX)/σ_X 可使变量均值变为 0、方差变为 1
弹簧振子的振动对应 →随机变量的方差

平衡位置对应期望,平均平方位移对应方差;整体平移不变,振幅放大 a 倍时平方位移扩大 a²

D(X)0,D(c)=0,D(aX+b)=a2D(X);X,Y 独立D(X+Y)=D(X)+D(Y)D(X)\ge 0,\quad D(c)=0,\quad D(aX+b)=a^2D(X);\quad X,Y\text{ 独立}\Rightarrow D(X+Y)=D(X)+D(Y)
9第 9 页 · 方差的性质

标准差

方差解决了「用平方衡量偏离」的难题,但有个副作用:单位被平方了——身高方差是 cm²,没法直接说「平均偏离多少 cm」。标准差就是对方差开根号,把单位还原回来。

定义
D(X) = √D(X),即方差的算术平方根
与 X 同量纲
单位不放大也不缩小,可与 X 直接加减比较
典型偏离距离
数值直观反映 X 偏离期望的「平均距离」
与方差取舍
运算性质不如方差简洁,但解读更自然
典型应用
金融风险测度(年化波动率)、质量控制(±3σ 准则)等
速度(m/s)对应 →标准差

方差像动能(½mv²),含平方不便感知;标准差像速度,开方后和 X 同单位,能直接说「偏离多少」

D(X)=D(X)=i(xiE(X))2piD(X) = \sqrt{D(X)} = \sqrt{\sum_i (x_i - E(X))^2 p_i}
10第 10 页 · 标准差

本节要点

  • 期望是概率加权的平均,反映分布集中位置
  • 方差衡量波动大小,DX=EX²−(EX)²最易算
  • 期望线性性恒成立,不要求 X、Y 独立
  • D(aX+b)=a²D(X),平移不变、缩放平方
  • 标准差与 X 同量纲,可跨变量比较波动
延伸主题:协方差与相关系数二项分布的数字特征大数定律简介
11第 11 页 · 本节要点

课后思考

三道题,先各想 1-2 分钟再看参考答案。题 1 回顾公式直觉,题 2 换个数字练手,题 3 把思路拉到分布列之外。

1为什么 E(aX+b) = aE(X)+b?从「加权平均」的角度想想,为什么这条性质其实是「显然」的?

参考答案X 取 xᵢ 时 aX+b 取 axᵢ+b——相当于把每个取值先平移 b 再缩放 a,权重不变。所以新的加权平均就是旧的加权平均先平移再缩放。

2某班成绩 X(满分 100),老师把每人成绩都乘 1.2 倍再减 5 分。新的均值、方差、标准差各是多少?和原来有什么关系?

参考答案均值为 1.2E(X)−5;方差为 1.44D(X);标准差为 1.2σ。注意方差对缩放是「平方放大」,标准差才与缩放同比例——这就是为什么要开根号。

3两个不同的离散型随机变量 X 和 Y,能否拥有相同的均值和方差?请举例。均值和方差能「完整描述」一个分布吗?

参考答案能。例如 X:0 和 2 各取一半;Y:−1 和 3 各取一半——均值都是 1、方差都是 1,分布却不同。说明 E 和 D 只抓住了一、二阶矩,丢掉了形状信息。

12第 12 页 · 课后思考