用样本估计总体

官方数学老师·15 页·深入(追求细节与边界)·0 次浏览·3 天前
参数估计抽样分布置信区间中心极限定理

用样本估计总体

搞懂估计量的三大评判准则,看清置信区间背后抽样分布的完整逻辑

按 空格/→ 演示下一步

1 / 15 页

全部页面点击任意一页,跳回舞台从这页播放

参数估计抽样分布置信区间中心极限定理

用样本估计总体

搞懂估计量的三大评判准则,看清置信区间背后抽样分布的完整逻辑

1第 1 页 · 用样本估计总体

利用样本估计总体

民调机构采访 1000 人就敢预测几千万选民的投票倾向;工厂抽检 50 件就判定这批十万件产品是否合格——凭什么?这背后就是「用样本估计总体」的统计思想。

样本与总体
样本是总体中随机抽取的部分个体;总体是研究对象的全体
用统计量估计参数
样本均值估计总体均值,样本比例估计总体比例
随机抽样是前提
非随机抽样会产生系统性偏差,样本无法代表总体
估计必有抽样误差
误差随样本量增大而缩小,但永远不可能等于零
典型适用场景
总体过大、检验具破坏性、总体为无限或假想时
品尝一勺汤判断整锅对应 →用样本估计总体

搅匀再舀(随机),尝一口判断咸淡(估计),一口不绝对准(误差)

E(Xˉ)=μ, D(Xˉ)=σ2/nE(\bar{X})=\mu,\ D(\bar{X})=\sigma^2/n
2第 2 页 · 利用样本估计总体

绘制并解读统计图表

上页我们讲了用样本估计总体的基本思路,但拿到一堆原始数据,光看数字很难说清分布。统计图表就像给数据拍 X 光片,把看不见的分布形状变成一眼可读的图像。

直方图核心
纵轴为频率/组距,每矩形面积=该组频率,所有面积之和为1
读图三步
看形状(对称/偏态)→ 定中心(均值/众数位置)→ 估离散(跨度与高低差)
图表选择
分类数据用条形图;分布用直方图;多组对比用箱线图
推断价值
样本分布的形状是估计总体分布的视觉依据,图表就是窗口
X 光片对应 →频率分布直方图

X 光把骨骼内部结构可视化,直方图把数据分布可视化,二者都是透过外表看本质

$\text{该组频率} = \text{纵轴高度} \times \text{组距}$
3第 3 页 · 绘制并解读统计图表

平均数

前面用统计图看清了数据的分布长相,但光看长相还不够——我们想要一个数字,把一群数据浓缩成「一个代表」。这就是平均数登场的时候。

定义
所有数据相加后除以数据个数,得到的代表值
反映集中趋势
刻画一组数据的「中心位置」,是数据整体的浓缩
对极端值敏感
一个特别大或特别小的数就能把平均数拉偏
与中位数众数互补
三者各答不同问题:总和均分、位置居中、出现最多
把全班身高叠起来再均分对应 →平均数

总身高不变,平均值相当于「每个人应有的等量身高」

xˉ=1ni=1nxi\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i
4第 4 页 · 平均数

中位数

上页我们讲了平均数,它对极端值特别敏感——9 人月薪 1 万,老板年薪百万,平均数立刻飞上天。这时我们需要一个稳健的代表:中位数。

排序后取中位
把所有数据从小到大排好队,正中间位置的数就是中位数
奇偶分别处理
数据个数为奇数时取中间那一个;为偶数则取中间两数的平均
不被极端值带偏
改动最大或最小值,中位数几乎不变;平均数则会被拉离真实水平
偏态分布时更优
收入、房价等右偏数据,用中位数描述典型水平比平均数更稳健
排队时正中间那个人对应 →中位数

两边人数对等,队首队尾换谁来都影响不到他

奇数:$M_e = x_{\frac{n+1}{2}}$;偶数:$M_e = \frac{x_{\frac{n}{2}} + x_{\frac{n}{2}+1}}{2}$
5第 5 页 · 中位数

众数

众数:背景、意义与延伸了解

众数
众数:背景、意义与延伸了解
6第 6 页 · 众数

方差

平均数相同的两个班级,一个学生成绩集中在75-85之间,另一个有考100也有考50——光看平均数已分不出高下。我们需要一个数,专门量化这种「波动」,这就是方差。

方差定义
各数据与平均数之差的平方的平均数,反映数据偏离均值的程度
核心意义
衡量离散程度:值越大,数据越分散;值越小,数据越集中
总体与样本之分
分母取 n 是总体方差 σ²;分母取 n-1 是样本方差 s²(无偏估计)
典型应用
质量波动控制、考试成绩稳定性比较、投资组合风险评估
一群人站位对应 →方差描述的离散

平均数是他们站位的中心,方差衡量他们散得多开——越散值越大

σ2=i=1n(xiμ)2ns2=i=1n(xixˉ)2n1\sigma^2=\dfrac{\sum_{i=1}^{n}(x_i-\mu)^2}{n} \quad s^2=\dfrac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}
7第 7 页 · 方差

极差

方差把每个数据都用上了,但有时候我们只想问一个最简单的问题:'这组数据最高的和最低的差多少?'——这就是极差。

定义
最大值减最小值,反映数据两端的跨度
优点
只需两个数就能算,概念直观、速度最快
致命弱点
只用两个值,对极端值(异常数据)异常敏感
稳健替代
想抗干扰可用四分位距 IQR,只看中间 50% 的数据
只量班里最高和最矮两个同学对应 →极差

不看中间大部分人,班级整体身高的信息全丢了

R=xmaxxminR = x_{\max} - x_{\min}
8第 8 页 · 极差

标准差

上一页的方差把每个偏差都平方了,单位也跟着「升级」——身高是厘米,方差却变成「厘米²」。想拿回原本能直接读懂的单位,得开个方。这就是标准差。

定义
方差的算术平方根,把平方度量还原成原始量纲
单位回归
与原始数据同单位,可直接说「平均偏离几厘米」
典型偏离
粗略刻画数据围绕平均数散开的「典型幅度」
样本校正
样本标准差除以 n−1(贝塞尔校正),保证无偏估计
更常用
因量纲与原数据一致,几乎在所有应用里取代方差出场
把面积换算回边长对应 →标准差对方差开方

方差单位是原数据的平方,开方就回到原单位,能直接读出偏离平均多远

s=i=1n(xixˉ)2n1s=\sqrt{\dfrac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}}
9第 9 页 · 标准差

频率分布表

50 个人的成绩单摆在面前看不出规律。分成 60 以下、60~70、70~80、80~90、90 以上几段,每段各有多少人、占多少比例,分布形状一目了然——这就是频率分布表。

分组(组距与组数)
把原始数据按数值区间切分,每段宽度叫组距,分多少段叫组数。一般 5~10 组为宜。
频数(次数)
落入某段的数据个数。例如 70~80 分有 12 人,频数就是 12。
频率
频数除以数据总数,反映该段占比。所有组频率之和恒等于 1。
频率密度(频率÷组距)
各组组距不等时,直接比频率会被组距「污染」;要比较应使用频率密度。
累积频率
把频率从小到大逐组累加,可快速回答「低于某值的数据占多少比例」。
整理混装水果对应 →频率分布表

混装水果看不出比例;按种类分堆清点,每堆个数就是频数,占比就是频率。

fi=niN,i=1kfi=1f_i = \dfrac{n_i}{N}, \quad \sum_{i=1}^{k} f_i = 1
10第 10 页 · 频率分布表

频率分布直方图

有了频率分布表,下一步是把数字画成图。但直接把「频率」当柱高画,会有个陷阱——组距不同的小组会被误判。

纵轴是频率/组距
不是频率本身。这样不同组距的小组才能在同一张图上公平比较
矩形面积 = 频率
宽窄不同的小组,靠面积而非高度反映占比
所有面积之和 = 1
因为各组频率之和为 1,整张图的「占地面积」是单位面积
适合展示分布形态
一眼看出集中趋势、离散程度、是否对称、有无异常
宽窄不同的水杯装水对应 →频率分布直方图

水量看底面积×水位高度;只比水位高低会错判宽杯窄杯

频率i=(频率组距)i×组距i\text{频率}_i = \left(\frac{\text{频率}}{\text{组距}}\right)_i \times \text{组距}_i
11第 11 页 · 频率分布直方图

百分位数

上一页讲中位数把数据一分为二——其实它只是百分位数家族的'第 50 号成员'。把切分比例从 50% 换成任意 p%,就得到更一般的百分位数。

定义
从小到大排列后,使累计频率恰好达到 p% 的那个数值;意味着 p% 的样本 ≤ 它
计算步骤
先算位置 i = n×p%;i 非整数则向上取整对应项;i 整数则取第 i 与 i+1 项平均
与已学概念的关系
P50 就是中位数;P25、P75 分别对应四分位数 Q1、Q3
典型应用
成绩排名看 P90/P95;收入分布关注 P50 中位数;网站延迟用 P99 衡量长尾体验
班里 100 人按成绩排队对应 →百分位数

第 10 名对应 P90:90% 的同学分数比你低

i=n×p%i = n \times p\%
12第 12 页 · 百分位数

四分位数

上页讲了百分位数 P_k——表示「有 k% 的数据比它小」。但百分位有 100 个,统计学家挑出最关键的三个:25%、50%、75% 位置上的数,就是四分位数。

定义
把数据从小到大排,用三个点把它四等分的数
与百分位关系
Q1=P25,Q2=P50(中位数),Q3=P75,三页串成一条线
位置公式
Q_k 的位置 = k(n+1)/4;非整数时在相邻数据间插值
四分位距 IQR
Q3 减 Q1,反映中间 50% 数据的离散程度
稳健性优势
极端值几乎不影响;是箱线图核心,标准差做不到
学校按成绩分四等对应 →四分位数

三个切点把学生分成四组各占 25%,与中位数一脉相承

$Q_k = \text{第 } \dfrac{k(n+1)}{4} \text{ 个数据},\ k=1,2,3$ $$\text{IQR} = Q_3 - Q_1$$
13第 13 页 · 四分位数

本节要点

  • 集中趋势定位,离散程度定宽——两视角不可偏废
  • 样本统计量是估计值,不等于总体参数
  • 图表选用服从数据类型,坐标轴是阅读起点
  • 百分位数刻画排位,不受极端值影响
  • 标准差与数据同量纲,方差仅为计算便利
延伸主题:抽样方法与误差控制置信区间与参数估计假设检验入门
14第 14 页 · 本节要点

课后思考

先自己琢磨一会儿,再翻开参考答案看看思路对不对。

1为什么用一小部分样本就能估计整个总体的特征?这种'靠谱'需要什么前提?

参考答案需要样本随机、有代表性、容量足够大。随机性保证每个个体被抽中的机会均等,足够容量才能让估计稳定收敛到真实值。

2想估计全校同学的平均身高,你会怎么设计抽样?什么情况下估计会偏差很大?

参考答案建议分层随机抽样(按年级、性别分层)。只在操场抽样会漏掉不爱运动的,结果偏高——这就是典型的抽样偏差。

3如果总体本身在变化(如疫情期间消费习惯改变),样本还'代表'总体吗?

参考答案总体快速变化时,旧样本反映的是'过去'。需要用近期数据或持续追踪,否则估计会失真,甚至反向误导决策。

15第 15 页 · 课后思考