随机抽样

官方数学老师·18 页·深入(追求细节与边界)·0 次浏览·3 天前
抽样方法误差分析统计推断

随机抽样

看清四种抽样方法的数学假设、误差来源与适用边界

按 空格/→ 演示下一步

1 / 18 页

全部页面点击任意一页,跳回舞台从这页播放

抽样方法误差分析统计推断

随机抽样

看清四种抽样方法的数学假设、误差来源与适用边界

1第 1 页 · 随机抽样

变量

抽样是从一群人里抽一部分人来观察,但我们到底在观察什么?每个人的身高、年龄、收入——这些都是「变量」。要理解抽样结果的含义,先得把变量这件事说透。

变量的定义
个体可观测的特征属性,取值随个体或情境不同而变化
分类:定性变量
取值为类别,如血型、性别,运算只能用计数与频率
分类:定量变量
取值为数字,又分离散(计数)与连续(测量)
混杂变量
同时影响自变量与因变量的第三变量,会扭曲因果推断
抽样对变量的要求
目标变量的每一类取值都应有机会进入样本
Excel 表的每一列对应 →变量

每列是一个变量,每行是一个个体,抽样就是从中挑行

2第 2 页 · 变量

样本

变量讲的是「测什么」,但对象成千上万时——比如全国选民——没法逐一去测每个对象的变量值。抽出一小批来观测,这批观测值的集合就叫「样本」。

定义
从总体中按规则抽取的部分个体的观测值集合,记为 x₁, x₂, …, xₙ
样本量 n
样本中个体的数量,n 越大估计越准但成本也越高
抽样误差
即便完全随机,样本统计量与总体参数之间仍会有差距
iid 假设
经典推断的基石:观测之间独立且服从同一分布
抽血化验对应 →样本推断总体

几毫升血推断全身健康,依赖血液充分混匀——对应样本须同分布

3第 3 页 · 样本

总体

上一页讲了样本——实际观测到的数据集合。但你想透过这份数据说什么?是眼前这几个对象本身,还是更大的一群人、一批产品?这一页来说清楚:那个'更大的那一群'到底是什么。

总体
我们想研究的全部个体的集合,是统计推断要回答的对象
目标 vs 抽样总体
理想群体 ≠ 抽样框实际覆盖的群体;差距就是覆盖偏差
参数
描述总体的数值(μ、σ²、p);几乎永远算不出来,只能估计
有限与无限
有限总体可枚举(全校学生),无限总体(过程/未来)只能靠抽样
从湖泊里取几瓶水做水质检测对应 →用样本推断整个湖的水质

几瓶水=样本,整个湖=总体;检测结果只能用来推断湖,而非那几瓶水本身

4第 4 页 · 总体

抽样调查

前面我们分别认识了随机抽样、变量、样本和总体。现在把它们拼成完整方法:怎么用一小部分数据,回答整个总体的疑问?这就是抽样调查要做的事。

推断性目标
从样本数据推断总体特征,结论指向总体而非样本本身
部分调查
只研究总体中的部分个体,而非对每一个都查
经济高效
比全面调查省时间、省人力、省钱,适合大总体
误差不可避免
抽样误差客观存在,但随机抽样下可估计、可控制
厨师从汤锅舀一勺尝味对应 →抽样调查

搅匀后�一勺(随机抽样),尝一口判断整锅咸淡(推断总体);可能漏掉某个偏咸的角落(抽样误差)

5第 5 页 · 抽样调查

简单随机抽样

上一节我们聊过抽样调查——从总体里挑一部分人来代表全体。可「怎么挑」才算公平?这一节就来讲最经典、最基础的那一种:简单随机抽样。

定义
总体中每个个体被抽中的概率相等,且抽样过程中个体之间相互独立
核心特征
等概率 + 不偏向,任一可能样本被抽中的机会相同
实现方式
抽签法(人工随机化)与随机数表法(借助随机工具)
适用条件
总体有限且个体可编号,规模适中、个体间无明显分层
边界
总体 N 极大时编号不可行;总体有明显结构时分层抽样更优
抽签抓阄对应 →简单随机抽样

把所有人名字写在签上彻底搅匀,每人被抽中的概率相同;先抽后抽不影响这种公平性

P(个体被抽中)=nNP(\text{个体被抽中}) = \dfrac{n}{N}
6第 6 页 · 简单随机抽样

个体

不管用哪种抽样方法,最后都要落到对每一个具体对象的观察上。这个「具体对象」是什么?这就要落到个体。

定义
个体是构成总体的每个具体观察单位,是变量取值的最小载体
不可再分
个体是研究意义上的最小单位,再拆分就改变了研究对象本身
变量载体
每个个体身上可观测多个变量的值,如学生有身高、成绩、性别
由研究目的决定
同一份数据里,个体可以是个人、家庭、学校,也可以是某一天
一颗苹果对应 →个体

研究「整园苹果」时一颗就是一个个体;切块研究苹果组织就另当别论了

xij=第 i 个个体在第 j 个变量上的观测值x_{ij}=\text{第 }i\text{ 个个体在第 }j\text{ 个变量上的观测值}
7第 7 页 · 个体

全面调查(普查)

前几页我们讲了抽样——用'部分'推断'整体'。但如果不靠推断,把总体里的每一个个体都直接查一遍呢?这种做法就叫全面调查,也叫普查。

核心定义
对总体中的每一个个体逐一调查,不漏、不重
经典实例
全国人口普查,每十年一次,对全体国民逐一登记
突出优势
数据完整,无抽样误差,结果即总体真值
现实代价
成本高、耗时长,对庞大总体几乎不可行
与抽样的取舍
小总体倾向普查,大总体往往只能走抽样
工厂逐件质检对应 →全面调查

每件产品都过检测线=每个个体都查;千万件产品时全检不现实=大总体的局限

8第 8 页 · 全面调查(普查)

样本量

前页抽到了一个样本,自然会问:抽多少个才算够?这就是样本量问题——它直接决定估计有多准。

样本量 n
样本中包含的个体数量,是抽样调查最关键的参数
误差与 n
误差大致与 √n 成反比;n 翻 4 倍,误差才缩一半
n 的决定因素
总体方差、允许误差、置信水平、抽样方式
边际递减
n 越大精度越高,但每多抽一个带来的提升越来越小
现实约束
成本、时间、可操作性都会限制 n 不能无限大
街头随机拦人做民调对应 →随机抽样的样本量

问 10 人不稳,问 1000 人就稳,再问下去提升变小

EknE \approx \dfrac{k}{\sqrt{n}}
9第 9 页 · 样本量

放回简单随机抽样

前面讲的简单随机抽样,抽完不放回——但袋里只有5个球时,第一次摸到红球概率是1/5,第二次再摸就不是了。要让每次概率严格不变,就必须把抽到的放回去。

放回机制
每次抽取后将个体放回总体,总量与构成始终不变
独立同分布
各次抽取互不影响,概率分布完全相同(i.i.d.)
概率可乘
独立事件的联合概率直接等于各事件概率之积
理论基石
中心极限定理、大数定律均建立在独立同分布之上
延伸:自助法
用有放回抽样从样本再生成"新样本",估计统计量分布
反复掷同一颗骰子对应 →放回抽样

每次掷完不"消耗"任何面,下次6面概率仍是各1/6

P(AB)=P(A)P(B)P(A\cap B)=P(A)\cdot P(B)
10第 10 页 · 放回简单随机抽样

不放回简单随机抽样

上一节抽签定出场顺序,每抽一根又放回盒里搅匀——那叫放回抽样。可现实中签一旦抽走,往往不会再塞回去。今天看这种更贴近生活的抽法。

不放回抽样
每次从剩余个体中抽一个,抽中后不再放回总体
样本无重复
同一个体最多被抽到一次,样本里不会出现重复值
样本量有上限
样本量 n 不能超过总体容量 N,否则抽无可抽
n = N 是边界
n 等于总体容量 N 时,即退化为全面调查(普查)
从盒子里摸彩球对应 →不放回抽样

每摸出一个放到一边,盒里少一个;球被抽完,抽样结束

11第 11 页 · 不放回简单随机抽样

抽签法

上一节说到不放回简单随机抽样,最直观、最好懂的实现,就是给每个个体编号、写签、混匀、再一张张抽出来——这就是抽签法。

操作步骤
编号→制签→混匀→不放回逐一抽出,签号即样本编号
随机性来源
靠物理搅匀,让每张签被抽到的概率都相等
适用条件
总体容量 N 较小(一般 N≤几百),操作才现实
主要局限
人混签并非真随机;签数一多就繁琐到不可行
延伸意义
它是随机数表法、计算机伪随机抽样的「概念原型」
摇号买房/车牌对应 →抽签法

把「等可能」变成看得见的物理操作,但都只是近似随机

12第 12 页 · 抽签法

随机数法

上页抽签法只能应付小样本,要从几千个体里抽几百人,做签混签就力不从心。随机数法把这件「摇签」的活交给随机数表或电脑,既省人力又不丢公平。

定义
借助随机数表或随机函数产生数字来抽取样本号
编号前提
需对总体中每个个体逐一编号,位数必须统一
工具来源
教材附录的随机数表,或编程语言的随机数生成函数
等概率性
每个编号被选中的概率相等,无主观偏差
适用场景
总体规模大、个体多、抽签难以实施时尤其高效
摇号买房对应 →随机数法

都靠随机机制保证公平;摇号面对海量购房人可用随机数表等效实现

13第 13 页 · 随机数法

分层随机抽样

全校要抽查视力,如果各年级近视率差别很大,全混在一起抽,结果可能严重偏倚。这时需要分层。

分层定义
按某特征把总体分成互不重叠的子群(层)
分层依据
选与研究变量强相关的特征,如年级、性别、地区
层内抽样
每层独立抽,可等比例或按权重不等比例
核心优点
每层都有代表,估计更精确,还能比较层间差异
适用前提
层间差异大、层内差异小,分层才有优势
选人大代表对应 →分层随机抽样

全国按省分,省内再按选区分,每层都有代表

$\bar{y}_{st}=\sum_h W_h \bar{y}_h$,$W_h=N_h/N$ 为第 $h$ 层权重
14第 14 页 · 分层随机抽样

比例分配

一所学校 800 人里高一 500、高二 200、高三 100。要从中抽 80 人做调查,每层各抽多少?最直觉的答案是——按人数比例来分。

核心思想
各层样本量 = 总样本量 × 该层规模占总体的比例
公式
n_h = n × (N_h / N),N_h 为第 h 层规模
为什么这样分
让样本结构和总体结构对齐,层越大人抽得越多
典型适用
各层规模悬殊、且层内方差相近时最稳妥
边界提醒
层内方差差异大时,Neyman 分配方差更小
按人头分钱对应 →按层规模分配样本

500 人和 100 人的两个层,前者天然就该抽得多——和班费按人头一个道理

nh=nNhNn_h = n \cdot \dfrac{N_h}{N}
15第 15 页 · 比例分配

样本平均数估计总体平均数

抽样调查拿到一组数据后,最自然的下一步就是算它们的平均数,用这个样本平均数去估计总体的平均数。这一步是抽样推断的核心动作。

核心动作
用样本平均数 x̄ 去估计总体平均数 μ
无偏性
E(x̄)=μ,多次抽样 x̄ 的均值恰等于 μ
精度公式
Var(x̄)=σ²/n,n 越大 x̄ 越靠近 μ
符号区分
x̄ 是统计量(随样本变),μ 是参数(总体固有)
喝汤尝咸淡对应 →用样本均估计总体均

舀一勺≈样本,一勺的咸淡≈样本均,整锅汤的咸淡≈总体均

xˉ=1ni=1nxi,E(xˉ)=μ\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i,\quad E(\bar{x})=\mu
16第 16 页 · 样本平均数估计总体平均数

本节要点

  • 随机是抽样的灵魂——保证每个个体入选机会均等,估计才能无偏
  • 样本量与代表性不是一回事:方法合理远比数量重要
  • 总体异质时优先分层抽样,比例分配保持子群结构
  • 样本均值的期望等于总体均值——这是用局部推全局的统计学根据
  • 普查与抽样的抉择,本质是成本、可行性与精度的三方权衡
延伸主题:抽样分布与中心极限定理非概率抽样的偏差与补救权重估计与复杂抽样设计
17第 17 页 · 本节要点

课后思考

先自己想一想,再翻看参考答案。没有标准答案,思路比结论更重要。

1样本平均数能用来估计总体平均数,这个估计为什么能成立?需要什么前提?

参考答案核心是样本要具有代表性——每个个体被抽中的机会大致相等。如果抽样过程有系统偏差(如只调查主动上网的人),估计就会系统性偏离总体真实值。

2某城市要调查居民对某项新政策的满意度,居民年龄结构差异很大,你建议怎么抽样?

参考答案用分层随机抽样:按年龄段分层,在每层内独立抽样。这样能避免某一年龄段被遗漏或被过度代表,让样本结构逼近总体结构,提高估计精度。

3如果总体本身随时间快速变化,一次随机抽样的结论还能代表什么?它的局限在哪里?

参考答案一次抽样只是某个时点的快照。当总体快速变化时,结论的时效性很短;若要刻画变化趋势,需要重复抽样或纵向追踪设计,单次抽样无法回答。

18第 18 页 · 课后思考
随机抽样 · 知识图解