随机抽样
看清四种抽样方法的数学假设、误差来源与适用边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
随机抽样
看清四种抽样方法的数学假设、误差来源与适用边界
变量
抽样是从一群人里抽一部分人来观察,但我们到底在观察什么?每个人的身高、年龄、收入——这些都是「变量」。要理解抽样结果的含义,先得把变量这件事说透。
每列是一个变量,每行是一个个体,抽样就是从中挑行
样本
变量讲的是「测什么」,但对象成千上万时——比如全国选民——没法逐一去测每个对象的变量值。抽出一小批来观测,这批观测值的集合就叫「样本」。
几毫升血推断全身健康,依赖血液充分混匀——对应样本须同分布
总体
上一页讲了样本——实际观测到的数据集合。但你想透过这份数据说什么?是眼前这几个对象本身,还是更大的一群人、一批产品?这一页来说清楚:那个'更大的那一群'到底是什么。
几瓶水=样本,整个湖=总体;检测结果只能用来推断湖,而非那几瓶水本身
抽样调查
前面我们分别认识了随机抽样、变量、样本和总体。现在把它们拼成完整方法:怎么用一小部分数据,回答整个总体的疑问?这就是抽样调查要做的事。
搅匀后�一勺(随机抽样),尝一口判断整锅咸淡(推断总体);可能漏掉某个偏咸的角落(抽样误差)
简单随机抽样
上一节我们聊过抽样调查——从总体里挑一部分人来代表全体。可「怎么挑」才算公平?这一节就来讲最经典、最基础的那一种:简单随机抽样。
把所有人名字写在签上彻底搅匀,每人被抽中的概率相同;先抽后抽不影响这种公平性
个体
不管用哪种抽样方法,最后都要落到对每一个具体对象的观察上。这个「具体对象」是什么?这就要落到个体。
研究「整园苹果」时一颗就是一个个体;切块研究苹果组织就另当别论了
全面调查(普查)
前几页我们讲了抽样——用'部分'推断'整体'。但如果不靠推断,把总体里的每一个个体都直接查一遍呢?这种做法就叫全面调查,也叫普查。
每件产品都过检测线=每个个体都查;千万件产品时全检不现实=大总体的局限
样本量
前页抽到了一个样本,自然会问:抽多少个才算够?这就是样本量问题——它直接决定估计有多准。
问 10 人不稳,问 1000 人就稳,再问下去提升变小
放回简单随机抽样
前面讲的简单随机抽样,抽完不放回——但袋里只有5个球时,第一次摸到红球概率是1/5,第二次再摸就不是了。要让每次概率严格不变,就必须把抽到的放回去。
每次掷完不"消耗"任何面,下次6面概率仍是各1/6
不放回简单随机抽样
上一节抽签定出场顺序,每抽一根又放回盒里搅匀——那叫放回抽样。可现实中签一旦抽走,往往不会再塞回去。今天看这种更贴近生活的抽法。
每摸出一个放到一边,盒里少一个;球被抽完,抽样结束
抽签法
上一节说到不放回简单随机抽样,最直观、最好懂的实现,就是给每个个体编号、写签、混匀、再一张张抽出来——这就是抽签法。
把「等可能」变成看得见的物理操作,但都只是近似随机
随机数法
上页抽签法只能应付小样本,要从几千个体里抽几百人,做签混签就力不从心。随机数法把这件「摇签」的活交给随机数表或电脑,既省人力又不丢公平。
都靠随机机制保证公平;摇号面对海量购房人可用随机数表等效实现
分层随机抽样
全校要抽查视力,如果各年级近视率差别很大,全混在一起抽,结果可能严重偏倚。这时需要分层。
全国按省分,省内再按选区分,每层都有代表
比例分配
一所学校 800 人里高一 500、高二 200、高三 100。要从中抽 80 人做调查,每层各抽多少?最直觉的答案是——按人数比例来分。
500 人和 100 人的两个层,前者天然就该抽得多——和班费按人头一个道理
样本平均数估计总体平均数
抽样调查拿到一组数据后,最自然的下一步就是算它们的平均数,用这个样本平均数去估计总体的平均数。这一步是抽样推断的核心动作。
舀一勺≈样本,一勺的咸淡≈样本均,整锅汤的咸淡≈总体均
本节要点
- ✓随机是抽样的灵魂——保证每个个体入选机会均等,估计才能无偏
- ✓样本量与代表性不是一回事:方法合理远比数量重要
- ✓总体异质时优先分层抽样,比例分配保持子群结构
- ✓样本均值的期望等于总体均值——这是用局部推全局的统计学根据
- ✓普查与抽样的抉择,本质是成本、可行性与精度的三方权衡
课后思考
先自己想一想,再翻看参考答案。没有标准答案,思路比结论更重要。
参考答案核心是样本要具有代表性——每个个体被抽中的机会大致相等。如果抽样过程有系统偏差(如只调查主动上网的人),估计就会系统性偏离总体真实值。
参考答案用分层随机抽样:按年龄段分层,在每层内独立抽样。这样能避免某一年龄段被遗漏或被过度代表,让样本结构逼近总体结构,提高估计精度。
参考答案一次抽样只是某个时点的快照。当总体快速变化时,结论的时效性很短;若要刻画变化趋势,需要重复抽样或纵向追踪设计,单次抽样无法回答。