统计调查

官方数学老师·16 页·进阶(有基础,想深入原理)·0 次浏览·3 天前
抽样设计数据收集误差分析调查方法

统计调查

从抽样设计到误差控制,搞懂一次调查的底层逻辑与常见陷阱

按 空格/→ 演示下一步

1 / 16 页

全部页面点击任意一页,跳回舞台从这页播放

抽样设计数据收集误差分析调查方法

统计调查

从抽样设计到误差控制,搞懂一次调查的底层逻辑与常见陷阱

1第 1 页 · 统计调查

整理数据

上一步我们拿到的是一堆原始记录——问卷答案、测量值、零散数字。它们现在只是「散落的珠子」,看不出规律。这一步要做的,是把这些珠子按规律串起来,让数据自己说话。

数据审核
检查完整性、准确性、一致性,剔除异常、补齐缺失
分组归类
数值型按区间划分,类别型按属性归并,让同类项聚在一起
编制统计表
用频数、频率把数据浓缩进表格,让数字一眼可读
绘制统计图
直方图、饼图、折线图等直观呈现,让规律「看得见」
仓库分拣快递包裹对应 →整理数据

包裹先验视、按地区码放、再登记入册;数据也先审核、分组、再制表呈现

2第 2 页 · 整理数据

绘制统计图

绘制统计图:定义、要点与典型应用

绘制统计图
绘制统计图:定义、要点与典型应用
3第 3 页 · 绘制统计图

统计调查

会整理数据只是『中段』。数据从哪来、靠什么方式收,这要做『统计调查』——它直接决定结论可不可信。

调查目的
先明确要回答什么问题,如『本班视力现状』
调查对象
划定总体范围,是全班、全校还是某群体
调查方式
全面调查(逐一查)或抽样调查(取部分代表整体)
调查内容
设计具体问题项,规定数据形式(数字或类别)
尝一勺汤判整锅咸淡对应 →抽样调查

一勺=样本,整锅=总体;勺子要搅匀再舀才典型

4第 4 页 · 统计调查

调查问卷

上页我们梳理了统计调查的全流程——问卷是其中最常用的数据采集工具。它怎么从一张纸变成现代社会的'听诊器'?

历史背景
起源于人口普查与早期民意调查,把主观回答变成可统计的数字
核心价值
用统一问题把千人千面的回答变成可对比的数据
设计核心
问题措辞、量表尺度、题型选择共同决定数据质量
抽样框
只调查一部分人,靠抽样框代表整体,避免偏倚
常见偏差
响应偏差、社会期望偏差等会让数据'说谎'
体检表对应 →调查问卷

都用标准化项目收集可对比的数据:体检量身高体重,问卷量观点态度

5第 5 页 · 调查问卷

数据

做完了调查、整理好了表格、画出了统计图——这一切操作的起点都是数据。可「数据」究竟是什么?它有哪些类型?这页讲清楚。

数据的定义
通过观察、实验、调查等方式获得的原始数值或事实,是统计分析的起点
定量 vs 定性
定量数据可测量、可运算(如身高、收入);定性数据描述类别(如性别、血型)
离散 vs 连续
离散数据只能取特定值(如班级人数);连续数据可取区间内任意值(如测量长度)
数据 ≠ 信息
数据是原料,信息是加工后的产物;同一份数据可加工出不同信息
厨房里的食材对应 →原始数据

买回来的菜要洗、切、炒才成菜;数据要整理、分析才出信息

6第 6 页 · 数据

划记法

划记法:背景、意义与延伸了解

划记法
划记法:背景、意义与延伸了解
7第 7 页 · 划记法

频数统计表

上一页我们用划记法数出了一堆「正」字,但这堆零散的正字没法直接看出谁多谁少、占多大比例。这一页要把它们搬进一张表里——频数统计表。

定义
用表格形式记录每个类别或数据值出现次数的整理方式
基本结构
三栏:数据/类别、频数(出现次数)、频率(占比)
频数 vs 频率
频数是绝对数,频率是相对数;所有频率之和等于 1
核心作用
把杂乱数据变成有序结构,为画统计图和做推断打底
投票计票对应 →频数统计表

每个候选人对应一行,得票数就是频数,一眼看出谁领先

频率=频数数据总数\text{频率}=\frac{\text{频数}}{\text{数据总数}}
8第 8 页 · 频数统计表

条形图

整理完数据做成频数统计表,数字虽然齐全,但一眼看不出谁大谁小。怎么让数据'跳'出来让人秒懂?这就轮到条形图登场了。

定义
用等宽长条的高度表示各类别数据多少的统计图
结构
横轴是分类类别,纵轴是数值大小
优点
直观比较各类别之间的差异
适用场景
类别不多、需对比大小的数据
绘制要点
条宽一致、条间留空隙、纵轴从0起
比身高对应 →条形图

让数据并排站成一排比高低,谁高谁矮一目了然

9第 9 页 · 条形图

扇形图

上页的条形图让我们看清了「谁高谁低」,但有时更关心「各占多少」——全班60人,男生有多少?占比多少?这就需要扇形图登场。

整体与部分
整个圆代表总体(100%),每个扇形代表一个部分
圆心角公式
扇形圆心角 = (该部分数量 ÷ 总数) × 360°
适用场景
突出数据构成、占比关系时使用
与条形图区别
条形图比「多少」,扇形图比「占多少」
切披萨分给朋友对应 →扇形图表示占比

整个披萨=总数,每块大小=各部分占比,块越大占比越高

扇形圆心角=该部分数量总数×360°\text{扇形圆心角}=\frac{\text{该部分数量}}{\text{总数}}\times 360°
10第 10 页 · 扇形图

全面调查

全国人口普查,挨家挨户登记每一个人——这就是全面调查。不抽样、不估计,追求的是全体数据的完整。

调查全体
对调查对象的全部个体逐一调查,不遗漏任何一个
数据精确
结果就是总体的真实情况,不存在抽样误差
适用条件
总体规模不能太大,否则人力物力难以承受
典型应用
人口普查、经济普查等需要精确数据的场景
全校点名对应 →全面调查

全校每个人都点到,一个不漏,结果确定但耗时费力

11第 11 页 · 全面调查

抽样调查

上页讲全面调查——一个不漏、数据精确。但全校两千学生测视力、几万灯泡测寿命,全部检测既耗时又毁物,根本不现实。怎么办?

抽样调查
从总体中抽取一部分个体作为样本,用样本来推断总体情况
总体与样本
全体对象叫总体,被抽中的那部分叫样本,样本需有代表性
随机性原则
每个个体被抽到的机会均等,避免人为偏好,保证推断可靠
适用场景
总体过大、检测有破坏性或需快速判断时优先选用
体检抽血化验对应 →抽样调查

几毫升血推断全身状况,不必抽干也能做诊断

12第 12 页 · 抽样调查

样本的代表性

抽样调查只研究总体中的一部分——样本。但凭什么用几千人就推断上百万人的情况?这就要谈「代表性」:样本能不能扛起「以小见大」这面大旗。

代表性定义
样本的特征能反映总体的特征,是抽样推断能够成立的逻辑前提
样本量适中
太小易被偶然性干扰,太大浪费资源;总体规模越大,所需相对样本量可越小
随机抽样
每个个体被抽中的机会相等,避免人为偏向,保证结论可推广到总体
典型应用
民意调查、产品质量抽检、医学流行病学研究均依赖样本的代表性
品尝一锅汤判断咸淡对应 →样本代表总体

搅匀后舀一小口(适量+随机),只舀表面会偏咸或偏淡

13第 13 页 · 样本的代表性

标记重捕法(估计总体数量

我们已经学过抽样调查要保证样本的代表性。但如果对象是整片森林里的野生鹿群,你没法逐个编号——这时该怎么办?

第一步:标记一批
先从总体中捕获 M 个,做上记号再放回自然
第二步:再捕一次
等标记个体与未标记充分混合后,再捕 n 个,记录其中带标记的 m 个
核心估算公式
用比例关系 N = M×n/m 反推总体数量
适用前提
总体封闭(无生死、无迁入迁出),且标记个体均匀混入
典型应用
野生动物数量调查,如湖中鱼群、林中鹿鸟
一滴红墨水滴入泳池对应 →标记重捕法的稀释思路

红墨水(M)被稀释的倍数,等于泳池水量(总体)相对墨水的倍数

N=M×nmN = \dfrac{M \times n}{m}
14第 14 页 · 标记重捕法(估计总体数量

本节要点

  • 选对调查方式:少量目标求准用全面,大量目标靠抽样看代表
  • 问卷含糊则后续全废:数据上限锁在源头,不在图表
  • 整理的本质:把一堆数压成一组分布,让规律自己浮现
  • 图选错结论就偏:条形图比多少,扇形图比占比
  • 样本不在多而在像总体;标记重捕靠两次捕获反推总量
延伸主题:抽样误差与置信区间对照实验与因果推断图表中的视觉误导陷阱
15第 15 页 · 本节要点

课后思考

课后留三道开放题,先自己想,再对照参考答案。答案给出思考路径,不是唯一标准。

1当总体数量很大或具有破坏性时,抽样调查为什么比全面调查更划算?这里的划算指的是什么?

参考答案"划算"指时间、人力与成本的节省,同时兼顾可靠性。总体庞大(如全国人口)或检测有破坏性(如灯泡寿命)时,全面调查既不现实也不经济,抽样用部分推断整体就成了更优解。

2若要调查全校同学的日均睡眠时长,你会如何设计抽样方案?需要考虑哪些关键因素?

参考答案先界定总体(全校学生)与样本(抽取的部分同学)。三个要点:1.随机抽样避免主观偏误;2.样本量要够,否则代表性不足;3.样本的性别、年级、文理科结构要与总体一致。

3用标记重捕法估计池塘中鱼的总数时,若标记过程影响了鱼的存活率或活动能力,估计结果会偏大还是偏小?为什么?

参考答案会偏大。若标记降低鱼的被捕概率(如标记物让鱼更警觉),二次捕获中标记鱼比例会偏低。反推总数时,只能用更大的总鱼数才能"对得上"观测到的标记数,于是高估了真实数量。

16第 16 页 · 课后思考