用样本估计总体
搞懂估计量的三大评判准则,看清置信区间背后抽样分布的完整逻辑
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
用样本估计总体
搞懂估计量的三大评判准则,看清置信区间背后抽样分布的完整逻辑
利用样本估计总体
民调机构采访 1000 人就敢预测几千万选民的投票倾向;工厂抽检 50 件就判定这批十万件产品是否合格——凭什么?这背后就是「用样本估计总体」的统计思想。
搅匀再舀(随机),尝一口判断咸淡(估计),一口不绝对准(误差)
绘制并解读统计图表
上页我们讲了用样本估计总体的基本思路,但拿到一堆原始数据,光看数字很难说清分布。统计图表就像给数据拍 X 光片,把看不见的分布形状变成一眼可读的图像。
X 光把骨骼内部结构可视化,直方图把数据分布可视化,二者都是透过外表看本质
平均数
前面用统计图看清了数据的分布长相,但光看长相还不够——我们想要一个数字,把一群数据浓缩成「一个代表」。这就是平均数登场的时候。
总身高不变,平均值相当于「每个人应有的等量身高」
中位数
上页我们讲了平均数,它对极端值特别敏感——9 人月薪 1 万,老板年薪百万,平均数立刻飞上天。这时我们需要一个稳健的代表:中位数。
两边人数对等,队首队尾换谁来都影响不到他
众数
众数:背景、意义与延伸了解
方差
平均数相同的两个班级,一个学生成绩集中在75-85之间,另一个有考100也有考50——光看平均数已分不出高下。我们需要一个数,专门量化这种「波动」,这就是方差。
平均数是他们站位的中心,方差衡量他们散得多开——越散值越大
极差
方差把每个数据都用上了,但有时候我们只想问一个最简单的问题:'这组数据最高的和最低的差多少?'——这就是极差。
不看中间大部分人,班级整体身高的信息全丢了
标准差
上一页的方差把每个偏差都平方了,单位也跟着「升级」——身高是厘米,方差却变成「厘米²」。想拿回原本能直接读懂的单位,得开个方。这就是标准差。
方差单位是原数据的平方,开方就回到原单位,能直接读出偏离平均多远
频率分布表
50 个人的成绩单摆在面前看不出规律。分成 60 以下、60~70、70~80、80~90、90 以上几段,每段各有多少人、占多少比例,分布形状一目了然——这就是频率分布表。
混装水果看不出比例;按种类分堆清点,每堆个数就是频数,占比就是频率。
频率分布直方图
有了频率分布表,下一步是把数字画成图。但直接把「频率」当柱高画,会有个陷阱——组距不同的小组会被误判。
水量看底面积×水位高度;只比水位高低会错判宽杯窄杯
百分位数
上一页讲中位数把数据一分为二——其实它只是百分位数家族的'第 50 号成员'。把切分比例从 50% 换成任意 p%,就得到更一般的百分位数。
第 10 名对应 P90:90% 的同学分数比你低
四分位数
上页讲了百分位数 P_k——表示「有 k% 的数据比它小」。但百分位有 100 个,统计学家挑出最关键的三个:25%、50%、75% 位置上的数,就是四分位数。
三个切点把学生分成四组各占 25%,与中位数一脉相承
本节要点
- ✓集中趋势定位,离散程度定宽——两视角不可偏废
- ✓样本统计量是估计值,不等于总体参数
- ✓图表选用服从数据类型,坐标轴是阅读起点
- ✓百分位数刻画排位,不受极端值影响
- ✓标准差与数据同量纲,方差仅为计算便利
课后思考
先自己琢磨一会儿,再翻开参考答案看看思路对不对。
参考答案需要样本随机、有代表性、容量足够大。随机性保证每个个体被抽中的机会均等,足够容量才能让估计稳定收敛到真实值。
参考答案建议分层随机抽样(按年级、性别分层)。只在操场抽样会漏掉不爱运动的,结果偏高——这就是典型的抽样偏差。
参考答案总体快速变化时,旧样本反映的是'过去'。需要用近期数据或持续追踪,否则估计会失真,甚至反向误导决策。