数据的集中趋势

官方数学老师·21 页·进阶(有基础,想深入原理)·0 次浏览·2 天前
统计集中趋势进阶分布

数据的集中趋势

学会用平均、中位、众数三把尺子衡量数据中心

按 空格/→ 演示下一步

1 / 21 页

全部页面点击任意一页,跳回舞台从这页播放

统计集中趋势进阶分布

数据的集中趋势

学会用平均、中位、众数三把尺子衡量数据中心

1第 1 页 · 数据的集中趋势

什么是集中趋势

上次聊到「数据的集中趋势」,但你停下来想想——「集中」这个词到底在捕捉什么?一组数据是真的「想」往某个值附近聚集,还是我们看图时脑补出的视觉规律?这一页给你一个更底层的回答。

本质是聚集现象
数据自然倾向于聚集在某个值附近,不是均匀分布
现实规律使然
大多数测量受共同因素主导,所以结果会向中心靠拢
代表性数值
那个中心点能代表整组数据的典型水平,比所有数据都好记好用
向心力对应 →集中趋势

行星绕太阳转,被引力拉向中心;数据也有隐形引力,被典型状态拉向某个值

2第 2 页 · 什么是集中趋势

三种代表值的位置关系

三种分布形态下,三种代表值在数轴上的相对位置。

图解渲染中…
A1正态分布里,均值/中位数/众数算出来几乎一样B1右尾的离群点把均值向高端拉,远离众数C1左尾的离群点把均值向低端拉,远离众数Y无论偏不偏,它们都落在数据最密的附近
3第 3 页 · 三种代表值的位置关系

平均数的基本概念

上页我们看到三种代表值的位置关系。今天聚焦最常用的平均数——它的本质就是一次'公平分配':把所有数据凑成总量,再平均分给每一个数据。

累加求和
把所有数据值加起来,得到总和
统计个数
数一数一共多少个数据点
相除得均值
总和除以个数,如5、7、9,21÷3=7
每个数据都参与
任何一个数据变化都会拉动均值
平分一堆糖对应 →求平均数

总和是一堆糖,n 个数据是 n 个人,每人分到多少就是平均数——分的人越多,每人越少

xˉ=x1+x2++xnn\bar{x} = \frac{x_1 + x_2 + \cdots + x_n}{n}
4第 4 页 · 平均数的基本概念

平均数的计算步骤

算术平均数的定义就一句话——数据加总再平摊,对应三步:求和、计数、相除。

1
求和
把全部观测值逐个累加,得到总和 Σxᵢ
2
计数
确认样本量 n,这就是后面相除的分母
3
相除
总和除以个数,得到算术平均数 x̄ = Σxᵢ/n
5第 5 页 · 平均数的计算步骤

加权平均数的引入

上一页算的是普通平均数,每个数据一视同仁地加起来除以个数。但现实中数据往往"分量"不同——比如算 GPA,4 学分的课比 2 学分的课"更重要",简单平均就显得不公平。

等量齐观的局限
普通平均假设每个数据份量相同,但现实里影响力常不一样
"权"的含义
权就是衡量每个数据重要性的数值,越重要权越大
加权的核心思路
求和时把数据乘以它的"权",再用权的总和去除
公司股东投票表决对应 →加权平均

一人一票 vs 一股一票:出资越多表决权越重,对结果影响越大,这正对应数据的"权"

xˉw=i=1nwixii=1nwi\bar{x}_w = \frac{\sum_{i=1}^{n} w_i x_i}{\sum_{i=1}^{n} w_i}
6第 6 页 · 加权平均数的引入

"权"的本质

上次我们算出加权平均数,但「权」本身还没说透。为什么期末考权重是 70%,平时成绩是 30%?「权」到底在表达什么?今天我们深入挖一挖「权」的本质。

权的本质
不是出现次数,而是「这个数据该被多看重」
权的力学意义
权大的数据像磁铁,把平均值「拉」向自己
权的主观性
同样一组数据,权重由规则制定者决定,没有标准答案
股票组合的持仓比例对应 →数据加权中的权

重仓股涨跌对总收益影响更大,权大的数据对平均值的「拉力」也更强

xˉ=w1x1+w2x2++wnxnw1+w2++wn\bar{x}=\frac{w_1x_1+w_2x_2+\cdots+w_nx_n}{w_1+w_2+\cdots+w_n}
7第 7 页 · "权"的本质

加权平均数的计算

加权平均数分四步:列数据、配权重、逐项乘权、累加除总权。

1
列出所有数值
把所有参与计算的数据点逐个写出来
2
确定对应权重
权重代表该值出现次数或重要程度
3
数值乘以权重
每项数据与对应权重相乘得到加权值
4
求和除以总权
所有乘积累加后除以权重之和
8第 8 页 · 加权平均数的计算

普通 vs 加权平均数

普通平均数默认每个数据同样重要;加权平均数承认数据有"分量"差异。混淆点:加权重到底改变了结果什么?

普通平均数
  • 每个数据权重相等(默认同等重要)
  • 公式:(x₁+x₂+…+xₙ) ÷ n
  • 结果落在数据的几何中心
  • 适合:各样本同等可靠
加权平均数
  • 每个数据可设不同权重(重要性不同)
  • 公式:Σ(权×值) ÷ Σ权
  • 结果向权重大的数据倾斜
  • 适合:可靠性/频次/贡献不同时
数据点的可靠性或重要性存在差异时,必须用加权平均;只有"众生平等"的场景才适合普通平均。
9第 9 页 · 普通 vs 加权平均数

中位数的概念

前面学的平均数有个软肋:一旦数据里混进极端值,平均数就会被「拉偏」。这时需要一个更稳健的代表——按位置站的中位数。

定义:位置代表
把所有数据按大小排序后,正中间那个(或两个平均)就是中位数
奇数个数据
排好序后直接取中间位置的那个数
偶数个数据
取中间两个数的平均,作为中位数
抗极端值
中位数只关心「位置」,极端值挪到哪儿都不影响它
排队找中间的人对应 →排序后取中位数

所有人按高矮排成一列,最中间那位就是中位数——不管队首队尾多极端

Median={x(n+1)/2,n 为奇数xn/2+xn/2+12,n 为偶数Median = \begin{cases} x_{(n+1)/2}, & n \text{ 为奇数} \\ \dfrac{x_{n/2} + x_{n/2+1}}{2}, & n \text{ 为偶数} \end{cases}
10第 10 页 · 中位数的概念

中位数的求解步骤

求中位数只要依次完成排序、定位中点,再按数据个数取值或求平均。

1
排序
先按从小到大排列数据,确保能准确定位中点。
2
找中点
数出数据个数 n,中点位置为 (n+1)/2。
3
取值或平均
n 为奇数取该位置值;n 为偶数取中间两数平均。
11第 11 页 · 中位数的求解步骤

众数的概念

前两页我们从'总和'与'位置'两个角度理解集中趋势。这一页换个视角——看'人气':在一组数据里,出现次数最多的那个值,就是众数。

出现频次最高
数据中出现次数最多的那个数(或类别)就是众数
可能不存在
若所有值出现次数都相等,则没有众数
可能不止一个
可有一个、两个(双众数)甚至多个众数同时存在
唯一适用于分类
平均数、中位数都要求数值可运算,众数只看频次
班级投票得票最多的人对应 →众数

得票数=出现频次,谁票数最高谁就是这组数据的众数

12第 12 页 · 众数的概念

众数的求解方法

求众数看似简单,但要严谨求解需要按四步走:整理、计数、比较、确定。

1
整理数据
把全部数据列出或分组归类,散乱的数据没法直接比较
2
统计频数
逐个计数每个数值出现的次数,形成频数表
3
找出最大
对比各频数大小,找到出现最频繁的那个值
4
确定众数
频数最大的数即为众数;并列多个则是多众数
13第 13 页 · 众数的求解方法

中位数 vs 众数

同为位置代表值,面对极端值、多峰数据时,谁能扛住?

中位数
  • 排序后居中位置的那个值
  • 排序→取中间,奇数取1个、偶数取2个平均
  • 抗极端值,不会被异常值拉偏
  • 适合数据有异常值或分布偏斜时
众数
  • 出现频次最高的那个值
  • 直接数频次,最高频即众数
  • 完全无视极端值,只看出现次数
  • 适合分类数据或多峰分布
中位数靠"排序取中"切断异常值;众数靠"只看频次"天然免疫异常值,抗噪机理完全不同。
14第 14 页 · 中位数 vs 众数

组中值的定义

前面所有均值讨论都基于原始数据。但现实中常只拿到分组表——比如'60-70分有5人',看不到具体分数。怎么用这种压缩过的数据算代表值?这就需要给每个区间找一个'代理数字'。

组中值
用每个组的上下限中点,作为该组所有数据的代表
计算公式
组中值 = (上限 + 下限) ÷ 2
隐含假设
默认组内数据在区间内均匀分布,不偏多也不偏少
只知票房区间估总收入对应 →组中值

只能看到'8-9亿'区间时,假定票房均匀分布,用8.5亿代表

中点值=上限+下限2中点值 = \dfrac{上限 + 下限}{2}
15第 15 页 · 组中值的定义

组中值的计算公式

组中值不是凭空定义的,它建立在「均匀分布」这一关键假设之上。

1
识别上下界
从区间中确认下界 a 和上界 b,圈定讨论范围
2
做均匀假设
默认数据在区间内均匀铺开,没有偏向
3
取区间中点
均匀分布下,区间中心最能代表这组数据
4
写出公式
(上界+下界)÷2,即 (a+b)÷2
16第 16 页 · 组中值的计算公式

组中值与集中趋势

上一页我们学会了求组中值——把每组两端取中点。但算出这个数能干嘛?这页告诉你:组中值是估算分组数据平均数的钥匙。

估算场景
只有分组频率分布表,没有原始数据,无法精确计算平均数
核心思想
假设组内数据均匀分布,用组中值代表该组"典型水平"
加权计算
组中值作数据、频率/组距作权,做加权平均得估计值
近似性质
结果是估计值而非精确值;组内分布越均匀,误差越小
体检身高按区间统计对应 →组中值估算平均数

不知道每人身高,假设每组集中在中点,再按人数加权

xˉfixi(fi为频率/组距,xi为组中值)\bar{x} \approx \sum f_i x_i \quad (f_i \text{为频率/组距,} x_i \text{为组中值})
17第 17 页 · 组中值与集中趋势

三种代表值的对比

平均数和中位数都叫'代表值',但同一组数据常给出不同答案——该信谁?

平均数
  • 用全部数据求和再均分
  • 适合对称分布的数值数据
  • 是算术量,可参与后续运算
  • 极端值一出现就被拉偏
中位数
  • 只看排序后的中间位置
  • 适合偏态分布或含异常值
  • 是位置量,不能代入公式
  • 极端值基本影响不到它
数据对称无异常→平均数;偏斜或含极端值→中位数;要看出现频次→众数。
18第 18 页 · 三种代表值的对比

自测检验

点击作答

5 名同学身高(cm)分别为 158、160、162、165、190。想描述这组数据的「一般身高」,最合适的代表值是?

19第 19 页 · 自测检验

课堂总结

  • 选哪种代表值,取决于数据形态与分析目的
  • 权重反映重要性差异,不是机械的加权操作
  • 组中值是分组数据的近似代表,精度有上限
  • 对称分布时三者重合,偏移越大差异越明显
延伸主题:数据的离散程度偏态与峰度异常值的识别与处理
20第 20 页 · 课堂总结

课后思考

先自己列思路,再对照参考答案。这里没有标准答案,关键是想明白为什么。

1为什么平均数对极端值那么敏感,一个异常数据就能把它拉偏?

参考答案平均数把每个数据都纳入计算,单个极端值显著改变总和,再除以个数自然偏移。不妨换成中位数对比感受。

2同一组工资数据,老板和员工为何会各选不同的代表值公布?

参考答案立场决定选择:平均数容易被极端值拉高,更适合讲'整体水平';中位数和众数则贴近多数人的位置。

3定性数据(比如最喜欢的颜色)没有数值,集中趋势还谈不谈得上?

参考答案严格说,平均数无定义。但众数的'最常出现'对定性数据仍有效,可视为集中趋势的一种推广。

21第 21 页 · 课后思考