数据的集中趋势
学会用平均、中位、众数三把尺子衡量数据中心
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
数据的集中趋势
学会用平均、中位、众数三把尺子衡量数据中心
什么是集中趋势
上次聊到「数据的集中趋势」,但你停下来想想——「集中」这个词到底在捕捉什么?一组数据是真的「想」往某个值附近聚集,还是我们看图时脑补出的视觉规律?这一页给你一个更底层的回答。
行星绕太阳转,被引力拉向中心;数据也有隐形引力,被典型状态拉向某个值
三种代表值的位置关系
三种分布形态下,三种代表值在数轴上的相对位置。
平均数的基本概念
上页我们看到三种代表值的位置关系。今天聚焦最常用的平均数——它的本质就是一次'公平分配':把所有数据凑成总量,再平均分给每一个数据。
总和是一堆糖,n 个数据是 n 个人,每人分到多少就是平均数——分的人越多,每人越少
平均数的计算步骤
算术平均数的定义就一句话——数据加总再平摊,对应三步:求和、计数、相除。
加权平均数的引入
上一页算的是普通平均数,每个数据一视同仁地加起来除以个数。但现实中数据往往"分量"不同——比如算 GPA,4 学分的课比 2 学分的课"更重要",简单平均就显得不公平。
一人一票 vs 一股一票:出资越多表决权越重,对结果影响越大,这正对应数据的"权"
"权"的本质
上次我们算出加权平均数,但「权」本身还没说透。为什么期末考权重是 70%,平时成绩是 30%?「权」到底在表达什么?今天我们深入挖一挖「权」的本质。
重仓股涨跌对总收益影响更大,权大的数据对平均值的「拉力」也更强
加权平均数的计算
加权平均数分四步:列数据、配权重、逐项乘权、累加除总权。
普通 vs 加权平均数
普通平均数默认每个数据同样重要;加权平均数承认数据有"分量"差异。混淆点:加权重到底改变了结果什么?
- 每个数据权重相等(默认同等重要)
- 公式:(x₁+x₂+…+xₙ) ÷ n
- 结果落在数据的几何中心
- 适合:各样本同等可靠
- 每个数据可设不同权重(重要性不同)
- 公式:Σ(权×值) ÷ Σ权
- 结果向权重大的数据倾斜
- 适合:可靠性/频次/贡献不同时
中位数的概念
前面学的平均数有个软肋:一旦数据里混进极端值,平均数就会被「拉偏」。这时需要一个更稳健的代表——按位置站的中位数。
所有人按高矮排成一列,最中间那位就是中位数——不管队首队尾多极端
中位数的求解步骤
求中位数只要依次完成排序、定位中点,再按数据个数取值或求平均。
众数的概念
前两页我们从'总和'与'位置'两个角度理解集中趋势。这一页换个视角——看'人气':在一组数据里,出现次数最多的那个值,就是众数。
得票数=出现频次,谁票数最高谁就是这组数据的众数
众数的求解方法
求众数看似简单,但要严谨求解需要按四步走:整理、计数、比较、确定。
中位数 vs 众数
同为位置代表值,面对极端值、多峰数据时,谁能扛住?
- 排序后居中位置的那个值
- 排序→取中间,奇数取1个、偶数取2个平均
- 抗极端值,不会被异常值拉偏
- 适合数据有异常值或分布偏斜时
- 出现频次最高的那个值
- 直接数频次,最高频即众数
- 完全无视极端值,只看出现次数
- 适合分类数据或多峰分布
组中值的定义
前面所有均值讨论都基于原始数据。但现实中常只拿到分组表——比如'60-70分有5人',看不到具体分数。怎么用这种压缩过的数据算代表值?这就需要给每个区间找一个'代理数字'。
只能看到'8-9亿'区间时,假定票房均匀分布,用8.5亿代表
组中值的计算公式
组中值不是凭空定义的,它建立在「均匀分布」这一关键假设之上。
组中值与集中趋势
上一页我们学会了求组中值——把每组两端取中点。但算出这个数能干嘛?这页告诉你:组中值是估算分组数据平均数的钥匙。
不知道每人身高,假设每组集中在中点,再按人数加权
三种代表值的对比
平均数和中位数都叫'代表值',但同一组数据常给出不同答案——该信谁?
- 用全部数据求和再均分
- 适合对称分布的数值数据
- 是算术量,可参与后续运算
- 极端值一出现就被拉偏
- 只看排序后的中间位置
- 适合偏态分布或含异常值
- 是位置量,不能代入公式
- 极端值基本影响不到它
自测检验
5 名同学身高(cm)分别为 158、160、162、165、190。想描述这组数据的「一般身高」,最合适的代表值是?
课堂总结
- ✓选哪种代表值,取决于数据形态与分析目的
- ✓权重反映重要性差异,不是机械的加权操作
- ✓组中值是分组数据的近似代表,精度有上限
- ✓对称分布时三者重合,偏移越大差异越明显
课后思考
先自己列思路,再对照参考答案。这里没有标准答案,关键是想明白为什么。
参考答案平均数把每个数据都纳入计算,单个极端值显著改变总和,再除以个数自然偏移。不妨换成中位数对比感受。
参考答案立场决定选择:平均数容易被极端值拉高,更适合讲'整体水平';中位数和众数则贴近多数人的位置。
参考答案严格说,平均数无定义。但众数的'最常出现'对定性数据仍有效,可视为集中趋势的一种推广。