课题学习 体质健康测试中
从原始体测数据到统计图表,完整走一遍数据分析的实战流程
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
课题学习 体质健康测试中
从原始体测数据到统计图表,完整走一遍数据分析的实战流程
描述数据
前面已经知道测试会得到身高、体重、肺活量、耐久跑成绩等一组组数字。拿到数据后,先别急着下结论,要先把它们整理成能说明“整体长什么样”的信息。
体检报告先列指标和参考范围,再用均值、比例和趋势概括整体;这对应数据的整理、概括与呈现。
分析数据
上一页给数据'拍了照'——知道了平均分、整体分布。但拍照只回答'是什么样的'。要回答'为什么这样'和'意味着什么',需要再往前走一步:分析数据。
描述=量体温、测血压;分析=找出病因、开出方案——主题都是'健康'
整理数据
体测成绩单铺开一整页——一眼看不出'7 秒以下有几人'。原始数据太散,没法直接对照。把数据按规则分组排队,让规律的轮廓自己浮出来——这就是整理数据要干的事。
散乱数据像堆地上找不着的衣服;按规则分组后每段各归其位,找哪段一目了然
平均数
上一节我们把全班立定跳远成绩整理成了表格——但几十个数字堆在一起,眼睛根本扫不过来。怎么用「一个数」就能代表全班整体水平?这就要请出最常用的统计量:平均数。
把每个数据看作重量不同的砝码,支点正好让两边力矩相等——这就是平均数的位置。
中位数
上页用平均数描述了全班 50 米成绩。但若有个同学跑得特别快(极端值),平均数会被「拉偏」——这时候,就需要中位数出场了。
数据从小到大排成一列,正中央那个人前后人数相等
众数
学完平均数和中位数,我们已经能用「总和」与「位置」两种角度看一组数据。但有时我们更关心:什么最常出现?比如班里同学的鞋码哪种最多——这就需要众数登场。
大家反复投票给同一个人,就像数据反复出现同一个数;得票最高的就是众数
方差
前面学过平均数、中位数、众数找的是数据的「中心」,但同样的平均分背后可能藏着截然不同的故事——有的班级分数紧贴均线,有的却有人拔尖有人垫底。方差要回答的,正是这种「离散程度」。
靶心=平均数;箭孔紧贴靶心方差小,四散方差大
样本
前面我们学了平均数、方差这些工具来处理数据。可数据从哪来?全国学生体质测试不可能人人都测,只能抽一部分。这一小部分,就是'样本'。
抽一管血就能反映全身状况;测一部分学生就能推断全国学生体质水平
总体
上一节我们从全校学生里抽了50人测体能,得到平均肺活量3200毫升。但这50人能代表全校1000名学生吗?要回答这个问题,得先往回退一步——我们真正想研究的,到底是'全体',还是'部分'?
整塘的鱼才是'总体',捞上来研究的那几条才是'样本'
集中趋势的度量
老师公布成绩时说'这次考试平均分是87分'——一个数字就让全班心里有了底。这背后藏着的问题:用哪个数,能最好地代表一整组数据?
几十号人只用一个'中心位'代表整体;选法不同(C位定义不同),代表人物也不同
统计图表
上几页我们学了平均数、方差这些数字武器,但面对成百上千个原始分数,光看数字仍让人眼花。怎么办?换一种语言——把数字画成图。统计图表就是数字和眼睛之间的『翻译官』。
地图把真实地形转化为符号和颜色,统计图表把数字转化为图形,让人一眼看清规律与结构
用样本估计总体
前面我们用平均数、方差描述了一份数据,但那份数据往往是抽样得到的。我们真正想知道的是全市、全省学生的体质水平——样本凭什么能代表总体?这一页把这件事讲清楚。
前提是汤要搅匀(随机抽样),一勺(样本)才能代表一锅(总体)的味道
本节要点
- ✓数据有描述与推断两个层面,方法选择要看目的
- ✓集中趋势三指标各有适用场景,极端值存在时慎用平均数
- ✓方差与标准差衡量离散程度,是判断稳定性的尺子
- ✓样本代表总体的前提:随机抽样 + 容量足够
- ✓图表是数据的语言,选对图比画好图更重要
课后思考
三道开放题,先自己琢磨再对答案;可留给课后慢慢想。
参考答案中位数。右偏分布中,少数高分把均值往上拉,多数人集中在低分段;中位数对极端值不敏感,更贴近多数人的真实水平。
参考答案样本量够大但代表性存疑。需补充:抽样方式是否随机、是否覆盖不同地区与年龄段、与总体的匹配度等。
参考答案不一定。方差只衡量平均偏离程度,不看分布形状;若多数数据聚集却存在离群点,方差也可能很小但实际并不稳定。