统计案例 公司员工的肥胖情况调查分析

官方数学老师·13 页·深入(追求细节与边界)·0 次浏览·3 天前
统计案例假设检验数据分析第九章

统计案例 公司员工的肥胖

看完整套图解,你能选对检验方法、读懂 P 值,独立完成肥胖调查的统计推断

按 空格/→ 演示下一步

1 / 13 页

全部页面点击任意一页,跳回舞台从这页播放

统计案例假设检验数据分析第九章

统计案例 公司员工的肥胖

看完整套图解,你能选对检验方法、读懂 P 值,独立完成肥胖调查的统计推断

1第 1 页 · 统计案例 公司员工的肥胖

撰写统计分析报告

上节用 BMI 数据发现 IT 部门肥胖率高于后勤部门,但光有结论没用——老板要拍板、HR 要落地、还要归档备查。这时候,就需要一份把分析过程与结论结构化呈现的统计分析报告。

报告定义
把统计分析的过程与结论结构化呈现给决策者的正式文档
标准结构
摘要、背景、方法、结果、结论与建议六大板块缺一不可
写作原则
数据为据、结论明确、图文互证、建议可落地执行
适用边界
重要决策、对外汇报、归档备查才需正式报告;日常探索不必写
医生写诊断报告对应 →统计分析师写分析报告

病历=调研数据,检查推断=统计推断,诊断结论=报告结论,治疗方案=管理建议

2第 2 页 · 撰写统计分析报告

简单随机抽样

要调查500名员工的肥胖率,不可能挨个测量——随机抽一部分来推总体,这就是简单随机抽样。

等概率抽样
总体中每个个体被抽中的概率完全相同
个体相互独立
每次抽取互不影响,或一次性抽够
无偏估计性
样本均值是总体均值的无偏估计
适用边界
需完整编号名单,大总体操作成本较高
抽签抽奖对应 →简单随机抽样

每张签概率相同,对应每个个体被等概率选中

3第 3 页 · 简单随机抽样

分层随机抽样

上一页的简单随机抽样是从全员里一视同仁地抽,但在肥胖调查中,如果某个部门整组没被抽到,这个群体的特征就完全失声了。怎么解决?

分层依据
选与研究变量密切相关的标志分层,如部门、年龄段
层内独立抽样
每层各自做简单随机抽样,保证每层都有代表
两种样本量分配
比例分配通用;Neyman 最优分配按 N_hσ_h 加权,精度更高
适用边界
层内方差越小、层间差异越大,分层收益越显著;否则提升有限
先按部门分组再各抽几人对应 →分层随机抽样

部门即层,部门内随机抽即层内抽样,保证每部门都进样本

nh=NhN×n(比例分配)n_h = \dfrac{N_h}{N} \times n \quad (\text{比例分配})
4第 4 页 · 分层随机抽样

身体质量指数 BMI

上页用抽样拿到了员工身高体重数据。怎么判一个人算'胖'?不能目测吧。统计上有个最常用的初筛指标——身体质量指数 BMI。先摸清这个工具,回头再看那份肥胖调查分析报告里它怎么用的。

定义与公式
BMI = 体重(kg) ÷ 身高(m)²,把人压成一个标准化密度比值
中国成人分级
<18.5 偏瘦,18.5~23.9 正常,24~27.9 超重,≥28 肥胖(WS/T 428-2013)
优势
只需身高体重两个量,无需仪器;适合大规模筛查和跨人群比较
边界与局限
不区分肌肉与脂肪;不适用运动员、孕妇、儿童、老人等特殊人群
物体的密度(质量÷体积)对应 →人的 BMI(体重÷身高²)

都是用一个比值刻画'密集程度'。但密度看不出是铁还是铜,BMI 也看不出体重来自肌肉还是脂肪

BMI=体重(kg)身高(m)2\text{BMI}=\dfrac{\text{体重(kg)}}{\text{身高(m)}^{2}}
5第 5 页 · 身体质量指数 BMI

BMI 分类标准(中国成人)

BMI 分类标准(中国成人):定义、要点与典型应用

BMI 分类标准(中国成人)
BMI 分类标准(中国成人):定义、要点与典型应用
6第 6 页 · BMI 分类标准(中国成人)

统计图表选择

前页把 BMI 分了四档——偏瘦、正常、超重、肥胖。可手头是几百个数字:怎么让人一眼看出哪档人最多、各部门差距有多大?答案在选对图表。

图表选择原则
先问数据想说什么(比较/构成/分布/关系),再选图
比较类 → 条形图
类别间数值对比,如各部门肥胖率排名
构成类 → 饼图/环形图
部分占整体比例,如各 BMI 等级员工占比
分布/关系类
直方图看 BMI 整体分布;散点图看年龄与 BMI 关系
厨房切菜用刀、盛汤用勺对应 →图表选择匹配数据类型

刀切肉、勺喝汤,工具配食材;柱图比类别、饼图看占比,散点图找关系

7第 7 页 · 统计图表选择

集中趋势参数

上一页抽样得到了一组员工 BMI,几十上百个数字密密麻麻——怎样用「一个数」说清这批人的典型水平?这就要请出集中趋势参数。

平均数(Mean)
全部数值求和除以个数,最直观,但对极端值敏感
中位数(Median)
排序后位于正中的那个值,对极端值不敏感、更稳健
众数(Mode)
出现频率最高的值,适合分类数据或明显多峰分布
截尾均值(Trimmed Mean)
去掉两端各 k 个极端值后再求平均,兼顾信息量与稳健
选择策略
对称无异常用均值;偏斜或含极端值用中位数;多峰用众数
公司发年终奖对应 →集中趋势参数

总奖金÷人数≈平均数;排名正中那位的奖金≈中位数;最多人拿的那个档位≈众数

xˉ=1ni=1nxi\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i
8第 8 页 · 集中趋势参数

离散程度参数

上页 BMI 均值 26 告诉我们'整体偏胖',但掩盖了关键信息:这 50 人是 BMI 都挤在 25 附近,还是有人 22 有人 35?要回答这个问题,必须看离散程度参数。

极差 Range
最大值减最小值,只用两个端点,易被极端值带偏
方差与标准差
衡量每个数据偏离均值的程度,标准差与原数据同量纲
四分位距 IQR
Q3 减 Q1,反映中间 50% 数据,对极端值稳健
变异系数 CV
标准差除以均值,消除量纲,适合跨单位数据比较
选用原则
近似正态用标准差;有极端值或偏态时 IQR 更稳健
两人投篮命中率对应 →集中与离散

命中率都 50%,一个稳在 48-52%,另一个 30%-70% 飘忽——均值一样,离散天差地别

s2=1n1i=1n(xixˉ)2s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2
9第 9 页 · 离散程度参数

样本估计总体规律

前面我们用均值、标准差描述了数百名员工的BMI分布。但全公司有数千名员工,我们想知道的是整体情况。这就需要从样本推断总体。

核心思想
用样本的均值、比例、方差等统计量,去估计总体的真实参数
代表性前提
抽样必须随机,样本才能代表总体;偏倚样本会得出错误结论
常见估计量
样本均值估计总体均值,样本肥胖率估计公司整体肥胖率
抽样误差
估计值与真实值总有差距,但样本量越大,误差越小
置信区间
总体参数以一定概率落入估计值附近的区间,如95%置信区间
品尝一勺汤对应 →样本估计总体

一勺尝出整锅味道——但只尝一口可能偏,搅匀再取样才靠谱

xˉ±zα/2sn\bar{x} \pm z_{\alpha/2} \cdot \frac{s}{\sqrt{n}}
10第 10 页 · 样本估计总体规律

统计推断的或然性

前页我们用样本均值估计了总体均值,但若换一批员工再抽样,结果可能不同。这不是巧合,而是统计推断的根本属性——或然性。

抽样误差不可避免
样本只是总体的一部分,二者的统计量天然存在随机差异
推断给出概率结论
不是「是或否」,而是「在多大可信程度上是或否」
置信水平作门槛
如95%,意味着100次重复抽样中约95次区间包含真值
两类错误并存
α错判为有、β漏判为无,样本量固定时此消彼长
样本量制约精度
n越大,抽样误差越小,结论越可靠
天气预报对应 →统计推断的或然性

降水概率80%不是绝对,但给出可量化可信度供人决策

$\bar{x} \pm z_{\alpha/2} \cdot \dfrac{\sigma}{\sqrt{n}}$
11第 11 页 · 统计推断的或然性

本节要点

  • 统计是闭环流程:问题→抽样→描述→推断,环环相扣
  • BMI中国切点更严(超重24/肥胖28),跨国比较需先换算
  • 集中趋势与离散程度须配对,单参数无法刻画全貌
  • 样本推断永远是概率陈述,置信度不能等同确定性
延伸主题:假设检验与显著性水平相关分析与回归建模肥胖的因果推断与混杂控制
12第 12 页 · 本节要点

课后思考

先自己思考,再看参考答案——三个问题分别检验回顾、应用与迁移能力。

1为什么员工肥胖调查通常采用分层抽样,而非简单随机抽样?

参考答案因为不同部门、性别、年龄段员工的肥胖率差异较大,分层抽样能保证各类员工都有代表,缩小抽样误差、提高估计精度。

2若样本中男女比例严重偏离总体,分层抽样得到的均值还能直接代表全体员工吗?

参考答案可以分层分析,仍能正确估计;但若忽略分层结构、直接合并计算均值,就会因权重偏差高估或低估总体参数。

3把估计的置信度从 95% 提到 99%,所需样本量会怎样变化?调查成本受何影响?

参考答案样本量约增大 1.7 倍。更高置信度要求更宽置信区间或更大样本,调查时间、人力与经费投入都会显著增加。

13第 13 页 · 课后思考