医学统计学绪论
搞懂统计推断的假设前提、推导逻辑与适用边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
医学统计学绪论
搞懂统计推断的假设前提、推导逻辑与适用边界
什么是医学统计学
新药上市前不会让所有人先试一遍——医生说'有效率 80%',这 80% 怎么得出来的?为什么你愿意相信?这背后就是医学统计学在做的事。
观测站↔样本,数值模型↔统计模型,'降水概率70%'↔'p<0.05'——都用概率量化把握
医学统计学的研究内容
医学统计学的研究内容分三层,由浅入深、从认识数据到预测未知。
医学统计学的应用场景
中心向外三条主干,对应医学统计学落地的三个尺度。
总体与样本的概念
想了解某市所有高血压患者的平均血压,但不可能测量每一个人。怎么办?医学统计学从这群人中抽出一部分,用他们的数据推断整体——这就是「总体」与「样本」要回答的问题。
一勺汤能否代表整锅,关键看锅是否搅匀——这正是随机抽样要解决的事
总体与样本的关系
上一节我们认识了总体和样本。但现实中总体往往太大甚至不可及——比如不可能普查全国每一位高血压患者。我们需要更聪明的办法:从总体中抽出一部分,靠它去推断整体。
搅匀后舀一勺尝味道,用这一勺推整锅;对应随机抽样+统计推断
参数与统计量的定义
上一页我们说用样本推断总体,但具体怎么「推断」?需要先把总体和样本各自量化成数字——参数和统计量就是干这活的。
整湖平均水温是参数(测不到整湖,只能估);杯里测出的水温是统计量(每次舀的位置不同,结果会变)
参数与统计量的区别
μ 和 x̄ 都叫'平均数',但一个是真值、一个是估计。搞混就会把抽样误差当成真实差异。
- 描述总体的固定数值
- 通常未知,需通过样本估计
- 用希腊字母表示:μ、σ、π
- 例:某地全部成年人的平均血压 μ
- 描述样本的可变数值
- 由样本数据直接算出
- 用拉丁字母表示:x̄、s、p
- 例:抽样 200 人算得的平均 x̄
变量与资料分类
参数与统计量建立在数据之上——但数据本身形态各异。血压可测到 145.5,血型只能是 A/B/AB/O,肿瘤分期只能是 I/II/III/IV。形态决定方法,这就是资料分类的根本问题。
重量是定量(称重),目的地是无序(无先后),优先级是有序(按等级派送)
误差与偏倚的概念
随机误差、系统误差及其控制方法
概率与频率的关系
翻开药品说明书,『不良反应发生率 5%』是概率还是频率?它从哪来?上一页我们区分了参数与统计量,而概率与频率正是这对关系在随机事件上的具体投影。
概率是固定的靶心;每次试验的频率是一颗弹孔,会偏离但围绕靶心聚集
基本概念的逻辑关系
从总体出发、走完"用样本推断总体"这一闭环的四个关键环节。
研究设计
研究设计是研究启动前的规划阶段,五步环环相扣,决定后续分析的方向与可信度。
资料收集
资料收集不是到了现场才开始——前期的设计与后期的核查,同样决定了数据能不能用。
资料整理
原始问卷收上来后不能直接分析,必须先清洗、编码、双重录入和核查,把脏数据变成干净数据库。
资料分析
资料分析是统计工作的核心环节,分四步递进推进:从看清数据,到判断差异,再到估计总体,最后处理多变量关系。
结果呈现与报告
结果呈现不是把软件输出原样贴上去,而是按读者最舒服的顺序分层落地。
知识点回顾与对比总结
- ✓核心概念多成对出现:总体/样本、参数/统计量、频率/概率
- ✓研究流程是闭环:设计→收集→整理→分析→呈现
- ✓易混对偶的边界:误差随机、偏倚系统;频率经验、概率理论
- ✓学科定位:从设计到呈现全程介入,不只是分析工具
课后思考
先合上书想,再对照参考答案——答案不唯一,重点是思考路径。
参考答案源于抽样分布理论。统计量围绕参数波动,可靠性由置信区间与显著性水平刻画;小样本或非随机抽样时边界会显著收缩。
参考答案很难。系统误差(偏倚)发生在数据生成阶段,统计方法只能描述、调整或量化其影响,无法真正消除;分析阶段的补救非常有限。
参考答案不能。涉及价值判断、个体特异性、医患沟通的决策,需要结合临床经验、人文伦理与情境考量,统计学只提供量化证据。