生存分析
掌握删失机制、KM 估计、Cox 比例风险与加速失效模型的适用边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
生存分析
掌握删失机制、KM 估计、Cox 比例风险与加速失效模型的适用边界
什么是生存分析
医生随访 100 位肺癌术后患者,想知道他们能活多久。但有人中途失联,有人研究结束时还活着——这些「没看到终点」的人该怎么办?这正是生存分析要回答的核心问题。
灯还在亮不代表不会坏,只是「至今未坏」;生存分析正是用这种「部分信息」反推真实寿命分布
生存时间与事件
上一页我们知道了生存分析关心的是「事件什么时候发生」。要把这件事说清楚,先得固定三个东西:起点、终点,以及它们之间的时间长度。这一页就来拆这三块。
起点=通电瞬间,终点=烧坏瞬间,生存时间=通电到烧坏的时长
删失数据的类型
以观测窗口为参照,看真实事件时间 T* 落在哪,决定删失类型。
Kaplan-Meier估计法
KM估计法把生存曲线拆成一步步的条件概率相乘,删失只影响风险人数。
生存曲线的绘制
从左到右读这张流程图:依次是数据准备、关键量计算、概率累积、阶梯绘制和删失标注。
生存曲线的中位生存期
KM曲线画出来后,盯着它能回答的第一个临床问题就是:这群病人"典型"还能活多久?答案不在曲线最低点,而在它高度刚好降到一半的那个时间。
都是找"恰好一半"对应的位置——分数是一半人低于它,时间则是一半人活不过它
生存曲线类型对比
KM 曲线本就呈阶梯状,关键是判断下降是否陡峭、平台是否稳定,以及两者如何组合。
- 生存率随时间快速下降,早期事件较多
- 曲线可出现连续或多次垂直下降
- 中位生存期往往较短,整体预后偏差
- 提示近期风险高,应关注早期干预
- 生存率长期维持高位,事件发生较少
- 曲线后段接近水平,形成稳定平台
- 中位生存期可能无法实际达到
- 提示长期预后较稳定,但仍非零风险
为什么要比较生存率
看到两条生存曲线明显分开,我们自然会问:这个差异是真实的,还是只是抽样波动?这就需要假设检验。但生存数据有个特殊难点——删失让 t 检验、卡方检验等传统方法全都失效。
不能只看平均续航小时数,要追踪整条放电曲线;中途损坏的电池(删失)必须用专门方法处理
Log-rank检验原理
Log-rank检验的核心:把每个事件时刻的观察死亡数 O 与零假设下的期望死亡数 E 比一比,差距越大说明两组越不像。
Log-rank检验的步骤
顺着箭头读:从假设出发,经统计量计算,到最终决策。
Log-rank vs Breslow
两组曲线看着差不多,两个检验却给出不同 p 值——分歧就在权重。
- 每个时间点权重相等,看全程
- 对远期/晚期差异更敏感
- 适用于比例风险假设成立
- 检验统计量为实际-期望死亡数
- 权重=当期风险人数,越早越重
- 对近期/早期差异更敏感
- 比例风险不成立时更稳健
- 加权版的实际-期望死亡数
Cox模型的基本思想
前面Log-rank只能比较组间生存差异,但临床常需同时控制年龄、性别、分期、治疗等多个混杂因素。Cox模型的精妙在于:用'半参数'结构绕开了最棘手的分布假设。
不必知道基准房租的精确分布,但能精确量化学区、楼层对房租的乘性影响
Cox模型的基本形式
Cox模型把风险函数拆成基线风险与协变量效应两部分,用偏似然绕过基线估计,直接求解回归系数。
比例风险假设
前面用 Cox 模型把协变量转成风险倍率;现在要问:风险倍率会不会随时间改变?
两车速度比全程大致固定,类比任意时点风险比不随时间漂移;并非风险差固定。
Cox模型结果解读
图里三条支线分别判读HR、CI、p值,最后汇成综合结论;右侧f1/f2/f3给出三种典型结局。
Cox模型的R语言实现
用 survival::coxph 在经典肺癌数据上拟合 Cox 模型,并检验比例风险假设。
高亮行串起 Cox 模型「建对象→拟合→检假设→取 HR」的完整链路。
Cox模型自测
Cox比例风险模型中'比例风险'(PH)假设的核心数学含义是?
课后思考
三个问题覆盖三个层次,建议先独立思考,再对照参考答案。
参考答案因为删失数据提供了「至少活到某时点」的部分信息,生存分析通过似然函数把这部分贡献纳入估计;而回归若直接丢弃或填补,等于损失或扭曲了真实信息。
参考答案可能。Log-rank 只看整体曲线分布;Cox 在调整其他协变量后能揭示特定因素的条件效应,这正是 Cox 相对 Log-rank 的增量价值所在。
参考答案可以,但结论会失真。后期交叉意味着风险比随时间变化,违背了 PH 假设;此时应考虑时依赖系数、分段模型或加速失效时间模型。