logistic回归分析

官方医学老师·23 页·深入(追求细节与边界)·0 次浏览·2 天前
分类问题概率模型决策边界回归分析

Logistic回归分析

看清线性回归在分类问题上的致命缺陷,掌握logistic回归的概率思维与决策边界

按 空格/→ 演示下一步

1 / 23 页

全部页面点击任意一页,跳回舞台从这页播放

分类问题概率模型决策边界回归分析

Logistic回归分析

看清线性回归在分类问题上的致命缺陷,掌握logistic回归的概率思维与决策边界

1第 1 页 · Logistic回归分析

为什么需要logistic回归

用线性回归预测「会不会生病」时,模型可能给出 -0.2 或 1.3 这样的值——可概率不可能小于 0、也不能大于 1。这是把线性模型硬套在二分类结局上时,最直接的矛盾。

二分类结局
Y 只取 0 或 1,如发病/不发病、流失/不流失
概率有界
真实概率 p 必须满足 0 ≤ p ≤ 1,两端不能越界
线性预测会越界
β₀+β₁X 可输出任意实数,不可避免超出 [0,1]
真实关系是 S 形
X 低时 p 几乎不变,中等时变化最快,高时又趋稳
用直尺量考分对应 →线性回归预测二分类

直尺能量出 150 分或负分,但考分只能在 0~100 之间,边界对不上

p^=β0+β1X却要求 p^[0,1]\hat{p}=\beta_{0}+\beta_{1}X \quad \text{却要求 } \hat{p}\in[0,1]
2第 2 页 · 为什么需要logistic回归

logistic回归的核心思想

线性回归能算出 -30、158 这种没意义的数,但概率只能落在 0 到 1 之间。怎么把任意实数压进 [0,1]?答案是 S 形曲线。

线性输出的困境
线性模型可输出任意实数,没法直接当成概率用
非线性变换的思路
用一个函数把整个实数轴 (-∞,+∞) 映射到 (0,1) 区间
Sigmoid 函数
S 形曲线:两端平、中间陡,单调递增,永远不越过 0 和 1
概率含义
Sigmoid 的输出可直接读作样本属于正类的概率
调光台灯的旋钮对应 →Sigmoid 函数

不管供电电压多大,旋钮输出的亮度都被压在 0~100%,把无界输入挤进有界范围

σ(z)=11+ez\sigma(z) = \frac{1}{1+e^{-z}}
3第 3 页 · logistic回归的核心思想

Sigmoid函数的图像与性质

上一页说logistic回归要把任意实数压到(0,1),靠的就是Sigmoid函数——它长什么样?

两条渐近线
y=0和y=1是上下限,曲线永远碰不到
中心拐点
x=0处y=0.5,斜率最大,转弯最急
中心对称
绕(0,0.5)旋转180°,曲线与自身重合
S型由来
两端走平、中段陡峭,拼起来就是字母S
流行病扩散曲线对应 →Sigmoid曲线

零星感染→暴增→人群饱和后趋平

σ(x)=11+ex\sigma(x) = \frac{1}{1+e^{-x}}
4第 4 页 · Sigmoid函数的图像与性质

Logit变换的意义

上一页 Sigmoid 把整条实数轴压进 [0,1]。现在反过来:手里握着一个概率 p,要把它的「刻度」还原到整条实数线上,才能做线性回归——这正是 Logit 变换要做的事。

Odds 优势比
p/(1-p) 把 [0,1] 映到 [0,+∞);p=0.8 时 odds=4,即 4 次成功 1 次失败
Logit 对数优势
对 odds 取自然对数,把 [0,+∞) 拉到 (-∞,+∞),这就是 logit(p)
线性挂钩成立
logit(p)=β₀+β₁x₁+…+βₙxₙ,概率与特征的线性关系终于建好
被卷起来的卷尺对应 →sigmoid 压卷 / logit 拉平

卷尺压进 [0,1] 只能读百分比;拉平后才是一把普通尺子,可直接做加减乘除

logit(p)=lnp1p=β0+β1x1++βnxn\text{logit}(p)=\ln\frac{p}{1-p}=\beta_0+\beta_1 x_1+\cdots+\beta_n x_n
5第 5 页 · Logit变换的意义

logistic回归的模型表达式

上一页我们把 p/(1-p) 取对数后,竟得到 x 的线性组合——「概率」背后藏着可加可减的结构。现在正式写成完整方程,并逐项拆解每一项的含义。

两种等价形式
logit 形式可线性相加;概率形式经 sigmoid 反变换得到,两者描述同一模型
β0 截距含义
所有自变量取 0 时的对数几率基线,对应概率为 1/(1+e^{-β0})
βj 偏回归系数
控制其余变量后,xj 每增 1 单位,对数几率的变化量
几率比 OR
e^{βj} 表示 xj 增 1 单位时,事件发生的几率所乘上的倍数
线性回归斜率对应 →logistic βj

β 都是「加在某尺度上的增量」;线性回归加在 y 上,logistic 加在 logit 上

lnP1P=β0+β1x1++βpxpP=11+e(β0+β1x1++βpxp)\ln\frac{P}{1-P}=\beta_0+\beta_1 x_1+\cdots+\beta_p x_p \quad\Leftrightarrow\quad P=\frac{1}{1+e^{-(\beta_0+\beta_1 x_1+\cdots+\beta_p x_p)}}
6第 6 页 · logistic回归的模型表达式

模型参数的几何意义

从β出发,看它如何改变Sigmoid曲线的位置与陡峭程度。

图解渲染中…
c1β0控制曲线左右滑动c2|β1|越大曲线越陡d1两参数共同决定曲线形态
7第 7 页 · 模型参数的几何意义

优势比(OR值)的定义与计算

前页说到 β 是 log-odds 的线性斜率。但论文里几乎不直接报 β,而是报一个叫 OR 的倍数——OR=exp(β)。这一节看清它的定义、推导与边界。

Odds 优势/比数
P/(1−P):事件发生与不发生的比例,取值 0~+∞
OR = exp(β₁)
x 增 1 单位时,新 odds / 旧 odds = e^β₁(由 logit 之差推出)
OR 的解读
OR>1 odds 增大,OR<1 odds 减小,OR=1 无效应——是乘性而非加性
数值示例
β₁=0.693 → OR=2(odds 翻倍);β₁=−0.693 → OR=0.5(odds 减半)
年终奖的倍数系数对应 →OR 优势比

月薪 1 万,系数 1.5 → 变 1.5 万;OR=1.5 就是 odds 也乘 1.5

OR=odds(x+1)odds(x)=eβ1OR = \frac{\text{odds}(x+1)}{\text{odds}(x)} = e^{\beta_1}
8第 8 页 · 优势比(OR值)的定义与计算

参数估计方法:最大似然估计

参数估计分四步:先看 OLS 为何失效,再换思路用似然,最后迭代求解。

1
起点:手头有什么
给定样本 (x_i, y_i),目标反推 β 系数
2
OLS 为何失效
二分类残差非正态、方差非齐,BLUE 性质不再成立
3
构造似然函数
每个样本贡献 P(y_i|x_i),连乘得整体观测概率
4
最大化似然
让观测数据出现概率最大的 β 即为最优估计
5
迭代逼近
无解析解,靠梯度下降或牛顿法数值求解
9第 9 页 · 参数估计方法:最大似然估计

回归系数的假设检验

MLE给了我们系数的点估计,但点估计本身不回答"这个变量到底有没有用"。要把"β=0"这个原假设放到检验台上,让三种不同的尺子去量。

Wald检验
看β̂/SE,等价χ²(1);只需MLE结果,最快但β大时偏宽松
似然比检验(LRT)
对比有无该变量的两模型,-2ΔLL~χ²(df);需拟两次,最稳健
计分检验(Score)
基于零假设处的梯度U(0),仅需拟零模型,适合变量筛选
渐近等价、小样本有别
大样本下三者等效;小样本LRT最稳,Wald有Hauck-Donner效应
实际选择
嵌套对比用LRT;单变量筛查用Wald;多参数联合检验用Score
法庭断案三种思路对应 →三种系数检验

Wald=看判决数距0多远;LRT=对比含/不含此证据两套说法;Score=在'无罪'下看证据走向

W=(β^SE(β^))2χ2(1)    Λ=2(01)χ2(q)W=\left(\frac{\hat\beta}{SE(\hat\beta)}\right)^2\sim\chi^2(1)\;\;\Lambda=-2(\ell_0-\ell_1)\sim\chi^2(q)
10第 10 页 · 回归系数的假设检验

模型的拟合优度评价

拿到最大似然估计的系数后,我们还得问一句:这模型到底行不行?判断'行不行'有四把尺子——但请记住,它们只能做相对比较,没有绝对及格线。

偏差Deviance
等于-2倍对数似然,衡量与饱和模型差距,越小拟合越好
皮尔逊卡方
观测与预测差值的平方除以预测后求和,直观但小样本会失真
AIC信息准则
-2L+2k,加入参数惩罚,可用于非嵌套模型比较
BIC贝叶斯准则
-2L+k·ln(n),对复杂度惩罚更狠,大样本更倾向简洁
适用边界
仅相对比较无绝对阈值,结果依赖样本量,常配合H-L检验
裁缝做衣服评分对应 →模型拟合评价

Deviance只测合身度,AIC/BIC还要扣'浪费布料'分,惩罚力度不同结论可能不同

$$AIC = -2L + 2k, \quad BIC = -2L + k\ln(n)$$
11第 11 页 · 模型的拟合优度评价

分类效果评价指标

模型训练完会给每个样本预测一个概率。但概率不是答案——你还得定个门限,比如 0.5 以上算阳性。门限一动,分类结果就变。这一页我们看:怎么系统地评价分类效果。

混淆矩阵
TP/FP/TN/FN 四格计数,所有指标的基石
正确率
(TP+TN)/总数,最直观,但样本不平衡时会骗人
灵敏度与特异度
灵敏度抓真病人、特异度放走真健康人,各看一面
ROC曲线与AUC
不依赖单一阈值的综合评分,AUC 越大越好
体检筛查对应 →分类评价指标

灵敏度对应不漏诊,特异度对应不误诊

$$\text{Accuracy}=\frac{TP+TN}{TP+FP+TN+FN},\quad \text{Sens}=\frac{TP}{TP+FN},\quad \text{Spec}=\frac{TN}{TN+FP}$$
12第 12 页 · 分类效果评价指标

配对设计的特殊需求

前面所有推导都默认样本相互独立。但病例对照研究里,研究者常刻意配对——一个肺癌病人配一个同年龄、同性别、同医院的对照。配对打断了独立性,标准logistic回归处理不了,必须换工具。

配对的目的
让病例与对照在关键混杂变量上相近,减小偏倚
配对的代价
同一对内个体不再独立,违反标准模型假设
标准logistic的盲区
把所有样本混在一起算,丢失配对信息
条件logistic的思路
以匹配组为单位,在组内做比较
条件的妙用
把配对变量的效应吸进条件,参数估计只剩研究因素β
双胞胎的身高对比对应 →条件logistic回归

双胞胎共享基因,只能在同对内部比高低,不能混在一起排名

logPij1Pij=αi+βXij, i=匹配组\log\frac{P_{ij}}{1-P_{ij}} = \alpha_i + \beta X_{ij},\ i=\text{匹配组}
13第 13 页 · 配对设计的特殊需求

条件似然函数原理

沿箭头从左到右读:看条件logistic如何一步步把基线α_i消掉,只留β

图解渲染中…
n3每匹配组写出1病例+M对照的联合似然n4同组所有个体共享同一个基线参数α_in5条件化即对该组所有似然项求和再相除n6最终似然只含β,匹配因素的混杂被消除
14第 14 页 · 条件似然函数原理

条件vs非条件logistic回归对比

配对设计和独立设计,看似都是logistic回归,底层逻辑和参数解释却完全不同。

条件logistic
  • 用于1:1或1:m配对设计数据
  • 每个配对组内部构造条件似然
  • 消去了基线患病率(截距项)
  • 软件需指定配对结构或分层变量
非条件logistic
  • 用于独立观测的横断面或队列数据
  • 用全体样本构建普通似然函数
  • 保留截距项,可估计基线风险
  • 软件直接输入自变量和因变量
配对数据必走条件logistic;独立样本用非条件logistic,否则标准误被低估、结论失真。
15第 15 页 · 条件vs非条件logistic回归对比

logistic回归分析标准流程

从一堆候选变量到能落地的预测模型,四步缺一不可。

1
变量筛选
筛掉无关变量,留下真正影响结局的预测因子
2
模型拟合
用最大似然估计回归系数,建立预测方程
3
模型检验
检验整体显著性、回归系数与拟合优度
4
结果报告
输出OR值与置信区间,给出临床或业务解读
16第 16 页 · logistic回归分析标准流程

变量筛选策略

几十个候选变量摆你面前,怎么挑出最该进模型的?前进、后退、逐步三种策略各有讲究。

前进法
只进不出,逐个纳入显著变量,最简但可能漏掉好变量
后退法
全进再剔除,每次移出不显著变量,稳但要求样本量大
逐步法
进进出出反复筛选,结合两者优势,是最常用的方法
选择依据
样本量小用前进法,候选少用后退法,默认选逐步法
注意事项
P值临界点要预先定好,结果需专业判断,不能纯靠软件
逛超市列购物清单对应 →三种变量筛选策略

空手购物是前进,满载退货是后退,边买边退是逐步

17第 17 页 · 变量筛选策略

SPSS实现logistic回归

spss

SPSS对话框每一步勾选都对应一句语法;点Paste即可把整流程沉淀为可复现的脚本。

代码高亮加载中…

这5个子命令恰好对应对话框「因变量/方法/分类/输出/选项」5个面板;点Paste一键复现。

18第 18 页 · SPSS实现logistic回归

结果解读报告规范

变量筛选做完、模型跑完,SPSS 输出一堆表——但写论文、提交临床报告时,这些结果该按什么格式摆出来?漏一项,审稿人就可能让你补做分析。

回归系数 β
自变量对 logit 的原始作用,正负表方向,绝对值反映强度
OR = exp(β)
把β换算回临床可读的优势比,最常被报告的核心指标
95% 置信区间
OR 的精度范围,下限与上限都不跨过 1 才有统计学意义
Wald χ² 与 P 值
检验该变量系数是否显著不为零,P<0.05 才算入选
标准报告模板
β、SE、Wald、OR、95%CI、P 同列呈现,一行写完一项结果
医院化验单对应 →logistic 回归报告

化验单每项都有「指标+数值+参考范围+异常判断」;回归报告同样缺一项就不完整

OR=eβ,95%CI=(eβ1.96SE,eβ+1.96SE)OR = e^{\beta},\quad 95\%CI = (e^{\beta-1.96SE},\, e^{\beta+1.96SE})
19第 19 页 · 结果解读报告规范

交互作用的识别与处理

从分层OR差异出发,经似然比检验确认,最终分层报告效应。

图解渲染中…
a2各层OR差异>20%或方向相反,提示可能存在交互a5比较含与不含交互项的两个嵌套模型a8按分层变量分别给出各层OR与95%CI
20第 20 页 · 交互作用的识别与处理

核心概念自测

点击作答

在 logistic 回归中,自变量 X 的回归系数 β=0.693(即 OR≈2)。以下哪项是对该 OR 值的正确解读?

21第 21 页 · 核心概念自测

logistic回归知识图谱

  • Logit变换把概率预测转化为线性回归问题
  • 最大似然估计源于结局离散性,比OLS更合理
  • 好模型从系数、拟合、分类、OR四维度评估
  • 配对数据走条件模型,独立观测用非条件
  • 交互或非线性问题,靠变量变换而非盲目加项
延伸主题:多分类logistic回归惩罚回归(LASSO)与高维筛选ROC曲线与诊断界值
22第 22 页 · logistic回归知识图谱

深入思考与延伸探索

先独立思考再看参考答案,三个问题覆盖回顾、应用与边界三个层次。

1为什么logistic回归用最大似然估计而非最小二乘?

参考答案因变量是二分类,不满足OLS的正态与等方差假设;MLE基于伯努利似然,直接针对离散结局建模,参数估计更合理。

2若某混杂因素同时影响暴露与结局却未纳入模型,会发生什么?

参考答案产生混杂偏倚,暴露与结局的真实关联被歪曲。可通过分层分析、倾向性评分或将该变量纳入模型来控制。

3logistic回归能直接处理连续型因变量吗?什么场景该换模型?

参考答案不能。有序结局用有序logistic,多类别用多项logistic,连续正态用线性回归,删失生存数据用Cox模型。

23第 23 页 · 深入思考与延伸探索