Logistic回归分析
看清线性回归在分类问题上的致命缺陷,掌握logistic回归的概率思维与决策边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
Logistic回归分析
看清线性回归在分类问题上的致命缺陷,掌握logistic回归的概率思维与决策边界
为什么需要logistic回归
用线性回归预测「会不会生病」时,模型可能给出 -0.2 或 1.3 这样的值——可概率不可能小于 0、也不能大于 1。这是把线性模型硬套在二分类结局上时,最直接的矛盾。
直尺能量出 150 分或负分,但考分只能在 0~100 之间,边界对不上
logistic回归的核心思想
线性回归能算出 -30、158 这种没意义的数,但概率只能落在 0 到 1 之间。怎么把任意实数压进 [0,1]?答案是 S 形曲线。
不管供电电压多大,旋钮输出的亮度都被压在 0~100%,把无界输入挤进有界范围
Sigmoid函数的图像与性质
上一页说logistic回归要把任意实数压到(0,1),靠的就是Sigmoid函数——它长什么样?
零星感染→暴增→人群饱和后趋平
Logit变换的意义
上一页 Sigmoid 把整条实数轴压进 [0,1]。现在反过来:手里握着一个概率 p,要把它的「刻度」还原到整条实数线上,才能做线性回归——这正是 Logit 变换要做的事。
卷尺压进 [0,1] 只能读百分比;拉平后才是一把普通尺子,可直接做加减乘除
logistic回归的模型表达式
上一页我们把 p/(1-p) 取对数后,竟得到 x 的线性组合——「概率」背后藏着可加可减的结构。现在正式写成完整方程,并逐项拆解每一项的含义。
β 都是「加在某尺度上的增量」;线性回归加在 y 上,logistic 加在 logit 上
模型参数的几何意义
从β出发,看它如何改变Sigmoid曲线的位置与陡峭程度。
优势比(OR值)的定义与计算
前页说到 β 是 log-odds 的线性斜率。但论文里几乎不直接报 β,而是报一个叫 OR 的倍数——OR=exp(β)。这一节看清它的定义、推导与边界。
月薪 1 万,系数 1.5 → 变 1.5 万;OR=1.5 就是 odds 也乘 1.5
参数估计方法:最大似然估计
参数估计分四步:先看 OLS 为何失效,再换思路用似然,最后迭代求解。
回归系数的假设检验
MLE给了我们系数的点估计,但点估计本身不回答"这个变量到底有没有用"。要把"β=0"这个原假设放到检验台上,让三种不同的尺子去量。
Wald=看判决数距0多远;LRT=对比含/不含此证据两套说法;Score=在'无罪'下看证据走向
模型的拟合优度评价
拿到最大似然估计的系数后,我们还得问一句:这模型到底行不行?判断'行不行'有四把尺子——但请记住,它们只能做相对比较,没有绝对及格线。
Deviance只测合身度,AIC/BIC还要扣'浪费布料'分,惩罚力度不同结论可能不同
分类效果评价指标
模型训练完会给每个样本预测一个概率。但概率不是答案——你还得定个门限,比如 0.5 以上算阳性。门限一动,分类结果就变。这一页我们看:怎么系统地评价分类效果。
灵敏度对应不漏诊,特异度对应不误诊
配对设计的特殊需求
前面所有推导都默认样本相互独立。但病例对照研究里,研究者常刻意配对——一个肺癌病人配一个同年龄、同性别、同医院的对照。配对打断了独立性,标准logistic回归处理不了,必须换工具。
双胞胎共享基因,只能在同对内部比高低,不能混在一起排名
条件似然函数原理
沿箭头从左到右读:看条件logistic如何一步步把基线α_i消掉,只留β
条件vs非条件logistic回归对比
配对设计和独立设计,看似都是logistic回归,底层逻辑和参数解释却完全不同。
- 用于1:1或1:m配对设计数据
- 每个配对组内部构造条件似然
- 消去了基线患病率(截距项)
- 软件需指定配对结构或分层变量
- 用于独立观测的横断面或队列数据
- 用全体样本构建普通似然函数
- 保留截距项,可估计基线风险
- 软件直接输入自变量和因变量
logistic回归分析标准流程
从一堆候选变量到能落地的预测模型,四步缺一不可。
变量筛选策略
几十个候选变量摆你面前,怎么挑出最该进模型的?前进、后退、逐步三种策略各有讲究。
空手购物是前进,满载退货是后退,边买边退是逐步
SPSS实现logistic回归
SPSS对话框每一步勾选都对应一句语法;点Paste即可把整流程沉淀为可复现的脚本。
这5个子命令恰好对应对话框「因变量/方法/分类/输出/选项」5个面板;点Paste一键复现。
结果解读报告规范
变量筛选做完、模型跑完,SPSS 输出一堆表——但写论文、提交临床报告时,这些结果该按什么格式摆出来?漏一项,审稿人就可能让你补做分析。
化验单每项都有「指标+数值+参考范围+异常判断」;回归报告同样缺一项就不完整
交互作用的识别与处理
从分层OR差异出发,经似然比检验确认,最终分层报告效应。
核心概念自测
在 logistic 回归中,自变量 X 的回归系数 β=0.693(即 OR≈2)。以下哪项是对该 OR 值的正确解读?
logistic回归知识图谱
- ✓Logit变换把概率预测转化为线性回归问题
- ✓最大似然估计源于结局离散性,比OLS更合理
- ✓好模型从系数、拟合、分类、OR四维度评估
- ✓配对数据走条件模型,独立观测用非条件
- ✓交互或非线性问题,靠变量变换而非盲目加项
深入思考与延伸探索
先独立思考再看参考答案,三个问题覆盖回顾、应用与边界三个层次。
参考答案因变量是二分类,不满足OLS的正态与等方差假设;MLE基于伯努利似然,直接针对离散结局建模,参数估计更合理。
参考答案产生混杂偏倚,暴露与结局的真实关联被歪曲。可通过分层分析、倾向性评分或将该变量纳入模型来控制。
参考答案不能。有序结局用有序logistic,多类别用多项logistic,连续正态用线性回归,删失生存数据用Cox模型。