判别分析

官方医学老师·20 页·深入(追求细节与边界)·0 次浏览·2 天前
统计学习多元统计分类方法模型边界

判别分析

搞懂Fisher、最大似然、Bayes与逐步判别的原理与边界

按 空格/→ 演示下一步

1 / 20 页

全部页面点击任意一页,跳回舞台从这页播放

统计学习多元统计分类方法模型边界

判别分析

搞懂Fisher、最大似然、Bayes与逐步判别的原理与边界

1第 1 页 · 判别分析

什么是判别分析

上一页我们看到判别分析在信用风控、医学诊断、人脸识别里都有身影——它底层的动作到底是什么?这页拆三件事。

起点:带标签样本
必须先有一批已知类别的样本作为「教材」,监督学习的入场券
中间:学一条规则
从样本里提炼「什么特征组合对应哪一类」的判别准则
终点:给新样本归类
用学到的规则,对类别未知的样本判定它属于哪一类
邮局分拣员分拣信件对应 →判别分析

分拣员见过无数信件学会「看邮编分地区」,新信件按地址进对应格——判别分析就是数据世界里的分拣员

$$P(Y=k\mid X=x)\,\propto\,P(X=x\mid Y=k)\,P(Y=k)$$
2第 2 页 · 什么是判别分析

判别分析的医学诊断类比

判别分析的核心是「拿特征猜归属」——听起来还是有点抽象。其实医生每天都在做这件事:根据你的症状,判断你得的是哪种病。

症状 = 指标
医生看到的化验值、体征就是判别分析里的特征变量 X
疾病 = 类别
病人最终归属的诊断结论(流感、肺炎、健康)就是分组
诊断经验 = 判别函数
医生脑中「发烧+咳嗽+白细胞高→感染」的判断,就是统计判别式
医生根据症状判断疾病对应 →判别分析

症状→指标、疾病→类别、临床经验→从样本学到的判别函数

y=w1x1+w2x2++wkxk+by = w_1 x_1 + w_2 x_2 + \cdots + w_k x_k + b
3第 3 页 · 判别分析的医学诊断类比

判别分析的基本流程

沿箭头从左到右读:训练样本如何一步步加工成新样本的分类结果。

图解渲染中…
a1已标注类别的历史数据,作为学习起点b1从样本中估计出区分各类别的数学表达式c1依据函数值的大小,定下归类的判据
4第 4 页 · 判别分析的基本流程

Fisher判别的核心思想

上一页讲了判别分析的基本流程,这一页钻进数学内核——Fisher当年怎么想到把高维数据"压扁"到一条直线上分类?答案藏在他给"最佳"下的精确定义里。

高维投影到一维
把多维特征压缩成一个分数,用分数高低判断类别
寻找投影方向
不是随便压,要选一个让分类效果最好的方向
类间尽量分开
不同类别的均值投影后距离最大化
类内尽量紧凑
同类样本投影后方差最小化,避免被自己人"稀释"
手电筒照两群人对应 →Fisher寻找投影方向

手电筒角度决定两群人影子在墙上分多开,对应Fisher找让类别分得最开的那个方向

J(w)=wTSBwwTSWwJ(w) = \dfrac{w^T S_B w}{w^T S_W w}
5第 5 页 · Fisher判别的核心思想

Fisher判别的几何解释

从左到右读:投影前→求投影方向→投影后。关注最右两栏方差的变化。

图解渲染中…
a3类内散度Sw:同类样本围绕均值的离散程度a4类间散度Sb:两类均值之间的距离度量a5w∝Sw⁻¹(μ₁-μ₂),使Rayleigh商J(w)=Sb/Sw最大a7投影到1维直线后,两类在直线上拉开
6第 6 页 · Fisher判别的几何解释

Fisher判别函数的构建

上一页我们看到,投影方向就是几何空间里那条「最能拉开两类」的轴。现在把这句直觉写成数学——让它能算、能解。

目标:瑞利商
分子度量类间差异、分母度量类内差异,最大化它们的比值
类间散度矩阵
两类均值向量差的外积,量化两类的中心距离
类内散度矩阵
每类内部样本到本类均值偏差的外积之和
广义特征值问题
对瑞利商求导令其为零,化简为矩阵方程
最优投影方向
解为 w ∝ S_W⁻¹(μ₁ − μ₂),方向被类内矩阵修正过
收音机的信噪比对应 →类间/类内差异比

信号是类间差异、噪声是类内差异;挑放大信号、压噪声的方向

J(w)=wSBwwSWw,SW1SBw=λwJ(\mathbf{w}) = \dfrac{\mathbf{w}^\top S_B \mathbf{w}}{\mathbf{w}^\top S_W \mathbf{w}},\quad S_W^{-1} S_B \mathbf{w} = \lambda \mathbf{w}
7第 7 页 · Fisher判别函数的构建

Fisher判别的计算步骤

Fisher 判别的计算分五步:从均值出发,构造矩阵,求解广义特征值,得到投影方向。

1
计算类均值向量
对每类样本取平均,得到各类中心 μ_k
2
计算类内离差矩阵
各类样本到均值的偏差平方和,构成 S_w
3
计算总体离差矩阵
再由 S_t − S_w 间接得到类间矩阵 S_b
4
求解广义特征值
解 S_b w = λ S_w w,找最优投影方向
5
投影得到判别函数
取前 d 个特征向量投影样本,用于分类
8第 8 页 · Fisher判别的计算步骤

最大似然法的原理

Fisher判别靠几何投影划分人群,不依赖分布假设。但如果我们已经知道各人群服从某种概率分布——比如多元正态——能否直接算"这个样本来自哪个总体最合理"?最大似然法正是这条路。

分布假设
假设每个总体服从已知概率分布,最常见的是多元正态N(μᵢ, Σᵢ)
似然值计算
样本x在总体i下的概率密度值fᵢ(x),就是它对第i类的似然Lᵢ(x)
最大似然归属
比较L₁(x)、L₂(x)、…、Lₖ(x),取最大者对应的总体作为判别结果
与Fisher互补
概率视角直接、可结合先验;几何视角无需分布假设,两者适用场景不同
三个抽奖箱对应 →最大似然判别

各箱红蓝球比例不同=各总体分布不同;摸出红球=观测样本;比哪箱红球比例最高=比似然值大小

Li(x)=1(2π)p/2Σi1/2exp(12(xμi)Σi1(xμi))L_i(x)=\frac{1}{(2\pi)^{p/2}|\Sigma_i|^{1/2}}\exp\left(-\frac{1}{2}(x-\mu_i)^\top\Sigma_i^{-1}(x-\mu_i)\right)
9第 9 页 · 最大似然法的原理

最大似然判别的计算流程

四步把一个新样本归到最像它的总体——估参数、写密度、代样本、比归类。

1
估计总体参数
用训练样本算出各总体的均值向量与协方差矩阵
2
写出密度函数
假设各总体服从多元正态,写出概率密度表达式
3
代入计算似然
把待判样本 x 代入各密度函数,得到各总体的似然值
4
比较并归类
选似然值最大的总体,把 x 划入那一类
10第 10 页 · 最大似然判别的计算流程

最大似然法 vs Fisher判别法

概率学派vs几何学派:适用场景与分布假设差异

最大似然法 vs Fisher判别
概率学派vs几何学派:适用场景与分布假设差异
11第 11 页 · 最大似然法 vs Fisher判别法

Bayes公式回顾

前面 Fisher 和最大似然各有各的做法,但它们其实都站在同一个更基本的公式肩膀上——Bayes 公式。这一页把它翻出来,认认每个零件。

先验概率 P(ωᵢ)
看到数据 x 之前,对类别的初步信念
似然度 P(x|ωᵢ)
已知类别 ωᵢ 时,观测到 x 的可能性
边缘概率 P(x)
x 在全部类别下出现的总概率,做归一化分母
后验概率 P(ωᵢ|x)
看到数据 x 之后,样本属于 ωᵢ 的更新后信念
判别决策
后验概率最大者胜出,等价于最小错误率判别
新冠核酸检测对应 →Bayes 公式

发病率=先验,灵敏度=似然,阳性总人数=证据,阳性中真患病率=后验

P(ωix)=P(xωi)P(ωi)P(x)P(\omega_i|x) = \frac{P(x|\omega_i) \cdot P(\omega_i)}{P(x)}
12第 12 页 · Bayes公式回顾

Bayes判别法的思想

上一页的Bayes公式是一座桥:正向是'因→果',反向是'果→因'。判别法正是走反向通道——已知一个样本,反推它最可能来自哪个类别。

核心思想
把先验(历史经验)和似然(样本特征)相乘,作为判别依据
先验 P(G_k)
各类别在总体中出现的已知概率,反映历史比例
似然 P(x|G_k)
在某类别条件下,观测到当前样本x出现的概率
后验 P(G_k|x)
看到样本x后,它属于G_k的概率,是最终判别依据
误判代价
不同类别错判损失不同,纳入后形成最小风险判别
法官量刑对应 →贝叶斯判别

先验=类似案件历史判决倾向;似然=当前案件证据强度;后验=综合量刑结果

P(Gkx)=P(xGk)P(Gk)P(x)P(G_k \mid x) = \dfrac{P(x \mid G_k)\,P(G_k)}{P(x)}
13第 13 页 · Bayes判别法的思想

Bayes判别的计算步骤

Bayes判别按贝叶斯公式分四步走完分类闭环。

1
确定先验概率
依据经验或样本频率估计各类别出现概率
2
计算似然函数
估计新样本特征在每类下的概率密度取值
3
求后验概率
代入贝叶斯公式得到样本属于各类的概率
4
按最大归类
选后验概率最大的类别作为判别结果
14第 14 页 · Bayes判别的计算步骤

为什么要逐步判别

前面已经算出了判别分数,但若把几十项检查都塞进模型,公式会变重,参数也会随样本轻微变化。逐步判别先要回答的不是“能不能算”,而是“哪些变量值得算”。

维数膨胀
变量越多,矩阵求逆和距离计算越复杂;样本量不足时,协方差估计还会明显不稳
逐步筛选
按变量对组间分离的增量逐个取舍,以统计门槛控制变量进入或移出
收益与边界
它可改善计算、稳定性与解释性,但由当前样本选出的变量未必适用于新样本
整理出差行李对应 →逐步筛选变量

只带真正需要的物品,并逐件检查是否提供新信息;冗余越多,整理越重且越易受干扰

Λ=WT,Λ组间分离相对增强\Lambda=\frac{|W|}{|T|},\quad \Lambda\downarrow\Rightarrow\text{组间分离相对增强}
15第 15 页 · 为什么要逐步判别

逐步判别的筛选过程

逐步判别像变量选秀,每轮检验进出,直到模型只剩真有判别力的变量。

1
准备检验工具
选Wilks Lambda配F检验,设F引入与F剔除两套阈值
2
引入最显著变量
对每个候选做F检验,p最小且过F_in者进入模型
3
回检已入模变量
新变量入模后,原变量偏F检验可能不再显著
4
剔除不显著变量
把不满足F_out阈值的变量移出当前模型
5
迭代直到稳定
重复引入-回检-剔除循环,直到无变量再进出
16第 16 页 · 逐步判别的筛选过程

变量筛选的准则

上页我们看到了逐步判别「先放进去看看效果、不行就拿掉」的过程。但每一步该听谁的指挥?变量留还是不留,不是凭感觉,需要一把客观的尺子——F 统计量。

F 统计量作尺
衡量某个变量加入后,分类能力提升是否显著,相当于给变量打一个「贡献分」。
引入门槛 F_in
算出的 F 大于 F_in,才把候选变量纳入判别函数。
剔除门槛 F_out
已进入函数的变量,F 小于 F_out 才被请出去。
双门槛防震荡
F_in 严格大于 F_out,进出标准不一样,避免变量反复进出。
公司招聘与裁员的双重门槛对应 →变量引入与剔除的 F 检验

录用分数要高才招入,解雇分数要更低才劝退,中间地带保持现状

F=(ngp+1)(Λp1Λp)ΛpF = \frac{(n-g-p+1)(\Lambda_{p-1} - \Lambda_{p})}{\Lambda_{p}}
17第 17 页 · 变量筛选的准则

四种判别方法的对比

  • 方法选择取决于三大要素:分布假设、样本量、先验信息
  • Fisher 不依赖分布假设,稳健但未利用先验
  • Bayes 引入先验可弥补样本不足的短板
  • 逐步判别以筛选换取低维稳定判别
  • 判别效果需用留一或交叉验证客观评估
延伸主题:二次判别与正则化判别判别在机器学习中的对应
18第 18 页 · 四种判别方法的对比

核心概念自测

点击作答

关于Fisher判别、似然判别与Bayes判别的判别准则本质区别,下列哪项描述正确?

19第 19 页 · 核心概念自测

深入思考

先合上屏幕,给三个问题各自想一分钟,再点开参考答案。

1Fisher判别与Bayes判别都在做分类,二者的判别准则在优化目标上有什么本质区别?

参考答案提示:Fisher找的是让类间距离/类内距离最大化的投影方向;Bayes比较的是各类下的后验概率大小。前者纯几何、无分布假设,后者依赖先验与协方差阵的设定。

2若一个临床诊断问题中,训练样本仅50例而候选自变量有15个,你会优先选哪种判别方法?理由是什么?

参考答案提示:先做变量筛选(逐步判别把15个压到几个稳健变量);再看方法——样本/变量比小时,Fisher比Bayes更稳健,因为Bayes对协方差阵的估计敏感。实际取舍可结合临床先验。

3当各类别的协方差矩阵严重不等、或类别样本量极不均衡时,前面学到的哪些方法假设会被破坏?结果还可信吗?

参考答案提示:Fisher要求各类协方差阵相等——这一条会破坏;Bayes虽可容纳异方差,但样本太少时估计仍不稳;样本不均衡使先验失效,需重赋权或重采样。这正是'没有万能判别'的体现。

20第 20 页 · 深入思考