判别分析
搞懂Fisher、最大似然、Bayes与逐步判别的原理与边界
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
判别分析
搞懂Fisher、最大似然、Bayes与逐步判别的原理与边界
什么是判别分析
上一页我们看到判别分析在信用风控、医学诊断、人脸识别里都有身影——它底层的动作到底是什么?这页拆三件事。
分拣员见过无数信件学会「看邮编分地区」,新信件按地址进对应格——判别分析就是数据世界里的分拣员
判别分析的医学诊断类比
判别分析的核心是「拿特征猜归属」——听起来还是有点抽象。其实医生每天都在做这件事:根据你的症状,判断你得的是哪种病。
症状→指标、疾病→类别、临床经验→从样本学到的判别函数
判别分析的基本流程
沿箭头从左到右读:训练样本如何一步步加工成新样本的分类结果。
Fisher判别的核心思想
上一页讲了判别分析的基本流程,这一页钻进数学内核——Fisher当年怎么想到把高维数据"压扁"到一条直线上分类?答案藏在他给"最佳"下的精确定义里。
手电筒角度决定两群人影子在墙上分多开,对应Fisher找让类别分得最开的那个方向
Fisher判别的几何解释
从左到右读:投影前→求投影方向→投影后。关注最右两栏方差的变化。
Fisher判别函数的构建
上一页我们看到,投影方向就是几何空间里那条「最能拉开两类」的轴。现在把这句直觉写成数学——让它能算、能解。
信号是类间差异、噪声是类内差异;挑放大信号、压噪声的方向
Fisher判别的计算步骤
Fisher 判别的计算分五步:从均值出发,构造矩阵,求解广义特征值,得到投影方向。
最大似然法的原理
Fisher判别靠几何投影划分人群,不依赖分布假设。但如果我们已经知道各人群服从某种概率分布——比如多元正态——能否直接算"这个样本来自哪个总体最合理"?最大似然法正是这条路。
各箱红蓝球比例不同=各总体分布不同;摸出红球=观测样本;比哪箱红球比例最高=比似然值大小
最大似然判别的计算流程
四步把一个新样本归到最像它的总体——估参数、写密度、代样本、比归类。
最大似然法 vs Fisher判别法
概率学派vs几何学派:适用场景与分布假设差异
Bayes公式回顾
前面 Fisher 和最大似然各有各的做法,但它们其实都站在同一个更基本的公式肩膀上——Bayes 公式。这一页把它翻出来,认认每个零件。
发病率=先验,灵敏度=似然,阳性总人数=证据,阳性中真患病率=后验
Bayes判别法的思想
上一页的Bayes公式是一座桥:正向是'因→果',反向是'果→因'。判别法正是走反向通道——已知一个样本,反推它最可能来自哪个类别。
先验=类似案件历史判决倾向;似然=当前案件证据强度;后验=综合量刑结果
Bayes判别的计算步骤
Bayes判别按贝叶斯公式分四步走完分类闭环。
为什么要逐步判别
前面已经算出了判别分数,但若把几十项检查都塞进模型,公式会变重,参数也会随样本轻微变化。逐步判别先要回答的不是“能不能算”,而是“哪些变量值得算”。
只带真正需要的物品,并逐件检查是否提供新信息;冗余越多,整理越重且越易受干扰
逐步判别的筛选过程
逐步判别像变量选秀,每轮检验进出,直到模型只剩真有判别力的变量。
变量筛选的准则
上页我们看到了逐步判别「先放进去看看效果、不行就拿掉」的过程。但每一步该听谁的指挥?变量留还是不留,不是凭感觉,需要一把客观的尺子——F 统计量。
录用分数要高才招入,解雇分数要更低才劝退,中间地带保持现状
四种判别方法的对比
- ✓方法选择取决于三大要素:分布假设、样本量、先验信息
- ✓Fisher 不依赖分布假设,稳健但未利用先验
- ✓Bayes 引入先验可弥补样本不足的短板
- ✓逐步判别以筛选换取低维稳定判别
- ✓判别效果需用留一或交叉验证客观评估
核心概念自测
关于Fisher判别、似然判别与Bayes判别的判别准则本质区别,下列哪项描述正确?
深入思考
先合上屏幕,给三个问题各自想一分钟,再点开参考答案。
参考答案提示:Fisher找的是让类间距离/类内距离最大化的投影方向;Bayes比较的是各类下的后验概率大小。前者纯几何、无分布假设,后者依赖先验与协方差阵的设定。
参考答案提示:先做变量筛选(逐步判别把15个压到几个稳健变量);再看方法——样本/变量比小时,Fisher比Bayes更稳健,因为Bayes对协方差阵的估计敏感。实际取舍可结合临床先验。
参考答案提示:Fisher要求各类协方差阵相等——这一条会破坏;Bayes虽可容纳异方差,但样本太少时估计仍不稳;样本不均衡使先验失效,需重赋权或重采样。这正是'没有万能判别'的体现。