聚类分析
搞懂距离度量、聚类算法、效果评估,附算法边界与常见踩坑
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
聚类分析
搞懂距离度量、聚类算法、效果评估,附算法边界与常见踩坑
什么是聚类分析
前页已经提过聚类分析,但它具体做什么?想象整理衣柜:没人规定怎么分,你按颜色、季节或款式自己定标准,把相似的衣服归到一起——聚类分析就是让算法替你完成这件事。
你(算法)自己定义'相似',按颜色/季节把衣服(数据)归成几堆(簇),没人提前告诉你类别
聚类 vs 分类
两个常被混用的词,核心区别在于"有没有答案"——一个闭眼找结构,一个睁眼做预测。
- 无监督学习,不给标准答案
- 目的:探索数据中隐藏的分组
- 输入:只有特征,没有标签
- 输出:算法自动产生的"簇"
- 有监督学习,提供带标签样本
- 目的:预测新样本属于哪一类
- 输入:特征 + 已知类别标签
- 输出:预定义的类别标签
聚类分析的基本思想
上一页我们看到,聚类没有标签也能分组。那它凭什么判断哪些该归一堆、哪些该分开?答案藏在一个我们日常整理东西时就在用的直觉里。
T恤归一堆、外套归一堆——同类挨着摆、异类隔开放
Q型聚类与R型聚类
样品聚类与指标聚类的应用场景
距离的概念
上一页我们把聚类归结为'按远近分组'。那'远'和'近'用什么尺子量?最直观的是几何距离,但真实数据常让它失效——这一页看它从几何走向统计的扩展。
平原假设各向同性;马氏距离按协方差'重塑空间',把椭球拉成球后再量距离——这正是白化的几何含义
常用距离公式
欧氏距离、马氏距离、兰氏距离等
相似系数
上页的距离回答'差多远',但很多场景我们更想直接问'多像'——比如两篇文章是否谈同一话题,长度差异不重要,方向一致才关键。这就轮到相似系数登场。
一人追100集一人追10集,都冲着同一剧情——方向一致即相似
系统聚类法原理
上一页搞定了距离怎么算——但算完距离只是工具。这一页要把距离用起来:面前摆着一堆散落的样品,究竟怎么一步步把它们组织成有结构的群体?
碎片散落=各自独立成类;最匹配两块先拼=合并最近两类;最终拼成完整图=归为一类
系统聚类法示意图
从左到右看:5个样本每次合并距离最近的一对,依次合并4次,最终归并成一个总类,形成一棵倒长的聚类树。
类间距离计算方法
上一节我们说系统聚类每一步都把'最近的两类'合并。可一旦每个类里装了好几个样本,两个类之间的'距离'该怎么定义?这一步选不同方法,聚出来的形状会差很多——有的拉成长链,有的挤成球。
最短=两班同学最近的一对;最长=最远的一对;类平均=所有同学两两配对的平均
八种合并策略对比
按「用什么定义合并」把8种方法分两支,逐支对比读
系统聚类法步骤
无论选用哪种合并策略,系统聚类都沿同一条循环主线推进:算距、合并、重算、迭代。
树状图的解读
如何从树状图确定最佳分类数
动态聚类法原理
系统聚类像「盖棺定论」——样本一旦归入某类就再不能翻身。动态聚类不一样:它允许样本在迭代中「跳槽」,不断调整直到稳定。
指定几位楼长→业主归入最近楼长→楼长搬到所辖业主平均位置→稳定后定片
K-means算法步骤
K-means靠"分配-更新"循环把数据划成K簇,四步缺一不可。
K-means迭代过程
用流程图呈现K-means核心循环:分配→更新→判收敛,直到簇心不再移动。
初始中心的选择
K-means 迭代前必须先选 K 个起点。起点不同,最终分簇可能天差地别——这一步往往决定了结果的好坏。
第一个代表随便派,之后每个代表都优先派到离现有代表最远的地方,保证覆盖不同区域
K值的确定方法
选完初始中心,又来一个坎:K 本身怎么定?数据没有标签,分几类合理本就是个谜。三种方法从不同角度帮你「猜」K。
低层挤,加层改善大;到某层后再加改善微弱,多花的钱就不值——那个拐点就是肘部
系统聚类 vs K-means
都是聚类,却走向完全不同的路:一个自底向上垒塔,一个迭代画圈。选错方法,结果可能天差地别。
- 层次方法,自底向上逐层合并
- 无需指定K,画完树再决定
- 输出一棵完整树状图
- 适合小数据,结果确定可复现
- 划分方法,迭代重画簇的边界
- 必须先给定K才开跑
- 直接给出K个簇的归属
- 适合大数据,但受初始中心影响
聚类质量评价
前面我们学会了怎么跑K-means、怎么画树状图,但跑完以后呢?分出来的结果到底靠不靠谱?不同K值选出来的方案到底谁更好?这就需要一套客观的评价标准。
类内离差=组内分歧大小;轮廓系数=本组比邻组更合拍的程度;ARI=新分组与标准答案的吻合率
知识点自测
3道选择题验证核心理解
课程总结
- ✓聚类是无监督分组,没有标准答案,合理性靠业务解读
- ✓度量选择就是定义问题——距离公式决定了你看见什么形状
- ✓系统聚类给层级全貌,K-means求快速收敛,各有所长
- ✓K-means 对初始中心与 K 值敏感,多次运行取最优是常规做法
- ✓没有最优聚类,只有内紧外稳、指标与业务共同支撑的合理聚类
课后思考
三道课后思考题,先自己琢磨再看参考答案,带着问题继续深入。
参考答案它默认簇是「球状、紧凑、大小相近」的。若数据是环状、大小悬殊或条带状,这一准则会把同一类拆散,把不同类强行合并。
参考答案看数据量与 K 是否已知。样本少、不知道几类——系统聚类看树状图;样本大、领域经验能定 K——K-means 更快。可先用肘部法则估计 K。
参考答案聚类无监督,没有「正确答案」。距离公式就是你对「相似」的定义——选哪个,取决于业务语义,而非数学对错。这也是评价指标的用武之地。