过程挖掘:从数据到洞察
看完你能亲手从事件日志还原真实流程并定位偏差根源
按 空格/→ 演示下一步
全部页面点击任意一页,跳回舞台从这页播放
过程挖掘:从数据到洞察
看完你能亲手从事件日志还原真实流程并定位偏差根源
什么是过程挖掘
上一页我们看到,IT 系统每天都在记录海量操作数据。但光看这些数据本身,没人能直接告诉你'业务到底是怎么跑的'。过程挖掘要做的事,就是从日志里把真实流程'画'出来。
黑匣子记录每次操作的'谁、几点、做了什么',事后能完整还原飞行轨迹
事件日志的结构
想象你打客服投诉一单外卖。客服先问订单号,再问"什么时候下的单、中间出了什么问题"——这三项信息凑齐,一条事件日志就成型了。
病历的"患者编号-检查项目-检查日期"对应"案例ID-活动-时间戳"
过程挖掘的输入与输出
沿箭头方向读:左上事件日志出发,往右下走完分叉分析,落到可执行流程再回流。
过程挖掘三大任务
有了事件日志,接下来能做什么?过程挖掘回答了三类问题:流程长什么样、实际跑偏没、还能怎么改。
记录车迹画路线图=发现,比对规划找违章=一致性检查,叠加拥堵更新路况=增强
发现-重构-增强的区分
左输入、中任务、右输出,三条链路横向对比三种任务的输入输出差异。
ProM框架
前几页讲了过程挖掘的几类任务和算法。但这么多算法,跑在哪里、谁来兜底?答案是 ProM——埃因霍温理工大学主导的开源框架。
商店只提供下载入口和运行环境,真正干活的是第三方App
PM4Py库
ProM 启动慢、和 Python 数据栈割裂。要在 Python 里做过程挖掘,PM4Py 是绕不开的——它把三大任务装进 Pythonic API。
工坊啥都有但启动慢,工具箱精选主流算法、贴 Python 流程
ProM vs PM4Py
ProM 是点鼠标的桌面软件,PM4Py 是写代码的 Python 库——一个让人「看」,一个让人「做」。
- 形态:桌面 GUI 应用,靠点击和拖拽操作
- 场景:探索分析、教学演示、快速原型
- 扩展:通过插件市场安装各类算法包
- 形态:Python 库,靠 import 与函数调用
- 场景:自动化批处理、生产流水线、系统集成
- 扩展:与 pandas、sklearn 等生态无缝衔接
PM4Py快速上手
5行核心代码,从XES日志直出Petri网模型
『读日志-挖模型-看模型』三步走,Alpha算法封装在一行调用里,把研究代码变成即用工具。
其他工具概览
ProM 与 PM4Py 是开源‘框架级’工具,要写代码才能用。企业实战更需要开箱即用、面向业务人员的产品——三个代表性工具登场。
重活企业选Celonis轿车,便捷分析选Disco单车,研究定制选Apromore
α算法的诞生
前页我们说过,发现任务的目标是从日志「重构」出流程模型。1999年之前,没人给出过可行的算法——直到Van der Aalst提出α算法,第一个真正能跑的发现方法。
日志里的活动顺序就是地面足迹,模型是还原出的路线
α算法的执行步骤
α 算法从事件日志中提炼四种活动关系,逐步过滤出最终模型所需的依赖信息。
α算法的优缺点
上下结构:中心是α算法,向下分「能处理」与「不能处理」两支。
启发式挖掘算法
上一页提到 α 算法碰到噪音就乱套——两条活动偶尔错位就可能拼出根本不存在的回路。启发式挖掘换了个思路:与其相信每一次出现,不如看谁出现的次数够多。
大脑自动加强反复出现的声音、忽略偶发杂音;算法也只信高频的跟随关系
基于区域的算法
α 算法在并发、循环上失灵,启发式挖掘只是近似。我们需要既精确又能驾驭复杂结构的方法——基于区域的算法绕开局部回溯,靠「分块-建模」直击全局。
行政区=库所,区间通道=变迁,整张地图=一张 Petri 网
Inductive Miner
上一个算法靠复杂的集合运算做区域切割。有没有更直接的方式,对着日志一通"切",保证产出的模型不会卡死、不会漏活动?——Inductive Miner 就走这条路线。
大块按图纸分小积木,每块只能是几种标准形状之一(顺序/并发/选择/循环),最终拼成完整模型
算法的选择决策树
同一份日志跑不同算法,结果可能天差地别——选型比调参更关键。
- 适用:日志干净、噪音极少
- 代表:Inductive Miner、α 算法
- 输出模型必有合理结构
- 适用:日志含噪、缺失或并发
- 代表:启发式挖掘、模糊挖掘
- 容错强但可能漏掉真实结构
过程发现与模型增强
前几页我们挖出了过程模型,但都是「基础款」——只覆盖最显著路径。你手里拿着这张图,最近却在街上看到几条新修的路——日志里有,但模型没标。模型增强就是把这些路径补回模型。
老地图对应已有模型,新修道路对应日志中真实走过的新路径
时控过程挖掘
前页把流程当静态快照——但同一组织今年的流程和去年可能截然不同。规则在变、组织在调整,漂移是常态。
每年一张快照比对,看哪里变了、怎么变的
资源感知的过程挖掘
上一页我们从时间维度看清了流程节奏,但流程终究由人执行——谁是关键角色?哪些人配合最密切?组织结构是怎样的?这些问题需要从日志的资源字段里挖掘。
员工名册对应资源识别,岗位对应角色挖掘,部门树对应组织挖掘
一致性检测
我们从日志发现模型,又给它加上时间、资源维度。但一个尖锐的问题浮现:发现的模型真的反映了现实吗?就像根据 GPS 轨迹画出城市地图后,还得拿真实路况去比对验证。
蓝图对应模型、产品对应日志,质检就是量出产品偏离图纸多远
当前面临的主要挑战
真实业务的事件日志远比教科书示例复杂——传感器噪声、流程随业务演进、千万级事件规模,都让算法从论文走向落地时举步维艰。
天气抖动=噪声;道路改线=漂移;数据堆积=规模
与Petri网深度结合
前面我们学了α算法、Inductive Miner等,它们输出模型形态各异。但有一种"通用语"贯穿整个过程挖掘——Petri网。它既是发现的"靶模型",也是分析与验证的天然载体。
每步落子对应token沿弧流动,可逐手回放检验是否合规
深度学习与过程挖掘
传统过程发现算法再精巧,最终都交出一张"能看清"的 Petri 网。但当日志高维稀疏、并发海量时,符号算法的天花板就到了。神经网络开辟另一条路:放弃显式模型,换取对复杂模式的拟合能力。
语法规则对应显式 Petri 网,语感对应网络权重——前者能讲清,后者只能模仿
自测:过程挖掘核心概念
某医院已有标准化就诊模型,团队希望:① 确认实际执行是否按设计进行;② 依据真实数据修正模型偏差。这两个目标分别对应哪两项过程挖掘任务?
知识要点回顾
- ✓事件日志是过程挖掘的唯一事实来源
- ✓发现·一致性·增强三大任务构成持续优化闭环
- ✓算法选择是工程决策,没有银弹
- ✓前沿方向都在让过程挖掘贴近真实世界
- ✓ProM偏研究探索,PM4Py偏工程落地
课后思考
先自己琢磨,再对照参考答案。问题没有标准答案,看的是思考路径。
参考答案日志是唯一直接接地的证据。多数算法要求每条trace完整;残缺日志得imputation或换启发式/ILP,但置信度必然打折。
参考答案α算法对并发友好、对短循环(<2长度)直接拒识。真实业务日志里短循环极常见——这正是Inductive Miner与启发式挖掘存在的理由。
参考答案DL预测准但过程黑盒。折中思路:DL做发现、符号算法做增强;或用attention近似解释。可解释性从'白盒'退到'可追溯',是这门学科的当下交易。