足球运动中的统计学(2)

官方教育学老师·23 页·深入(追求细节与边界)·0 次浏览·2 天前
足球数据进球分析xG概率分布

足球运动中的统计学

从射门频次到 xG 模型,掌握足球进球的统计规律与边界

按 空格/→ 演示下一步

1 / 23 页

全部页面点击任意一页,跳回舞台从这页播放

足球数据进球分析xG概率分布

足球运动中的统计学

从射门频次到 xG 模型,掌握足球进球的统计规律与边界

1第 1 页 · 足球运动中的统计学

什么是足球统计学

上一页说到足球里藏着大量可被记录的事实。但光堆数字还不够——足球统计学要做的是把这些事实变成能指导决策的洞察,让判断从"看着觉得"走向"算出来说"。

学科本质
把比赛事实转化为可量化、可分析、可指导决策的信息
数据来源
传球、射门、抢断等比赛事件都可被精确记录
三层跃迁
先描述发生了什么,再诊断为什么,最后预测会怎样
上下文约束
同一数据在不同比分、时段、对手下意义完全不同
老刑警破案对应 →足球数据分析师

经验和直觉打底,加上数据线索锁定关键证据——数据让教练的直觉变得可检验

2第 2 页 · 什么是足球统计学

足球统计学的核心问题

全图分三层:中心是总问题,第二层是三个分问题,第三层是每个分问题的具体研究维度。

图解渲染中…
关键节点补时、点球、定位球等可能改变走势的特殊时刻偶然性折射、变线、门将失误等难以归因的成分
3第 3 页 · 足球统计学的核心问题

球场的区域划分

看球时解说喊'进入进攻三区了!'——球场纵向三等分:离本方球门最近是防守三区,中间是中场,最靠近对方球门就是进攻三区。

防守三区
本方半场靠近己方球门的1/3,约35米,防守与发起反击的起点
中场三区
球场正中1/3,攻防转换地带,决定控球归属的关键区域
进攻三区
对方半场靠近对方球门的1/3,约35米,制造射门威胁的主战场
从家到学校的路对应 →球场的三个区域

家附近=防守区,校门口=进攻区,路中间=中场

每区长度=105335\text{每区长度}=\frac{105\text{米}}{3}\approx35\text{米}
4第 4 页 · 球场的区域划分

球在各区域停留时间分布

沿箭头方向:追踪数据→分区映射→时长累积→选择可视化方式。

图解渲染中…
a3把每一帧归属区域按秒累加,得到「区域→秒数」表a4同一份时长表可以走三条路,呈现侧重不同a5颜色深浅代表时间密度,适合看空间热点a7横轴比赛时间,纵轴区域占比,看战术迁移
5第 5 页 · 球在各区域停留时间分布

区域停留与进球的关系

上一页我们看到,球在禁区的停留时间只占全场约 8%——这片 16.5×40 米的小区域看似不起眼。但进球数据会打破直觉:绝大多数进球,都诞生在禁区里。

「小而少」的禁区
禁区面积约占场地 16%,球在其中停留时间甚至更低
进球高度集中
绝大多数进球的射门起点或完成位置都在禁区内
停留→预期进球
禁区内控球时长与 xG 强相关,是公认的核心进攻指标
其他区域是「过道」
中场和边路停留多为组织过渡,单次触球威胁有限
餐厅后厨对应 →禁区

后厨面积小、停留时间短,但几乎所有菜品都在这里完成——禁区停留少,却是大部分进球的诞生地

6第 6 页 · 区域停留与进球的关系

比赛时间分段

上一页我们看到球在不同区域的停留时间分布不均。但比赛不只是空间上'偏食',时间维度上同样不均匀——90 分钟里的进球并不平均散落,而是有明显的高峰时段。这就是为什么要做时间分段。

开场阶段
0-15 分钟,两队试探,节奏偏保守,进球率较低
常规阶段
15-75 分钟,战术博弈主战场,比赛节奏稳定
尾声阶段
75-90 分钟,体能下降+落后方压上,进球率明显抬升
阶段边界会漂移
红牌、大比分落后等事件会让某阶段提前或缩短
5公里跑的三段体感对应 →比赛时间分段

起跑不敢冲、中途找节奏、最后咬牙冲刺——心态与强度逐段递进

λ[75,90]1.31.5λ[0,15]\lambda_{[75,90]} \approx 1.3\text{–}1.5 \cdot \lambda_{[0,15]}
7第 7 页 · 比赛时间分段

各时段进球概率对比

时间从左到右流逝,节点内为该 15 分钟内进球占全场比例——越往后,数字越大。

图解渲染中…
C上半场尾段:抢攻 + 体能下降,17%F全场尾段:体能枯竭 + 读秒心理,21% 为峰值
8第 8 页 · 各时段进球概率对比

为什么时段进球率不同

上页我们看到 76-90 分钟是全场进球最密集的时段。这不是巧合——背后是体能、战术、心理三股力量在同时作用。

体能下降
后段体能下滑,防守专注松动、跑动减少,给进攻方更多空档(同时制约进攻效率)
战术博弈
落后方压上→身后空档变大;领先方收缩→反击空间增加;60-75 分钟换人常重塑结构
心理压力
临近结束比分落后时,孤注一掷心态显著提高射门频率;点球压力造就补时绝杀
长跑最后冲刺阶段对应 →足球比赛末段

领先者守住配速、落后者拼死追赶——战术选择与心理状态同步剧变,节奏完全不同

9第 9 页 · 为什么时段进球率不同

输球方进球现象

上页聊了「什么时候进球」,现在换个角度——看输球的一方。你可能以为败方往往被零封,但数据讲了一个不一样的故事。

双队进球很普遍
约七成比赛双方都有进球
败方场均约1球
输球一方平均每场也能进约1个球
一球小负最常见
近一半分胜负比赛,败方只输1球
惨败中也能进球
0:3、1:4等大比分里败方进球并不罕见
考试挂科但蒙对几道对应 →输球但仍有进球

败方没「交白卷」——和挂科生猜对几道题一样常见

10第 10 页 · 输球方进球现象

落后不同球数时的扳平概率

从'落后'这个岔路口出发,看三种落后球数下扳平概率如何坍塌。

图解渲染中…
A比赛处于落后状态的起点E扳平约25-30%,仍有希望F扳平约8-10%,希望大减G扳平约2-3%,几乎无望
11第 11 页 · 落后不同球数时的扳平概率

赢球方 vs 输球方进球对比

胜方靠'控制'进球,败方靠'反扑'进球——同样的进球数背后,逻辑完全不同。

赢球方进球特征
  • 场均进球更多:胜方场均约 1.8 球,整体压制
  • 时段分布均衡:上半场就能建立优势,不依赖末段
  • 以阵地配合为主:通过传导与渗透撕开防线
  • 绝杀出现但非主流:更多是'扩大比分'而非'救命'
输球方进球特征
  • 场均进球更少:败方场均约 0.9 球,被压制
  • 时段偏后集中:60 分钟后进球占比明显升高
  • 以反击和定位球为主:长传冲吊、角球、点球居多
  • 末段绝杀占比高:伤停补时进球中有相当比例来自落后方
看比分别只看数字——1:2 和 2:1 完全不同:胜方早建优势、节奏可控;败方进球往往是末段反扑或定位球孤注一掷。
12第 12 页 · 赢球方 vs 输球方进球对比

进球能力(xG)的概念

前面我们看的是区域和时段的总进球率。一脚禁区内的推射和一脚三十米外的远射,进球概率天差地别——怎么为每次射门给出一个具体的概率数字?这就是 xG。

xG 的定义
一次射门在历史同类情境下转化为进球的概率,介于 0 到 1 之间
建模用到的特征
射门位置、角度、触球部位、助攻方式、是否定位球、防守压力等
概率如何得出
用海量历史射门按相似特征分组,统计该组的实际进球率
xG 的核心价值
把射门质量与运气分离——实际进球减 xG 即为运气与临场成分
天气预报的降水概率对应 →xG

天气条件对应射门特征;当天是否下雨对应是否进球;同类天气的下雨比例对应 xG

xGi=P(进球射门特征),总 xG=ixGixG_i = P(\,\text{进球} \mid \text{射门特征}\,), \quad \text{总 xG} = \sum_i xG_i
13第 13 页 · 进球能力(xG)的概念

xG的计算逻辑

从一次射门出发,三类特征被提取并查询历史样本库,最终输出该射门的期望进球值。

图解渲染中…
b1射门点到球门的距离与角度b2最近防守者距离与压迫人数b3头球/正脚/凌空/倒钩等c1数百万次同类射门的转化率
14第 14 页 · xG的计算逻辑

xG与实际进球的差异

xG量的是「该进几个」,实际进球是「进了几个」。两者的差额,藏着运气、门将扑救和临场发挥的全部密码。

xG(期望进球)
  • 衡量射门机会的质量
  • 由位置、角度、方式决定
  • 反映创造机会的能力
  • 剔除运气,长期稳定
实际进球
  • 衡量最终比分贡献
  • 加上运气、门将、发挥因素
  • 反映把握机会的表现
  • 短期波动大,单场有欺骗性
xG高却少进=运气差或发挥失常;xG低却多进=超水平或运气眷顾。评估球员能力看xG,判断单场结果看实际进球。
15第 15 页 · xG与实际进球的差异

为什么xG比进球数更重要

想象你是球探:球队A单赛季进了80球,球队B单赛季xG是80。谁的进攻更强?多数职业球探会选B。这一页解释,为什么xG比进球数更能反映真实进攻效率。

进球数带运气噪音
单场进球通常只有1~3个,受门将扑救、门柱、折射影响剧烈,结果波动大
xG衡量射门机会质量
只看射门位置、角度、防守压力等'该进多少'的因素,剥离运气成分
xG预测未来更准
高xG低进球的球队后续常能'还回来',高进球低xG的球队运气会均值回归
区分实力与运气
xG告诉你进攻端'应该进几个',是真实进攻效率的过程指标
篮球投篮的该进率对应 →xG

教练不看你今天投进几个,看你在哪个位置、什么姿势投——位置近、无人防守时该进概率高

xG=i=1nP(射门i进球)\text{xG}=\sum_{i=1}^{n}P(\text{射门}_i \text{进球})
16第 16 页 · 为什么xG比进球数更重要

概率论基础回顾

xG 给出的 0.3、0.15 这些数字,本质都是概率。这页把三个最基础的工具拎出来——不靠它们,后面所有的统计推断都站不住。

独立事件
一次射门进或不进,不改变下一次射门的进球概率
条件概率
已知在某个条件下,事件概率会被重新计算
期望值
把所有可能的结果按各自概率加权求和
掷骰子赌出 1 点对应 →期望值

单次押 1 元赢 6 元、概率 1/6,6 局平均每把只赚 1 元——这就是期望值

E(X)=ipixiE(X) = \sum_{i} p_i \cdot x_i
17第 17 页 · 概率论基础回顾

单个进球概率的计算

python

把预期进球数 λ 代入泊松公式,输出 0~4 球及恰好 1 球的概率。

代码高亮加载中…

第 5 行是泊松质量函数 P(X=k)=e^(-λ)·λ^k/k!;λ=1.35 是设定参数,可比较各进球数的概率。

18第 18 页 · 单个进球概率的计算

两队对赛进球概率计算

python

用 Python 把两队的期望进球组装成完整比分概率矩阵,并汇总为胜/平/负。

代码高亮加载中…

L9 把两队建成独立泊松;L13 因相互独立,联合分布就是两分布的外积;L22–L24 取矩阵的下三角、对角线、上三角,分别累加得到主胜、平、客胜概率。

19第 19 页 · 两队对赛进球概率计算

用概率预测比赛结果

上一页我们算出了两队各自进 0、1、2、3… 球的概率。这些数字单独看还不够——比赛里两队同时进球,要看「组合」。把两个分布叠在一起,就能算出胜、平、负各自的概率。

比分矩阵
主队进球数(行)×客队进球数(列),每个格子代表一种比分
三种比分区域
对角线下方=主胜,对角线=平,对角线上方=主负
区域求和
每块区域里所有格子的概率相加,得到对应结果概率
概率归一
胜、平、负三者概率之和必等于 1,可用来检验计算
两颗骰子比大小对应 →两队进球比胜负

每颗骰子有点数分布,两分布交叉出所有组合后按大小分组求和

P()=iP(X=i)j<iP(Y=j)P()=iP(X=i)P(Y=i)P()=iP(X=i)j>iP(Y=j)\begin{aligned}P(\text{胜})&=\sum_{i}P(X=i)\cdot\sum_{j<i}P(Y=j)\\P(\text{平})&=\sum_{i}P(X=i)\cdot P(Y=i)\\P(\text{负})&=\sum_{i}P(X=i)\cdot\sum_{j>i}P(Y=j)\end{aligned}
20第 20 页 · 用概率预测比赛结果

知识点自测

点击作答

一场比赛球队 10 次射门 xG 总和为 2.0,但实际进了 4 球,最准确的解读是?

21第 21 页 · 知识点自测

统计学视角下的足球规律

获得完整的知识框架

统计学视角下的足球规律
获得完整的知识框架
22第 22 页 · 统计学视角下的足球规律

课后思考

先独立思考再看参考答案,三个问题层层递进。

1为什么说xG比进球数更能反映球队的进攻实力?

参考答案xG综合射门位置、角度等机会质量,剔除运气干扰;进球数受临场运气影响大,单场波动剧烈,xG更稳定地反映"应该进几个"。

2用概率预测比赛时,实力接近的双方该如何评估"爆冷"的可能性?

参考答案实力接近时各种结果的概率差距缩小,单一预测意义不大;改用完整概率分布,多次重复后小概率事件累积几乎必然发生。

3这些基于大样本的统计结论,对一场具体的比赛还成立吗?为什么?

参考答案单场波动大、样本量为1,统计结论是"期望值"而非确定结果;但能给出基准概率,让你判断某场结果是否属于"小概率反常"。

23第 23 页 · 课后思考