列联表与独立性检验

官方数学老师·13 页·深入(追求细节与边界)·0 次浏览·3 天前
假设检验χ²检验分类变量适用边界

列联表与独立性检验

理清χ²统计量的构造逻辑,掌握2×2与R×C列联表下的检验流程与适用边界

按 空格/→ 演示下一步

1 / 13 页

全部页面点击任意一页,跳回舞台从这页播放

假设检验χ²检验分类变量适用边界

列联表与独立性检验

理清χ²统计量的构造逻辑,掌握2×2与R×C列联表下的检验流程与适用边界

1第 1 页 · 列联表与独立性检验

条件概率

上一页我们用列联表做独立性检验,但'独立'到底是什么意思?答案就藏在条件概率里——它正是定义独立性的语言,也是贝叶斯推理的起点。

定义
在事件B已发生的前提下,事件A发生的概率,记作P(A|B)
计算公式
P(A|B)=P(A∩B)/P(B),要求P(B)>0
独立性的等价刻画
A与B独立 ⟺ P(A|B)=P(A),是χ²检验的理论根基
样本空间收缩
本质是把Ω缩到B这个'子世界'里重新数概率
贝叶斯反向
已知P(B|A)求P(A|B),是条件概率的'逆问题',统计推断的核心
医生问诊对应 →条件概率

知道'发烧'再判'流感',比'无信息'时更准——B一加,诊断空间从所有人缩到B子集

P(AB)=P(AB)P(B), P(B)>0P(A\mid B)=\dfrac{P(A\cap B)}{P(B)},\ P(B)>0
2第 2 页 · 条件概率

构建列联表

上一节我们用条件概率刻画「已知 B 发生,A 的概率」。要做独立性检验,第一步不是算公式,而是把原始数据组织成一张能一眼看清两变量联合分布的表格——列联表。

交叉分类
行放一个分类变量,列放另一个,每格同时落入两个类别
联合频数 n_{ij}
第 i 行第 j 列的观测计数,是原始数据,不是估算
边缘合计
行合计 n_{i·}、列合计 n_{·j},反映单变量边际分布
总样本量 n
全部单元格求和,是频率换算的统一分母
频率换算
n_{ij}/n 得联合概率,n_{ij}/n_{i·} 得条件概率
停车场按颜色×车型分块对应 →列联表的二维分块

每辆车唯一落一个格子,行合计=某色全部,列合计=某车型全部

ni=jnij,nj=inij,n=i,jnijn_{i\cdot}=\sum_j n_{ij},\quad n_{\cdot j}=\sum_i n_{ij},\quad n=\sum_{i,j}n_{ij}
3第 3 页 · 构建列联表

使用χ²独立性检验推断关联

上页我们搭好了列联表,行列比例差异肉眼可见。但这个差异是真有关联,还是抽样造成的偶然波动?χ²独立性检验就是给这种「差异」做定量判定的工具。

假设设置
H0两变量独立 vs H1两变量有关联,先假定独立再找反证
期望频数
Eᵢⱼ=行和×列和/总频数,独立假设下每个格子应有的理论值
χ²统计量
Σ(O-E)²/E,累加所有格子偏离期望的程度
自由度
df=(r-1)(c-1),由行数和列数共同决定
决策规则
χ²>临界值或p<α则拒绝H0,判定两变量存在关联
法官判案对应 →假设检验逻辑

先假定「无罪」即独立,看证据(χ²值)是否够强到推翻假设

χ2=ij(OijEij)2Eij,Eij=ninjn\chi^2 = \sum_{i}\sum_{j} \frac{(O_{ij} - E_{ij})^2}{E_{ij}}, \quad E_{ij} = \frac{n_{i\cdot} \, n_{\cdot j}}{n}
4第 4 页 · 使用χ²独立性检验推断关联

分类变量

调查顾客满意度时,你不会问'打几分'——你会问'满意、一般、不满意'。这种把观察对象归入某几个类别的变量,就是列联表里每一个格子背后的原料。

本质
取值是有限个类别或属性,不是连续数值,不能做算术运算
两种类型
无序分类(如性别、血型)与有序分类(如满意度等级)
典型应用
列联表的每个格子都由两个分类变量的交叉计数填出
整理衣柜按季节分格对应 →分类变量

每件衣服只能归入一个格子,没有'平均季节'这种说法

5第 5 页 · 分类变量

2×2列联表

前面我们把任意两个分类变量放进列联表。当两个变量都只有「是/否」两类时——比如「是否患病」对「检测是否阳性」——表自然收缩成 2×2。这是最小、也最常见的一种。

结构
两个二分类变量交叉形成 4 个核心单元格
单元格标记
a、b、c、d 是惯例记法,对应四种交叉组合的观测频数
边缘合计
每行、每列各有合计;总和 n 即总样本量
典型应用
药物试验、医学诊断、A/B 测试等二元结局场景
使用注意
任一格期望频数 <5 时 χ² 近似失效,需改用 Fisher 精确检验
点外卖时的两次二元选择对应 →2×2 列联表

加辣/不加辣 × 可乐/雪碧 → 四格,每格记同时满足两种选择的人数

χ2=n(adbc)2(a+b)(c+d)(a+c)(b+d)\chi^2 = \frac{n(ad-bc)^2}{(a+b)(c+d)(a+c)(b+d)}
6第 6 页 · 2×2列联表

独立性

χ² 检验的原假设就是「两个分类变量相互独立」——「独立」到底什么意思?和日常说的「没关系」是一回事吗?

独立性定义
P(A∩B) = P(A)·P(B)。等价于 P(A|B)=P(A),B 不提供 A 的任何信息。
是总体的性质
独立性属于理论分布,不是样本的属性。χ² 只能给反证强度,不能「证明」独立。
≠ 互斥
互斥是 P(A∩B)=0;独立是 P(A∩B)=P(A)P(B)。当 P(A),P(B)>0 时方向相反。
χ² 的矛头
原假设 H₀:独立。χ² 越大,实际与「假定独立下的期望频数」偏离越强,反证越有力。
连续抛两枚硬币对应 →两变量独立

第一枚结果完全不改第二枚的分布;两次互不干扰,对应联合=边际乘积

P(AB)=P(A)P(B),Eij=ninjnP(A \cap B) = P(A) \cdot P(B), \quad E_{ij} = \dfrac{n_{i\cdot} \, n_{\cdot j}}{n}
7第 7 页 · 独立性

零假设(原假设)

上一页我们说了'独立'意味着什么。要判断样本里看到的关联是不是真的,需要先立一个'反方'——假设它们其实独立。这个被检验的默认假设,就是零假设。

默认假设
在检验开始前先立的'反方':假设两个分类变量之间没有关联,是要被检验和可能拒绝的陈述
原假设的内容
在χ²独立性检验中写作 H₀:变量A与变量B相互独立,即行变量与列变量之间不存在关联
不证明,只拒绝
H₀永远无法被'证明'成立——只能说'没有足够证据拒绝它',这是常见误解的重灾区
证据不足的措辞
χ²统计量小、p值大时,结论应是'未能拒绝H₀'而非'接受H₀',两者有本质区别
法庭:无罪推定对应 →零假设:被假定成立

无罪推定=零假设;检方举证=数据证据;定罪=拒绝H₀;证据不足释放=未能拒绝H₀

H0:  Pij=pipj,  i,jH_0:\; P_{ij} = p_{i\cdot}\cdot p_{\cdot j},\; \forall\,i,j
8第 8 页 · 零假设(原假设)

χ²统计量

前面我们搭好了列联表、明确了零假设是「两变量独立」。但盯着单元格里的数字凭直觉判断『差得够大』并不严谨——我们需要一个量化指标,把每一格的偏离聚成一个总分。

核心思想
把每个单元格的观测频数O与独立假设下的期望频数E作对比,偏离越大越可疑
期望频数
H₀下E_ij=行合计×列合计÷总样本量,反映『如果独立应当看到多少』
公式结构
对每格算(O-E)²/E再加总;平方消方向、除以E做标准化
平方与除以E
平方处理偏差方向,除以E消除样本量与单元格规模差异,使各格可比
自由度
df=(行数-1)(列数-1),决定χ²服从的分布形状,相同χ²值在不同df下含义不同
预测销售vs实际销售对应 →χ²统计量

每个品类(O-E)²再除以预期额,加总就是整体『预测失准』总分

χ2=i=1rj=1c(OijEij)2Eij\chi^2 = \sum_{i=1}^{r}\sum_{j=1}^{c} \frac{(O_{ij} - E_{ij})^2}{E_{ij}}
9第 9 页 · χ²统计量

独立性检验(χ²检验)

前面我们算出了 χ² 统计量、提出了零假设——但「拒绝/不拒绝 H₀」的判断规则还没落地。这一页把这些零件拼成完整的 χ² 独立性检验。

检验目的
判断两个分类变量在总体上是否独立(即无关联)
反证法逻辑
先假设独立(H₀),看观测偏离期望多大;偏离离谱就推翻假设
决策依据
比较 χ² 与临界值,或查表得 p 值再与 α 比较,两法等价
显著性水平
常用 α=0.05 或 0.01,决定拒绝 H₀ 的门槛
适用条件
需大样本;期望频数不小于 5,否则 χ² 近似失效
法院审判对应 →χ² 独立性检验

都走反证法:先假定无罪/独立,看证据(χ²值)是否强到推翻假设

χ2>χα,(r1)(c1)2拒绝 H0\chi^2 > \chi^2_{\alpha,\,(r-1)(c-1)} \Rightarrow \text{拒绝 } H_0
10第 10 页 · 独立性检验(χ²检验)

小概率事件与临界值

上一页我们算出了χ²统计量,但这个数算大算小?生活里我们常说「这事不会那么巧吧」——统计学把这种直觉变成了一条明确的数字门槛。

小概率事件
事先约定一个很低的概率阈值(通常5%),低于它的事件视为「不太可能随机发生」
显著性水平α
那个事先约定的阈值,代表研究前承诺的「最大冤枉率」,常用0.05或0.01
临界值χ²α
χ²分布上对应概率α的分位点,需按自由度查表得到
拒绝域
χ²落在临界值右侧的区域,一旦实测值进入,就拒绝原假设
法庭「排除合理怀疑」对应 →临界值与显著性水平

α是怀疑的严格度,临界值是定罪的证据线;证据越线即判有罪

P(χ2χα2H0)=αP(\chi^2 \geq \chi^2_{\alpha} \mid H_0) = \alpha
11第 11 页 · 小概率事件与临界值

本节要点

  • 列联表把分类变量交叉计数,呈现联合频次分布
  • 独立性:联合概率=边缘概率之积
  • χ²检验衡量实际频次与期望频次的偏离
  • 检验只能拒绝或不拒绝H₀,不能证明独立
  • 相关≠因果,样本量过小结果不可靠
延伸主题:Fisher精确检验(小样本)效应量Cramér's V对数线性模型
12第 12 页 · 本节要点

课后思考

三道题覆盖三个层次:核心逻辑、临界判断、维度拓展。先自己想,再翻参考答案。

1χ²统计量用「观察频数与期望频数的差距平方和」来衡量「独立」,这种度量方式有什么精妙之处?换成别的度量会怎样?

参考答案精妙有三层:平方放大差距、避免正负相消;除以期望频数让不同格子可比;求和累积总偏差。换成简单|差|等,会失去统计量的已知分布,检验无从依据。

2一项调查得到P=0.048,刚好低于0.05临界值,但样本只有50例。你会下「存在关联」的结论吗?理由是什么?

参考答案应慎重。P贴近临界意味着证据不强;样本50时χ²近似准确性下降,需检查每个期望频数是否≥5。若有格子<5,可改用Fisher精确检验。

3列联表只展示两个分类变量。如果想同时考察「性别、专业、是否选修某门课」三者间关联,该如何拓展?

参考答案拓展为三维列联表,对数线性模型是常用工具;也可分层做多个二维表考察交互效应。检验思路仍是「观察vs期望」,只是自由度要重新推导。

13第 13 页 · 课后思考
列联表与独立性检验 · 知识图解