生物統計學習筆記從概念、推導到實務判讀

CHAPTER 05 · TOPIC 04

卡方獨立性檢定

卡方獨立性檢定(chi-square test of independence)用來判斷兩個類別變項在母體中是否彼此獨立。資料先整理成 r×c 列聯表;若兩變項獨立,每一格應出現多少次可以由列、欄的邊際比例推算,再與實際觀察次數比較。

本頁內容
  1. 使用時機
  2. 2×2 表的觀察次數
  3. 建立假設
  4. 期望次數如何得到?
  5. 2×2 表的四個期望次數
  6. Pearson 卡方統計量
  7. 自由度為什麼是 (r−1)(c−1)?
  8. 2×2 表的簡化公式
  9. 為什麼只看卡方分配右尾?
  10. 與 Poisson 分布的關係
  11. 近似條件與方法選擇
  12. 檢定步驟

卡方獨立性檢定(chi-square test of independence)用來判斷兩個類別變項在母體中是否彼此獨立。資料先整理成 r×c 列聯表;若兩變項獨立,每一格應出現多少次可以由列、欄的邊際比例推算,再與實際觀察次數比較。

使用時機

當同一批獨立觀察單位同時具有兩個類別變項,而且研究問題是兩種分類是否存在關聯時,可以使用卡方獨立性檢定。例如,比較暴露狀態與疾病狀態、治療組別與是否改善,或性別與偏好的類別是否彼此獨立。

  • 兩個變項都必須是類別資料,並可整理成交叉次數表。
  • 每個觀察單位只能出現在一個儲存格中,各觀察單位彼此獨立。
  • 分析的是次數,而不是直接把百分比或平均數代入公式。
  • 各格期望次數需要足夠大,Pearson 卡方分配的近似才可靠。

2×2 表的觀察次數

有疾病(case)無疾病(control)列合計
有暴露(exposed)ABA+B
無暴露(unexposed)CDC+D
欄合計A+CB+DN=A+B+C+D

A、B、C、D 是觀察次數 O;最後一列與最後一欄是邊際總數。卡方獨立性檢定不直接比較 OR 或 RR 的大小,而是問:如果暴露與疾病真的獨立,這四格次數與獨立模型所預期的次數相差多遠?

建立假設

虛無假設H0:X 與 Y 彼此獨立H_0:X\text{ 與 }Y\text{ 彼此獨立}
對立假設H1:X 與 Y 不獨立H_1:X\text{ 與 }Y\text{ 不獨立}
H₀ 的機率條件P(X=i,Y=j)=P(X=i)P(Y=j)P(X=i,Y=j)=P(X=i)P(Y=j)

「不獨立」表示兩變項存在統計關聯,但不代表其中一個變項必然造成另一個變項。卡方檢定也不提供關聯方向與效果大小;這些資訊要搭配各格比例、殘差、OR、RR 或其他適合的效果量判讀。

期望次數如何得到?

在 H₀ 下,第 i 列且第 j 欄的聯合機率等於第 i 列邊際機率乘上第 j 欄邊際機率。用樣本的列比例與欄比例估計這兩個邊際機率,再乘上總人數 N,就得到該格的期望次數。

第 i 列的邊際機率估計P^(X=i)=ni+N\widehat P(X=i)=\frac{n_{i+}}N
第 j 欄的邊際機率估計P^(Y=j)=n+jN\widehat P(Y=j)=\frac{n_{+j}}N
獨立時的聯合機率估計P^ij=ni+Nn+jN\widehat P_{ij}=\frac{n_{i+}}N\frac{n_{+j}}N
第 i,j 格的期望次數Eij=NP^ij=ni+n+jNE_{ij}=N\widehat P_{ij}=\frac{n_{i+}n_{+j}}N

2×2 表的四個期望次數

儲存格觀察次數H₀ 下的期望次數
A:有暴露且有疾病AEA=(A+B)(A+C)NE_A=\dfrac{(A+B)(A+C)}N
B:有暴露且無疾病BEB=(A+B)(B+D)NE_B=\dfrac{(A+B)(B+D)}N
C:無暴露且有疾病CEC=(C+D)(A+C)NE_C=\dfrac{(C+D)(A+C)}N
D:無暴露且無疾病DED=(C+D)(B+D)NE_D=\dfrac{(C+D)(B+D)}N

Pearson 卡方統計量

每一格先計算觀察次數與期望次數的差,再除以該格期望次數的平方根形成 Pearson residual;把所有殘差平方後相加,就是 Pearson 卡方統計量。

第 i,j 格的 Pearson residualrij=OijEijEijr_{ij}=\frac{O_{ij}-E_{ij}}{\sqrt{E_{ij}}}
Pearson 卡方統計量χ2=i=1rj=1c(OijEij)2Eij\chi^2=\sum_{i=1}^{r}\sum_{j=1}^{c}\frac{(O_{ij}-E_{ij})^2}{E_{ij}}

自由度為什麼是 (r−1)(c−1)?

在 r×c 表中,一共有 rc 個聯合機率。若不加限制,全部機率相加等於 1,因此可自由指定 rc−1 個;在 H₀ 的獨立模型下,只需指定 r−1 個列邊際機率與 c−1 個欄邊際機率。兩個模型相差的參數數量就是卡方檢定的自由度。

未限制的聯合分布rc1rc-1
獨立模型的邊際參數(r1)+(c1)(r-1)+(c-1)
兩者相減df=(rc1)[(r1)+(c1)]=(r1)(c1)df=(rc-1)-[(r-1)+(c-1)]=(r-1)(c-1)

2×2 表的簡化公式

把四格期望次數代入 Pearson 卡方公式並整理,可得到 2×2 表專用的交叉乘積簡化式。它和逐格計算 Σ(O−E)²/E 完全相同,但只適用於未做連續性校正的 2×2 Pearson 卡方檢定。

χdf=12=N(ADBC)2(A+B)(C+D)(A+C)(B+D)\chi^2_{df=1}=\frac{N(AD-BC)^2}{(A+B)(C+D)(A+C)(B+D)}
符號在這組公式中的意義
χ²卡方分配或卡方統計量
補充:由 Pearson 公式推導 2×2 簡化式

令列總數 r₁=A+B、r₂=C+D,欄總數 c₁=A+C、c₂=B+D,且 N=r₁+r₂=c₁+c₂。先看 A 格的觀察次數與期望次數之差:

A 格期望次數EA=r1c1NE_A=\frac{r_1c_1}{N}
A 格的差AEA=A(A+B)(A+C)NA-E_A=A-\frac{(A+B)(A+C)}N
通分並展開AEA=AN(A+B)(A+C)N=ADBCNA-E_A=\frac{AN-(A+B)(A+C)}N=\frac{AD-BC}{N}

由固定的列、欄總數可得,B、C 格的偏差與 A 格方向相反,D 格則與 A 格方向相同;四格偏差的絕對值都等於 |AD−BC|/N。

四格偏差AEA=DED=ADBCNA-E_A=D-E_D=\frac{AD-BC}{N}
另外兩格BEB=CEC=ADBCNB-E_B=C-E_C=-\frac{AD-BC}{N}

代回 Pearson 公式,因為平方會消除正負號,所以四項具有共同分子:

χ2=(ADBC)2N2(1EA+1EB+1EC+1ED)\chi^2=\frac{(AD-BC)^2}{N^2}\left(\frac1{E_A}+\frac1{E_B}+\frac1{E_C}+\frac1{E_D}\right)
代入四格期望次數1E=N(1r1c1+1r1c2+1r2c1+1r2c2)\sum\frac1E=N\left(\frac1{r_1c_1}+\frac1{r_1c_2}+\frac1{r_2c_1}+\frac1{r_2c_2}\right)
提出共同分母1E=N3r1r2c1c2\sum\frac1E=\frac{N^3}{r_1r_2c_1c_2}
得到簡化式χ2=N(ADBC)2r1r2c1c2=N(ADBC)2(A+B)(C+D)(A+C)(B+D)\chi^2=\frac{N(AD-BC)^2}{r_1r_2c_1c_2}=\frac{N(AD-BC)^2}{(A+B)(C+D)(A+C)(B+D)}

為什麼只看卡方分配右尾?

χ² 最小為 0;當每格 O 都等於 E 時,χ²=0,資料與獨立模型完全吻合。O 與 E 的整體差距愈大,χ² 愈大,也愈不支持 H₀。因此拒絕域只在右尾。

p 值=P ⁣(χdf2χobs2H0)p\text{ 值}=P\!\left(\chi^2_{df}\geq\chi^2_{\mathrm{obs}}\mid H_0\right)
符號在這組公式中的意義
χ²卡方分配或卡方統計量

與 Poisson 分布的關係

Pearson 統計量的分母使用 E,形式上可聯想到 Poisson 計數具有 Var(O)=E。更正式地說,若各格先視為獨立 Poisson 計數,在給定總數 N 後會得到多項分布;但卡方獨立性檢定不要求原始資料一定是「N 很大、p 很小」的稀有事件,也不能因此說此檢定只是由 Poisson 分布直接推出。

近似條件與方法選擇

Pearson 卡方檢定使用大樣本近似。常見的入門經驗規則是每一格期望次數 Eᵢⱼ 約至少為 5;若某些期望次數太小,離散計數形成的 χ² 統計量可能還沒有充分接近連續的卡方分布,查卡方表得到的 p 值便可能不夠準確。

因此,看到某個觀察格小於 5 可以提醒我們進一步檢查,但不能只憑這個觀察值決定方法。2×2 表若期望次數稀疏,可優先考慮 Fisher 精確檢定;其他 r×c 表則可考慮適當的精確或 Monte Carlo 方法。下一頁會另外說明 Yates 連續性校正。

檢定步驟

  1. 確認資料包含兩個類別變項,觀察值彼此獨立,並建立 r×c 觀察次數表。
  2. 設定 H₀ 為兩變項獨立、H₁ 為兩變項不獨立。
  3. 利用 Eᵢⱼ=列合計×欄合計÷N 計算每格期望次數,並檢查近似條件。
  4. 計算 Pearson χ² 與 df=(r−1)(c−1),由右尾得到 p 值。
  5. 若拒絕 H₀,再檢視比例、殘差與效果量,說明關聯主要來自哪些儲存格及其實質意義。