生物統計學習筆記從概念、推導到實務判讀

CHAPTER 06 · TOPIC 02

ANOVA 事後比較

整體 ANOVA 若達統計顯著,只能說明至少一組母體平均數不同,不能直接指出差異發生在哪兩組。若研究者想進一步比較各組平均數,就需要使用事先規劃的對比或事後比較(post hoc comparisons)。

本頁內容
  1. 為什麼不能直接反覆做 t 檢定?
  2. 單次錯誤率與整體錯誤率
  3. 兩組平均數差的共同標準誤
  4. Fisher's LSD 法
  5. Bonferroni 法
  6. Holm 法
  7. Holm–Šidák 法
  8. 四種方法如何選擇?

整體 ANOVA 若達統計顯著,只能說明至少一組母體平均數不同,不能直接指出差異發生在哪兩組。若研究者想進一步比較各組平均數,就需要使用事先規劃的對比或事後比較(post hoc comparisons)。

為什麼不能直接反覆做 t 檢定?

兩兩比較時有兩個問題需要決定。第一,各組平均數差的標準誤如何估計?第二,做了多次檢定後,每一次比較應使用多大的顯著水準 α?不同方法對這兩個問題採取不同處理,因此在第一類錯誤與統計檢定力之間有不同取捨。

若共有 k 組,全部兩兩比較的次數為:

m=(k2)=k(k1)2m=\binom{k}{2}=\frac{k(k-1)}{2}
符號在這組公式中的意義
C(N,n) 或二項係數組合數;表示不考慮順序時,從指定總數中選取若干個的方式數

例如 3 組共有 C(3,2)=3 次比較;5 組則有 10 次。比較次數增加時,只要求每一次檢定的第一類錯誤率都是 0.05,並不能讓整組比較發生至少一次偽陽性的機率仍維持在 0.05。

單次錯誤率與整體錯誤率

α1\alpha_1 表示單次比較的第一類錯誤率,以 αF\alpha_F 表示同一組 m 次比較中至少發生一次第一類錯誤的機率,也就是家族錯誤率(family-wise error rate, FWER)。若先用各次檢定彼此獨立來理解,則有:

m 次都沒有第一類錯誤P(沒有第一類錯誤)=(1α1)mP(\text{沒有第一類錯誤})=(1-\alpha_1)^m
至少出現一次第一類錯誤αF=1(1α1)m\alpha_F=1-(1-\alpha_1)^m
α₁ 較小時的近似αFmα1\alpha_F\approx m\alpha_1

兩組平均數差的共同標準誤

在傳統等變異單因子 ANOVA 中,各組被假設具有共同誤差變異數。事後比較因此可以使用 ANOVA 表中的組內均方 MSE,估計第 i 組與第 j 組平均數差的標準誤。

平均數差的標準誤SE(XˉiXˉj)=MSE(1ni+1nj)SE(\bar X_i-\bar X_j)=\sqrt{MS_E\left(\frac{1}{n_i}+\frac{1}{n_j}\right)}
兩兩比較的 t 統計量tij=XˉiXˉjMSE(1ni+1nj)t_{ij}=\frac{\bar X_i-\bar X_j}{\sqrt{MS_E\left(\frac{1}{n_i}+\frac{1}{n_j}\right)}}
使用的自由度df=nkdf=n-k

下面四種方法可以使用相同的平均數差與共同標準誤;主要差別在於如何調整判定顯著的門檻或 p 值。

Fisher's LSD 法

Fisher's least significant difference(LSD)法以 pooled t 檢定的方式逐對比較平均數,使用 ANOVA 的 MSE 作為共同變異數估計。若整體 ANOVA 使用 α=0.05,每一組 LSD 比較通常也直接以 0.05 判斷,不再因比較次數調整 α。

拒絕 H0,ijquadpij<α\text{拒絕 }H_{0,ij}\quad\text{若}quad p_{ij}<\alpha
符號在這組公式中的意義
α顯著水準或信賴區間兩端所使用的尾端機率

Bonferroni 法

Bonferroni 法把希望控制的家族顯著水準 αF\alpha_F 分配給 m 次比較。每一次比較使用 αF/m\alpha_F/m 作為門檻;等價地,也可以把每個原始 p 值乘以 m,再與 αF\alpha_F 比較。其他 t 統計量與標準誤的計算和前面相同。

調整每次比較的 ααper comparison=αFm\alpha_{\mathrm{per\ comparison}}=\frac{\alpha_F}{m}
調整 p 值padj=min(mp,1)p_{\mathrm{adj}}=\min(mp,1)

例如 3 組共有 3 次兩兩比較。若希望整體 αF=0.05\alpha_F=0.05,每次比較的門檻就是 0.05/30.01670.05/3\approx0.0167

Holm 法

Holm t test 又稱 Holm step-down procedure。它也是控制家族錯誤率的方法,但不讓每個 p 值都承受相同的最嚴格 Bonferroni 門檻,因此通常比單純 Bonferroni 更有檢定力。

  1. 把 m 個原始 p 值由小到大排列為 p(1)≤p(2)≤⋯≤p(m)。
  2. 先將最小的 p 值與「家族顯著水準除以全部比較數」所得的門檻比較。若不顯著,就停止,後面的比較都不判為顯著。
  3. 若最小的 p 值顯著,再檢查第二小的 p 值;分母隨尚未判定的比較數逐步減少,因此門檻會逐步放寬。
  4. 遇到第一個不顯著的 p 值時停止;該項及後面較大的 p 值都不拒絕虛無假設。
p(i)αFmi+1p_{(i)}\leq\frac{\alpha_F}{m-i+1}
符號在這組公式中的意義
α顯著水準或信賴區間兩端所使用的尾端機率

原文以 p 值由大到小排列,依序乘以 1、2、3、…來理解;這與由小到大排列後依序使用 m、m−1、m−2、…的倍率是同一件事。實際計算調整後 p 值時還要保持單調性,避免較大的原始 p 值得到反而更小的調整值。

pHolm,(i)=min ⁣(1,max1ji[(mj+1)p(j)])p_{\mathrm{Holm},(i)}=\min\!\left(1,\max_{1\leq j\leq i}[(m-j+1)p_{(j)}]\right)
符號在這組公式中的意義
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

Holm–Šidák 法

Holm–Šidák t test 將 Holm 的逐步程序與 Šidák 門檻結合。仍先把 p 值由小到大排序;當目前還有 r=m−i+1 個假設尚未判定時,第 i 步使用下列門檻:

第 i 步剩餘的比較數r=mi+1r=m-i+1
Holm–Šidák 門檻αi=1(1αF)1/r\alpha_i'=1-(1-\alpha_F)^{1/r}

p(i)αip_{(i)}\leq\alpha_i',就繼續檢查下一個 p 值;遇到第一個不顯著結果便停止。原文以由大到小排序後的序號 k 表示同一概念,因此寫成 α=1(1αF)1/k\alpha'=1-(1-\alpha_F)^{1/k}。改用「尚未判定的比較數 r」可避免把排序方向與次序混淆。

四種方法如何選擇?

方法如何處理多重比較主要特性
Fisher's LSD通常不調整 α較寬鬆、檢定力較高,但家族第一類錯誤容易膨脹
Bonferroni將家族顯著水準平均分配給所有比較簡單且控制穩健,但比較多時可能過度保守
Holm逐步放寬 Bonferroni 門檻控制 FWER,通常比 Bonferroni 更有檢定力
Holm–Šidák使用逐步 Šidák 門檻門檻通常略寬於 Holm,但需留意檢定之間的相依性