生物統計學習筆記從概念、推導到實務判讀

CHAPTER 08 · TOPIC 02

中位數檢定

中位數檢定(median test,常稱 Mood's median test)用於比較兩個獨立樣本的母體位置。它先用兩組合併資料的中位數把觀察值分成上、下兩側,再比較兩組落在同一側的比例是否相同。

本頁內容
  1. 中位數檢定適用什麼研究設計?
  2. 從虛無假設開始建立 2×2 表
  3. 為什麼會得到超幾何機率?
  4. pooled median 兩側各有多少資料?
  5. 大樣本如何使用兩比例差的常態近似?
  6. 中位數檢定到底能得出什麼結論?

中位數檢定(median test,常稱 Mood's median test)用於比較兩個獨立樣本的母體位置。它先用兩組合併資料的中位數把觀察值分成上、下兩側,再比較兩組落在同一側的比例是否相同。

中位數檢定適用什麼研究設計?

這裡比較的是兩組彼此獨立的資料,例如兩種治療分別施用在不同受試者身上。若同一名受試者接受兩次測量,資料是成對的,應考慮 Sign test 或 Wilcoxon signed-rank test,而不是把兩次測量當成兩個獨立樣本。

設計適合的方法
兩組獨立樣本,只比較 pooled median 兩側比例Median test
兩組獨立樣本,使用全部等級資訊Wilcoxon rank-sum / Mann–Whitney U
單一樣本或成對樣本Sign test 或 Wilcoxon signed-rank

從虛無假設開始建立 2×2 表

令兩組樣本數分別為 n₁、n₂。把兩組資料合併後求 pooled median,再令 m₁、m₂ 分別為第 1、2 組落在指定一側(例如高於中位數)的個數。中位數檢定的正式問題是兩組母體中位數是否相同;在 H₀ 下,組別標籤不應改變觀察值落在 pooled median 上、下兩側的比例。若兩組完整分布相同,當然也會得到這個結果,但檢定本身不等於比較分布的所有細節。

H0:η1=η2H1:η1η2H_0:\eta_1=\eta_2\qquad H_1:\eta_1\ne\eta_2
高於 pooled median低於 pooled median合計
第 1 組m₁n₁−m₁n₁
第 2 組m₂n₂−m₂n₂
合計M=m₁+m₂n₁+n₂−Mn₁+n₂

落在 pooled median 上的觀察值必須依事先規則處理;常見作法是排除這些 ties,再以剩餘有效樣本建立表格。若 ties 很多,結果可能對處理方式敏感,應在報告中說明。

為什麼會得到超幾何機率?

在 H₀ 下固定三個邊際:第 1 組共有 n₁ 筆、第 2 組共有 n₂ 筆,且 pooled median 指定側共有 M=m₁+m₂ 筆。問題變成:從 n₁+n₂ 個位置中選出 M 個位於該側的位置時,其中恰有 m₁ 個落在第 1 組的機率是多少?

有利配置數(n1m1)(n2m2)\binom{n_1}{m_1}\binom{n_2}{m_2}
全部配置數(n1+n2m1+m2)\binom{n_1+n_2}{m_1+m_2}
觀察到這個配置的機率P(M1=m1M)=(n1m1)(n2m2)(n1+n2m1+m2)P(M_1=m_1\mid M)=\frac{\binom{n_1}{m_1}\binom{n_2}{m_2}}{\binom{n_1+n_2}{m_1+m_2}}

這個式子給的是某一個配置的機率。求雙尾 p 值時,還要把在 H₀ 下與觀察表同樣或更不相容的 2×2 表機率加總;不能只把觀察表本身的機率當成 p 值。計算方式與 Fisher's exact test 相同。

pooled median 兩側各有多少資料?

若合併後共有 N=n₁+n₂ 筆、沒有等於中位數的 ties,N 為偶數時兩側各有 N/2 筆;N 為奇數時,中間那一筆本身就是中位數,移除後兩側各有 (N−1)/2 筆。

N 為偶數m1+m2=N2m_1+m_2=\frac N2
N 為奇數並移除中位數m1+m2=N12m_1+m_2=\frac{N-1}{2}

如果多筆資料恰好等於 pooled median,就不能只用奇偶性決定有效總數;必須先依規則處理這些 ties,再重新計算兩側合計。

大樣本如何使用兩比例差的常態近似?

樣本較大時,可以比較兩組落在指定側的樣本比例 m₁/n₁ 與 m₂/n₂。H₀ 下兩組使用同一個 pooled proportion p̂,q̂=1−p̂。

兩組樣本比例差p^1p^2=m1n1m2n2\hat p_1-\hat p_2=\frac{m_1}{n_1}-\frac{m_2}{n_2}
合併比例p^=m1+m2n1+n2,q^=1p^\hat p=\frac{m_1+m_2}{n_1+n_2},\qquad\hat q=1-\hat p
近似標準誤SE0=p^q^(1n1+1n2)SE_0=\sqrt{\hat p\hat q\left(\frac1{n_1}+\frac1{n_2}\right)}
檢定統計量Z=m1/n1m2/n2p^q^(1/n1+1/n2)N(0,1)Z=\frac{m_1/n_1-m_2/n_2}{\sqrt{\hat p\hat q(1/n_1+1/n_2)}}\approx N(0,1)

這個近似式可從兩個樣本比例差得到:H₀ 下 E(p̂₁−p̂₂)=0;若先以共同成功機率 p 近似兩組計數,則 Var(p̂₁−p̂₂)=pq(1/n₁+1/n₂),再用 pooled p̂ 估計未知的 p。小樣本或期望次數不足時,應使用精確方法。

中位數檢定到底能得出什麼結論?

拒絕 H₀ 表示兩組落在 pooled median 兩側的比例不同,支持兩組分布位置存在差異。若要直接解釋為母體中位數不同,還要考慮兩組分布形狀、離散程度與 ties;不拒絕 H₀ 也不代表兩組分布完全相同。

  1. 確認兩組樣本彼此獨立。
  2. 合併資料求 pooled median,並說明等於中位數的觀察值如何處理。
  3. 建立 pooled median 上、下兩側的 2×2 表。
  4. 小樣本使用條件式超幾何精確檢定;樣本充足時可使用卡方或兩比例 Z 近似。
  5. 報告兩組樣本數、兩側計數、檢定方法、p 值與效果方向。