生物統計學習筆記從概念、推導到實務判讀

CHAPTER 08 · TOPIC 01

Wilcoxon 檢定

當資料不適合直接用平均數與常態模型描述時,可以改從符號、次序或等級建立檢定。這類方法通常稱為無母數方法。它們不需要指定完整的母體分配形式,但仍然需要獨立性、成對結構或分配形狀等相應條件,並不是完全沒有假設。

本頁內容
  1. Sign test:先把數值轉成正號與負號
  2. Sign test 如何計算 p 值?
  3. Rank-sum test:兩組獨立樣本一起排序
  4. 用五個等級建立 rank-sum 的精確分配
  5. Rank-sum 的平均數、變異數與常態近似
  6. Signed-rank test:方向之外也考慮距離
  7. 用三個成對差值建立 signed-rank 分配
  8. Signed-rank 的平均數、變異數與常態近似
  9. 三種方法如何選擇?

當資料不適合直接用平均數與常態模型描述時,可以改從符號、次序或等級建立檢定。這類方法通常稱為無母數方法。它們不需要指定完整的母體分配形式,但仍然需要獨立性、成對結構或分配形狀等相應條件,並不是完全沒有假設。

研究設計只使用方向方向與距離等級都使用對應的 t 檢定
單一樣本或成對樣本Sign testWilcoxon signed-rank testOne-sample 或 paired t-test
兩組獨立樣本Wilcoxon rank-sum test / Mann–Whitney U testIndependent-samples t-test

Sign test:先把數值轉成正號與負號

Sign test 可用於單一樣本,也可用於成對樣本。單一樣本時,把每個 Xᵢ 與虛無假設指定的中位數 M₀ 比較;成對樣本時,先把同一對的兩次測量相減,再把差值與 0 比較。

例如,可用單一樣本 Sign test 檢查 1~7 分的住院滿意度中位數是否為 4;也可將同一名病人的飯前與飯後血糖相減,用成對 Sign test 檢查正差與負差是否同樣可能。

單一樣本差值Di=XiM0D_i=X_i-M_0
成對樣本差值Di=Xi,afterXi,beforeD_i=X_{i,\mathrm{after}}-X_{i,\mathrm{before}}
只保留符號Zi={1,Di<00,Di=01,Di>0Z_i=\begin{cases}-1,&D_i<0\\0,&D_i=0\\1,&D_i>0\end{cases}

等於 0 的差值不提供正負方向,所以先移除,再把剩下的有效個數記為 n。令 C 為正差值的個數。若虛無假設成立,正、負方向應各有一半機率,因此 C 服從成功機率 1/2 的二項分配。

雙尾虛無假設H0:p=12H1:p12H_0:p=\frac12\qquad H_1:p\ne\frac12
虛無分配CH0Binomial(n,12)C\mid H_0\sim\operatorname{Binomial}\left(n,\frac12\right)
期望值與變異數E(C)=n2,Var(C)=n4E(C)=\frac n2,\qquad\operatorname{Var}(C)=\frac n4

Sign test 如何計算 p 值?

依本單元採用的傳統計算界線,有效樣本數 n<20 時,直接使用 Binomial(n,1/2) 計算精確 p 值。若 n=10、觀察到 C=8,雙尾 p 值把與 8 同樣或更偏離 n/2=5 的兩側結果都算入:

p=2P(C8)=2k=810(10k)(12)10p=2P(C\ge8)=2\sum_{k=8}^{10}\binom{10}{k}\left(\frac12\right)^{10}
符號在這組公式中的意義
N合併後的總樣本數,或符號秩檢定中的非零差值數;依該段定義
n、m兩組的樣本數,且 N=n+m
W、Wₛ指定組別的秩和統計量
TWilcoxon 符號秩檢定的秩和統計量
Xᵢ、Yⱼ排序後的秩或不同觀察值的秩
Σ求和符號;將指定範圍內的各項全部加總
C(N,n) 或二項係數組合數;表示不考慮順序時,從指定總數中選取若干個的方式數

n 較大時,可利用二項分配的平均數 n/2 與標準差 √(n/4) 作常態近似。因為 C 是離散值而常態分配是連續的,實際計算通常加入 0.5 的連續性校正。

未校正的 ZZ=Cn/2n/4Z=\frac{C-n/2}{\sqrt{n/4}}
雙尾拒絕域C>n2+z1α/2n4C<n2z1α/2n4C>\frac n2+z_{1-\alpha/2}\sqrt{\frac n4}\quad\text{或}\quad C<\frac n2-z_{1-\alpha/2}\sqrt{\frac n4}

單尾問題必須在看資料前依研究方向寫成 p>1/2 或 p<1/2,並只計算相應尾端的機率;不是得到結果後才選擇尾端。

Rank-sum test:兩組獨立樣本一起排序

Wilcoxon rank-sum test 與 Mann–Whitney U test 是同一個兩獨立樣本檢定的兩種等價統計量。它把兩組共 N 筆資料合併排序,再觀察其中一組取得的等級和是否異常偏大或偏小。

  1. 合併兩組共 N=n+m 筆觀察值,由小到大給予等級 1~N。
  2. 數值相同時,把它們應占名次的平均值分給每一筆。
  3. 選定其中 n 筆的處理組,把其等級相加得到 Wₛ。
  4. 在 H₀ 下,比較目前 Wₛ 與所有可能分組形成的虛無分配。
Ws=itreatmentRiW_s=\sum_{i\in\mathrm{treatment}}R_i
符號在這組公式中的意義
N合併後的總樣本數,或符號秩檢定中的非零差值數;依該段定義
n、m兩組的樣本數,且 N=n+m
W、Wₛ指定組別的秩和統計量
TWilcoxon 符號秩檢定的秩和統計量
Xᵢ、Yⱼ排序後的秩或不同觀察值的秩
Σ求和符號;將指定範圍內的各項全部加總

若 H₀ 表示兩組來自相同分配,組別標籤便可互換;從 N 個等級任取 n 個放入處理組的 C(N,n) 種方式,在 H₀ 下具有相同機率。這就是精確虛無分配的來源。

用五個等級建立 rank-sum 的精確分配

假設 5 位受試者依症狀由嚴重到輕微排成 1~5 級,其中 3 人接受藥物、2 人接受安慰劑。H₀ 表示治療組與對照組的結果分配相同,因此任選 3 個等級作為治療組共有 C(5,3)=10 種等機率配置。

Treatment ranksControl ranksWₛ
1,2,34,56
1,2,43,57
1,2,53,48
1,3,42,58
1,3,52,49
2,3,41,59
1,4,52,310
2,3,51,410
2,4,51,311
3,4,51,212
w6789101112
P(Wₛ=w)0.10.10.20.20.20.10.1
P(Ws=w)=#(w;n,m)(Nn)P(W_s=w)=\frac{\#(w;n,m)}{\binom{N}{n}}
符號在這組公式中的意義
N合併後的總樣本數,或符號秩檢定中的非零差值數;依該段定義
n、m兩組的樣本數,且 N=n+m
W、Wₛ指定組別的秩和統計量
TWilcoxon 符號秩檢定的秩和統計量
Xᵢ、Yⱼ排序後的秩或不同觀察值的秩
C(N,n) 或二項係數組合數;表示不考慮順序時,從指定總數中選取若干個的方式數

其中 #(w;n,m) 是 n 筆處理組、m 筆對照組時,處理組等級和等於 w 的配置數。傳統 rank-sum 表格常只列到 n≤10、m≤10;超出表格範圍時,早期計算會改用常態近似。現代統計軟體可在更廣的樣本範圍直接計算精確或排列 p 值,因此應依軟體方法、樣本大小與 ties 情況決定,而不是把 10 當成統計理論的硬門檻。

Rank-sum 的平均數、變異數與常態近似

虛無期望值E(Ws)=12n(N+1)E(W_s)=\frac12n(N+1)
無 ties 時的虛無變異數Var(Ws)=112mn(N+1)\operatorname{Var}(W_s)=\frac1{12}mn(N+1)
常態近似Z=WsE(Ws)Var(Ws)Z=\frac{W_s-E(W_s)}{\sqrt{\operatorname{Var}(W_s)}}

有 ties 時,等級使用平均名次,常態近似的變異數也要加入 ties 修正。連續性校正的方向依所計算的尾端決定;不能固定對所有 Z 都減 1/2。

補充:推導 rank-sum 等級和的平均數與變異數

令全部 N 個等級為 X₁,X₂,…,X_N,處理組從中任取 n 個,對照組大小 m=N−n。H₀ 下所有 C(N,n) 個配置等機率,因此平均數與變異數都必須從這些可能配置出發。以下先假設沒有 ties。

平均數:平均所有 C(N,n) 種配置

先把每一種處理組配置內的 n 個等級相加,再對全部配置取平均。固定任一等級 Xᵢ 後,其他 n−1 個位置可從剩餘 N−1 個等級選取,所以 Xᵢ 會出現在 C(N−1,n−1) 個配置中。

從所有配置的等級和取平均E(Ws)=S(iSXi)(Nn)E(W_s)=\frac{\displaystyle\sum_{\mathcal S}\left(\sum_{i\in\mathcal S}X_i\right)}{\binom{N}{n}}
每個 Xᵢ 都出現 C(N−1,n−1) 次E(Ws)=i=1NXi(N1n1)(Nn)E(W_s)=\frac{\displaystyle\sum_{i=1}^{N}X_i\binom{N-1}{n-1}}{\binom{N}{n}}
化簡組合數比例E(Ws)=nNi=1NXiE(W_s)=\frac nN\sum_{i=1}^{N}X_i
代入 1+2+⋯+NE(Ws)=nNN(N+1)2=12n(N+1)E(W_s)=\frac nN\frac{N(N+1)}2=\frac12n(N+1)

變異數:展開每一個配置的等級和平方

變異數先由 E(Wₛ²)−[E(Wₛ)]² 出發。展開一個配置的 (ΣXᵢ)²,會得到單一等級的平方 Xᵢ²,以及兩個不同等級的交叉項 2XᵢXⱼ。單一 Xᵢ 出現在 C(N−1,n−1) 個配置;指定的 Xᵢ、Xⱼ 同時出現時,剩下 n−2 個位置可從 N−2 個等級選,因此出現在 C(N−2,n−2) 個配置。

由變異數定義開始Var(Ws)=S(iSXi)2(Nn)[12n(N+1)]2\operatorname{Var}(W_s)=\frac{\displaystyle\sum_{\mathcal S}\left(\sum_{i\in\mathcal S}X_i\right)^2}{\binom{N}{n}}-\left[\frac12n(N+1)\right]^2
分成平方項與交叉項=iXi2(N1n1)+2i<jXiXj(N2n2)(Nn)n2(N+1)24=\frac{\displaystyle\sum_iX_i^2\binom{N-1}{n-1}+2\sum_{i<j}X_iX_j\binom{N-2}{n-2}}{\binom{N}{n}}-\frac{n^2(N+1)^2}{4}
化簡兩個組合數比例=nNiXi2+n(n1)N(N1)2i<jXiXjn2(N+1)24=\frac nN\sum_iX_i^2+\frac{n(n-1)}{N(N-1)}\,2\sum_{i<j}X_iX_j-\frac{n^2(N+1)^2}{4}
把交叉項改寫成兩個級數2i<jXiXj=(iXi)2iXi22\sum_{i<j}X_iX_j=\left(\sum_iX_i\right)^2-\sum_iX_i^2
代回變異數=nNiXi2+n(n1)N(N1)[(iXi)2iXi2]n2(N+1)24=\frac nN\sum_iX_i^2+\frac{n(n-1)}{N(N-1)}\left[\left(\sum_iX_i\right)^2-\sum_iX_i^2\right]-\frac{n^2(N+1)^2}{4}
使用等級級數公式iXi=N(N+1)2,iXi2=N(N+1)(2N+1)6\sum_iX_i=\frac{N(N+1)}2,\qquad\sum_iX_i^2=\frac{N(N+1)(2N+1)}6
代入後保留兩個主要項=n(Nn)(N+1)(2N+1)6(N1)n(N+1)2(Nn)4(N1)=\frac{n(N-n)(N+1)(2N+1)}{6(N-1)}-\frac{n(N+1)^2(N-n)}{4(N-1)}
通分並提出共同因子=n(Nn)(N+1)(N1)12(N1)=\frac{n(N-n)(N+1)(N-1)}{12(N-1)}
以 m=N−n 表示Var(Ws)=112nm(N+1)\operatorname{Var}(W_s)=\frac1{12}nm(N+1)

Signed-rank test:方向之外也考慮距離

Wilcoxon signed-rank test 用於單一樣本或成對樣本。Sign test 只記錄差值的正負;signed-rank test 進一步把 |Dᵢ| 排序,所以較大的差值會得到較大的等級。當差值分布合理地近似對稱時,這些大小資訊通常能提供比 Sign test 更多的檢定力。

  1. 計算每一筆相對 M₀ 的差值,或每一對測量的差值 Dᵢ。
  2. 移除 Dᵢ=0 的資料,將剩餘有效樣本數記為 n。
  3. 對 |Dᵢ| 由小到大排序;相同絕對差使用平均等級。
  4. 把原本的正負號放回等級,分別加總得到正等級和 T⁺ 與負等級和 T⁻。
  5. 雙尾精確檢定可使用較小的 T=min(T⁺,T⁻),或等價地以 T⁺ 的兩尾虛無分配求 p 值。
正等級和T+=Di>0RiT^+=\sum_{D_i>0}R_i
負等級和的絕對值T=Di<0RiT^-=\sum_{D_i<0}R_i
等級總和固定T++T=1+2++n=n(n+1)2T^++T^-=1+2+\cdots+n=\frac{n(n+1)}2

用三個成對差值建立 signed-rank 分配

比較新、舊肥料時,把 3 個草莓園各分成兩半,分別使用新肥料與舊肥料。這是成對設計,因為同一個果園內的兩個收穫量共享相近環境。

果園123
新肥料收穫768280
舊肥料收穫789186
D=新−舊−2−9−6
|D| 的等級132

H₀ 下,差值分布以 0 為中心且對稱,因此每個絕對差的等級配置正號或負號的機率各為 1/2。三個等級共有 2³=8 種等機率的正負配置。令 Vₛ=T⁺,只把帶正號的等級相加:

符號配置(−1,−2,−3)(+1,−2,−3)(−1,+2,−3)(−1,−2,+3)(+1,+2,−3)(+1,−2,+3)(−1,+2,+3)(+1,+2,+3)
Vₛ=T⁺01233456
v0123456
P(Vₛ=v)0.1250.1250.1250.2500.1250.1250.125

實際資料三個差值皆為負,因此 T⁺=0、T⁻=6。精確雙尾 p 值為 2P(T⁺≤0)=2×1/8=0.25;這 3 對資料不足以拒絕新、舊肥料效果相同的虛無假設。

Signed-rank 的平均數、變異數與常態近似

H₀ 下,每個等級以 1/2 機率進入 T⁺,所以期望正等級和是全部等級總和的一半。無 ties 時,各等級是否帶正號可視為彼此獨立的 Bernoulli(1/2) 指標。

虛無期望值E(T+)=12(1+2++n)=n(n+1)4E(T^+)=\frac12(1+2+\cdots+n)=\frac{n(n+1)}4
無 ties 時的虛無變異數Var(T+)=14(12+22++n2)=n(n+1)(2n+1)24\operatorname{Var}(T^+)=\frac14(1^2+2^2+\cdots+n^2)=\frac{n(n+1)(2n+1)}{24}
常態近似Z=T+n(n+1)/4n(n+1)(2n+1)/24Z=\frac{T^+-n(n+1)/4}{\sqrt{n(n+1)(2n+1)/24}}

傳統教材常以有效樣本數 n≥20 作為 signed-rank 常態近似的經驗界線,n<20 時則查精確分配表;這是計算上的近似規則,不是定理中的固定分界。現代統計軟體應優先依實際演算法選擇精確法或近似法。使用常態近似時,可依尾端方向加入 0.5 連續性校正;若有相同的 |Dᵢ|,還必須使用 ties 修正後的變異數。

補充:推導 signed-rank 正等級和的平均數與變異數

以下的 n 是移除零差值後的有效樣本數。令 Iᵣ 表示第 r 個等級是否帶正號:帶正號時 Iᵣ=1,帶負號時 Iᵣ=0。在 H₀ 下,每個差值取正、負號的機率各為 1/2;沒有 ties 時,正等級和可寫成 T⁺=ΣrIᵣ。

先由指標變數得到平均數與變異數

正等級和T+=r=1nrIrT^+=\sum_{r=1}^{n}rI_r
每個正號指標E(Ir)=12,Var(Ir)=14E(I_r)=\frac12,\qquad\operatorname{Var}(I_r)=\frac14
逐步推導平均數E(T+)=E(r=1nrIr)=r=1nrE(Ir)=12r=1nr=n(n+1)4E(T^+)=E\left(\sum_{r=1}^{n}rI_r\right)=\sum_{r=1}^{n}rE(I_r)=\frac12\sum_{r=1}^{n}r=\frac{n(n+1)}4
逐步推導變異數Var(T+)=Var(r=1nrIr)=r=1nr2Var(Ir)=14r=1nr2=n(n+1)(2n+1)24\operatorname{Var}(T^+)=\operatorname{Var}\left(\sum_{r=1}^{n}rI_r\right)=\sum_{r=1}^{n}r^2\operatorname{Var}(I_r)=\frac14\sum_{r=1}^{n}r^2=\frac{n(n+1)(2n+1)}{24}

最後一行能直接相加各項變異數,是因為 H₀ 下各個非零差值的正負號彼此獨立,所以 Cov(Iᵣ,Iₛ)=0。若研究設計本身使各對差值不獨立,這個虛無分配就不能直接使用。

再從 2ⁿ 種正負配置完整展開

也可以完全依照精確分配的建立方式推導。令 X₁,X₂,…,Xₙ 為等級 1,2,…,n。每個等級可取正號或負號,因此共有 2ⁿ 種等機率配置;T⁺ 只加總配置中帶正號的等級。固定一個 Xᵢ,它在一半、也就是 2ⁿ⁻¹ 種配置中為正;固定兩個不同等級 Xᵢ、Xⱼ,它們同時為正的配置共有 2ⁿ⁻² 種。

從全部 2ⁿ 種配置取平均E(T+)=A(iAXi)2nE(T^+)=\frac{\displaystyle\sum_{\mathcal A}\left(\sum_{i\in\mathcal A}X_i\right)}{2^n}
每個 Xᵢ 出現 2ⁿ⁻¹ 次E(T+)=2n1iXi2nE(T^+)=\frac{2^{n-1}\sum_iX_i}{2^n}
代入等級總和E(T+)=12iXi=12n(n+1)2=14n(n+1)E(T^+)=\frac12\sum_iX_i=\frac12\frac{n(n+1)}2=\frac14n(n+1)

由全部配置的二次動差推導變異數

從變異數定義開始Var(T+)=A(iAXi)22n[14n(n+1)]2\operatorname{Var}(T^+)=\frac{\displaystyle\sum_{\mathcal A}\left(\sum_{i\in\mathcal A}X_i\right)^2}{2^n}-\left[\frac14n(n+1)\right]^2
計入平方項與交叉項出現次數=2n1iXi2+2n22i<jXiXj2nn2(n+1)216=\frac{2^{n-1}\sum_iX_i^2+2^{n-2}\,2\sum_{i<j}X_iX_j}{2^n}-\frac{n^2(n+1)^2}{16}
約去 2 的次方=12iXi2+14[(iXi)2iXi2]n2(n+1)216=\frac12\sum_iX_i^2+\frac14\left[\left(\sum_iX_i\right)^2-\sum_iX_i^2\right]-\frac{n^2(n+1)^2}{16}
合併 ΣXᵢ²=14iXi2+14(iXi)2n2(n+1)216=\frac14\sum_iX_i^2+\frac14\left(\sum_iX_i\right)^2-\frac{n^2(n+1)^2}{16}
代入兩個等級級數=14n(n+1)(2n+1)6+14[n(n+1)2]2n2(n+1)216=\frac14\frac{n(n+1)(2n+1)}6+\frac14\left[\frac{n(n+1)}2\right]^2-\frac{n^2(n+1)^2}{16}
後兩項相消後的結果Var(T+)=124n(n+1)(2n+1)\operatorname{Var}(T^+)=\frac1{24}n(n+1)(2n+1)

若改用帶正負號的等級總和

另一種記法不是只加正等級,而是直接把正、負等級相加,令 W=T⁺−T⁻。每個等級 r 以相同機率取 +r 或 −r,因此平均數為 0,單一項的變異數為 r²。

帶符號的等級總和W=T+TW=T^+-T^-
平均數E(W)=0E(W)=0
變異數Var(W)=r=1nr2=n(n+1)(2n+1)6\operatorname{Var}(W)=\sum_{r=1}^{n}r^2=\frac{n(n+1)(2n+1)}6

兩種統計量包含相同資訊,因為 W=2T⁺−n(n+1)/2。閱讀軟體輸出或查表時,必須先確認使用的是 T⁺、較小等級和 T,還是帶符號總和 W。

三種方法如何選擇?

方法樣本關係使用的資訊主要虛無假設
Sign test單一或成對差值正負正差與負差機率各為 1/2
Wilcoxon signed-rank單一或成對差值方向+|差值|等級差值分布以 0 為中心且對稱
Wilcoxon rank-sum / Mann–Whitney U兩組獨立合併後的資料等級兩組分配相同
  1. 先判斷資料是單一樣本、成對樣本,還是兩組獨立樣本。
  2. 明確寫出虛無假設是在談正負機率、對稱差值中心,還是兩組完整分配。
  3. 處理零差值與 ties,並在報告中說明有效樣本數及所用修正。
  4. 小樣本優先使用精確或排列方法;使用常態近似時說明連續性校正。
  5. 同時報告統計量、p 值、效果方向與適合的效果量,不只寫顯著或不顯著。