CHAPTER 08
無母數分析
Nonparametric Analysis
章節目錄
- Wilcoxon test
- 假設檢定(雙尾): H0:p=12 vs. H1:p≠12(單尾的話就把=改≥或≤,然後公式的型一誤差調一下就行了)
- 中位數檢定
- Kruskal-Wallis test
Wilcoxon test
為無母數檢定,無母數檢定用於探討非常態母群或是中位數檢定的差異,用於成對樣本(相依樣本)的比較上常使用魏克生符號檢定與符號檢定,以下詳細說明。
無母數檢定:母群體未知且非常態分布的類別資料與等級資料,或是用於樣本數較小時。
魏克生符號檢定或符號檢定(Sign test)
用於一組樣本(檢定母體中位數是否等於某特定值)或成對樣本(兩組母體的中位數是否相等)在同一個變項的分佈狀況的檢驗。
例子:病人在醫院滿意度調查,從非常不滿意1到非常滿意7,隨機詢問五個病人,中位數是否為4;同一名病患的飯前血糖濃度與飯後血糖濃度的差異。
使用時機相當於One Sample T test與Paired t-test,只是差在無母數
資料處理設資料為X1 , X2 , …, Xi , …, Xn,令 -1 當Xi-M0<0 Zi= 0 當Xi-M0=0 1 當Xi-M0>0以正負號的個數當統計量做為檢定的基礎,然後就把他當二項配來做。
因為當作二項分配來看,而虛無假設是中位數為某個數,因此在虛無假設是對的情況下,比中位數大的和小的機率應該一樣,所一這邊把和中位數一樣的去掉後,二邊的機率分別為12,我們這邊把比較大的個數的隨機變數當做C,而其機率為p=12,此時EC=np=n2、VarC=npq=n4,這邊的n是已經去掉和中位數一樣的。
假設檢定(雙尾): H0:p=12 vs. H1:p≠12(單尾的話就把=改≥或≤,然後公式的型一誤差調一下就行了)
統計公式(用Z值,因如果樣本數過多時,二項分配接近常態):
Z=C-n/2n/4,然後可以以此來查p值
如果C>n2+Z1-α/2n/4或C<n2-Z1-α/2n/4可拒絕H0
如果n不到20,而要p值的話,就算其在期望值之外的機率例:當n=10,C=8>10/2=5時,p=2×810Ck10(12)10
其實就是將原本的數值經過轉換,換成正和負,然後就可以用二項分配來看,所以如果是要比兩組資料時,就和二項分配兩組資料的看法差不多,以上是討論一組資料的。
Wilcoxon rank sum test (Wilcoxon 等級和檢定= Mann-Whitney U test)
例:5位精神障礙者,其中2人給安慰劑、3人給藥,之後以嚴重程度給與等級1~5 (1為最嚴重)
H0:藥沒效,則以下C35種方法機率一樣
| 給藥 | 3,4,5 | 2,4,5 | 1,4,5 | 2,3,5 | 1,3,5 | 2,3,4 | 1,3,4 | 1,2,4 | 1,2,3 | 1,2,5 |
| 對照 | 1,2 | 1,3 | 2,3 | 2,4 | 2,4 | 1,5 | 2,5 | 3,5 | 4,5 | 3,4 |
可得Ws的機率密度函數(Ws為給藥之等級和)
| w | 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| P(Ws=w) | 0.1 | 0.1 | 0.2 | 0.2 | 0.2 | 0.1 | 0.1 |
公式:全部N個(符級1~N),處理(給藥)n個,剩N-n=m個,記為#(w;n,m)為處理之等級和為w之分割總組數則P(Ws = w) = #(w;n,m)Nn
若m ≤ 10, n ≤ 10時,查表
若超過此範圍可用常態近似(數量不夠多時,也可以用-1/2來近似)
P[T-EWsVarWs≤α] ≈ Φα
EWs= 12n(N+1)
VarWx= 112mn(N+1)
類似於independent t test,為二獨立樣本的檢定
公式證明(補充):
EWs= XiNn=XiN-1n-1Nn
=nNXi=nNN(N+1)2=12n(N+1)
VarWs= (Xi)2Nn-[12n(N+1)]2
=Xi2N-1n-1Nn+2XiYjN-2n-2Nn-n2(N+1)24
=nNXi2+n(n-1)N(N-1)[(Xi)2-Xi2]-n2(N+1)24
=n(N-n)(N+1)(2N+1)6(N-1)-nN+12N-n4N-1=n(N-n)(N+1)(N-1)12(N-1)
=112nm(N+1)
Wilcoxon sign ranked test (Wilcoxon符號秩檢定)
其和Sign test主要差異在於Wilcoxon sign rank test不只考慮正負方向,還考慮了與基準點的距離,因此相比之下是更好的方法。
其先把資料和中位數的距離(絕對值)排序後(如果相同則取平均)、把負的前面直接加負號,然後求得T=正排序和 or |負排序和|。
而所得T值的期望值及變異數(因為拆成正負然後取一,所以要除2):
ET=121+2+…+n=n(n+1)4
VarT=1212+22+…+n2=nn+1(2n+1)24
類似於one sample t test或paired t test,可用在單一樣本或相依樣本
除查表外,當數字較大時,可用常態近似
當樣本數n≥20 Z=|T-nn+14|nn+1(2n+1)24
當樣本數n<20(不像常態分配,所以要修正) Z=T-nn+14-12nn+1(2n+1)24
然後就可以由Z值來求p值,看可不可以拒絕虛無假設
例(相依樣本):比較新舊肥料,將3個草苺園分2部分(一個用新,另一個用舊),得到下面的表
| 新(收獲) | 76 | 82 | 80 |
| 舊(收獲) | 78 | 91 | 86 |
| | 新 – 舊 | | 2 | 9 | 6 |
| 等級 | 1 | 3 | 2 |
H0:假設新和舊不影響(即在相差相同下,正和負的機率一樣)
把每一個果園內的差也考慮進去,也就是說第二果園的(新-舊)的等級就為+3或-3,二者機率相同為1/2,全部會有±1, ±2, ±3,總共8種可能
我們這邊取正的,負的忽略之得到下表
| (-1,-2,-3) | (-1,-2,3) | (-1,2,-3) | (-1,2,3) | (1,-2,-3) | (1,-2,3) | (-1,-2,3) | (1,2,3) | |
| Vs | 0 | 3 | 2 | 5 | 1 | 4 | 3 | 6 |
則Vs的機率密度函數
| v | 0 | 1 | 2 | 3 | 4 | 5 | 6 |
| P(Vs = v) | 0.125 | 0.125 | 0.125 | 0.25 | 0.125 | 0.125 | 0.125 |
公式證明(補充)
EVs= Xi2N=2N-1Xi2N =12Xi=14N(N+1)
VarVs= (Xi)22N-[14N(N+1)]2
=2N-1Xi22N+2N-2×2XiYj2N-N2(N+1)216
=12Xi2+14[(Xi)2-Xi2]-N2(N+1)216
=14Xi2+14(Xi)2-N2N+1216=124N(N+1)(2N+1)
原文書裡面的Wilcoxon sign ranked test不是只加正號或負號,直接把正的和負的數直接相加,此時EW=0, VarW= 16N(N+1)(2N+1)
中位數檢定
前面的統計方法,二母體之資料需成對,若無成對時就需要用中位數檢定來做。
虛無假設H0:假設兩個分布是相同的,則兩組的數據混合再一起排序後,中位數兩邊該組的量應該是平均的、成比例的。
有二個母體,各有n1, n2個數據,混合排列後,二組間在中位數旁邊數據個數的有m1, m2個,在虛無假設為具的狀況下,其機率為n1m1n2m2n1+n2m1+m2
由上面的機率公式,我們就可以得到在不同的m1, m2下的分布函數,就可以得到機率密度函數,也就可以求p值。另外m1和m2是相關的,因為它們的和是在中位數旁的個數,所以當n1+n2為偶數時,m1+m2 = 1/2(n1+n2);n1+n2為奇數時,m1+m2 = 1/2(n1+n2-1)。
當n1, n2大時可利用常態分布求近似值,公式:
τ=m1n1-m2n2pq[1n1+1n2]≈N(0, 1),其中p=m1+m2n1+n2 , q=1-p
公式說明:
關於上面用常態近似的公式,我們可以先看成是m1n1-m2n2的分布,其中n1和n2是已知的,我m1和m2是會因試驗而變的且是相關的,因此就先看的m1n1-m2n2分布狀況
而經過推導後(過程略), Em1n1-m2n2=0,Varm1n1-m2n2=(1n1-1n2)( m1+m2n1+n2×m1+m2-1n1+n2-1) ≈ pq[1n1+1n2]
因此就有了上面常態近似的公式
Kruskal-Wallis test
檢定多組不是常態分布的獨立母群體(無母數檢定),想要知道處理(分組)是不是有用,也就是組間是不是存在差異,有點類似變異數分析,只是他是無母數分析,另外變異數分析是轉換成F分布,Kruskal-Wallis是轉換成卡方分布。
檢定方法:
先將各組樣本混合並排序,依數值由小排到大並標記排序分數
再將排序分數放回原各組內,分開加總各組之排序分數得R1, R2...Rs。
藉由R1, R2...Rs與各組樣本數n1, n2...ns換算成檢定統計量 H;H 機率分布為自由度 k-1 之 卡方分布 並用以檢定是否各組統計量完全相等。
K-W 檢定各組樣本數至少要 5 以上。
K-W 檢定與有母數分析法中 變異數分析 的使用情況相似。
虛無假設H0:處理間沒有差異
公式:
假設第i群處理:Ri‧= Ri1+…+Rinini,Ri=Ri1+…+Rini
所有數的和為1+2+…+N = 12N(N+1),所以所有數的平均R‧‧=N+12
Kruskal-Willis統計量: K= 12N(N+1)i=1sni(Ri‧-N+12)2=12N(N+1)i=1sRi2ni-3(N+1)K會呈自由度為S-1之卡方分布
重要表格:
| 單一樣本 | 獨立樣本(2 groups) | 相依樣本(2 repeats) | 獨立多組(≥3 groups) | |
| 二元變數 | Chi-squared Fisher’s exact | McNemar’s test | Chi-squared | |
| 常態連續變數 | One sample T test | Independent sample T test | Paired t-test | One-way ANOVA |
| 非常態連續變數 | Wilcoxon signed rank test or Signed test | Mann-Whitney U test (Wilcoxon rank-sum test) | Wilcoxon signed rank test or Signed test | Kruskal-Wallis test |
| 次序變數 | Wilcoxon signed rank test or Signed test | Mann-Whitney U test (Wilcoxon rank-sum test) | Wilcoxon signed rank test or Signed test | Kruskal-Wallis test |