CHAPTER 06
變異數分析
Analysis of Variance
章節目錄
- ANOVA(analysis of variance)單因子獨立樣本變異數分析
- 假設檢定 H0:μ1=μ2=…=μj H1:μi≠μk,存在部分的i及k。或是:至少一組的母群平均數其他組不同
- 變異數分析的事後比較
- 補充:2組資料求得的F(單因子獨立樣本變異數分析)其實就提t2
ANOVA(analysis of variance)單因子獨立樣本變異數分析
用來比較兩群以上沒有關聯之樣本,在某個變數的平均數是否有差異
其是就是分組,然後看分組的效果好不好(分組其是就是一個model,之後在做回歸分析時,model就是那條線的方程式,分析方法其實類似)
要比較分組的效果好不好就是比較組間的平方和和組內的平方和(組內的平方和就相當於error),當然組間的平方和愈大愈好,而用的是將組間和組內的相除(因為有個數的關系,所以各要除於其自由度),為MSM/MSE。而兩個相除就相當於組間的卡方值(n個獨立標準常態變數之平方和的分配)與組內的卡方值相除,所以結果就是F分配,用來求p值的就是用F來求
因為F值為MSM/MSE,而組間的相差(MSM)大愈好,組內(MSE)愈小愈好,所以F值愈大愈好,此時p值也是愈小愈好
我們在求MSE時,是直接把全部的組內離差平方和相加,再除以組內的自由度,但是每組的平均都不一樣,卻可以全部相加然後相除?因為我們其實以經有假設每組組內的分佈是符合常態分佈,而且他們的標準差都一樣了(這邊和獨立樣本t檢定一樣),所以可以直接相加相除。另外,就F分配的定義來說,其是兩組卡方分配相除,而其中一組是組間,另一組是組內,但組內可能有很多組,卻只得出一個卡方分配的值的原因就是他已經假設他們的標準差一樣了才可以這樣,否則就不是F分配了。
資料形式自變數:兩個以上獨立而沒有關聯的組別,為質的變數。自變數又稱因子(factor),而單因子就是只有一個自變數依變數:量的變數
假設檢定 H0:μ1=μ2=…=μj H1:μi≠μk,存在部分的i及k。或是:至少一組的母群平均數其他組不同
統計公式解說:(假設全體樣本數有n個,分成k組)
| Group 1 | Group 2 | … | Group j | |
| X11 | X12 | … | X1k | |
| X21 | X22 | TotalTotal… | X2k | |
| . | . | . | . | |
| errorerror. | . | . | . | |
| Xn11 | Xn22 | . | Xnkk | |
| X1 | X2 | … | Xk | X |
ModelModel
可以看成是一個Model公式:Xij=μ+αij+eij
μ(X):總平均
αij(Xj-X):j組平均與總平均的差(組偏差)那一組的效果
eij(Xij-Xj):j組內的變異(variance),也就是自己與自己那組平均的差距個人誤差
資料處理
每一組資料可以拆成兩部分error(組內)和model(組間),其相加為total
error=Xij-Xj
model=Xj-X
total=Xij-X
資料計算一:
組內離差平方和SSE=j=1ki=1nj(Xij-Xj)2
組間離差平方和SSM=j=1ki=1nj(Xj-X)2=j=1knj(Xj-X)2
而所有資料的離差平方和SS=j=1ki=1nj(Xij-X)2=SSE+SSM(證明略)
資料計算二:
有了SSE和SSM後,因為還有個數的不同,所以各自除上其自由度,得到MSE和MSM:
組內自由度 = 總樣本數 – 組數 = n - k
組間自由度 = 組數 – 1 = k – 1
全體自由度 = 總樣本數 – 1 = n - 1
資料計算三:
MSE=SSE/組內自由度
MSM=SSM/組間自由度
最後再將MST/MSE求得F值,再差表或用電腦算求p值
然後就可以看是否可以拒絕虛無假設
最後就可以得到一個表格(假設全體樣本數有n個,分成k組):
| 變異來源 | 離差平方和 | 自由度df | 均方MS | F值 | p值 |
| 組間 | SSM | k - 1 | MSM | F | p |
| 組內 | SSE | n - k | MSE | ||
| 全體 | SST | k - 1 |
其實除了單因子獨立樣本變異數分析(ANOVA)之外,還有相依樣本的、二因子的、甚至還有單因子多變量變異數分析,由資料的不同形式,而經過不同的處理,但觀念大致就和ANOVA差不多。其中單因子相依樣本變異數分析的公式和ANOVA差不多,而其他像二因子或多變量的分析就會複雜許多,可能會有兩兩比較或是其他更多的處理方式之類的,這邊就不予以介紹了。
變異數分析的事後比較
雖然變異數分析後得到顯著的結果,但其所提供的資訊有限,如哪兩組之間比較顯著之類的,所以未了得到更進一步的資料,就會再做事後比較。而兩兩在做比較時,關於標準誤要怎麼定?檢定的出來的p值是否能拒絕虛無假設的範圍(α)要怎麼定?是不是和變異數分析的一樣?會因不同的校正方法會有不同的效果,各有其優缺點,而因有不同的校正方法,所以就有以下各種不同的事後比較法。
Fisher的LSD法(least significant difference)
其就是採用t檢定的方法,兩兩進行t檢定,只是其用的標準誤是用MSE(1ni+1nj),公式為t=Xi-XjMSE(1ni+1nj)=不均數差異標準誤
而其α並沒有做調整,也就是如果我們變異數分析的α定0.05的話,這邊也是0.05,也就是說用上面的t得到的p小於0.05時,就可以說兩組的分類是顯著的。所以其缺點就是會使第一類型錯誤機率膨脹,也就是比較寬鬆,因為每多做一次的檢定,誤差其實就會變大。
Bonferroni法、Bonferroni t Test
因為Fisher的LSD法會造成型一誤差膨脹的原因,因此對α做校
正,就是把α除以對比的次數(如:總共有三組的話,兩兩比較總共會有C23=3次的對比次數),其他的公式則和Fisher的LSD法一樣。而其缺點就是太過於保守,當進行愈來愈多次的事後比較時,校正後的型一誤差就會變得非常低,就很難說兩組的分類的顯著的,也就是說把α降低了,但是β增加了,連帶使統計檢定力(1-β)降低。
設α1是兩組之料間的type 1 error,αN是進行N次比較後全部資料的type 1 error,我們有αN=1-(1-α1)N≈Nα1的關系,而我們一般定的標準是αN,我們取兩個出來檢定的標準是α1,所以要將αN除以N(事後比較次數)
Holm法、Holm t test、Holm’s step down test他的校正方法就是把LSD檢定的p值由大到小排序,最大的第一個p值乘上1(等於未校正),其次的第2個p值乘上2,後面的則依次類推,乘上3、4…;另一種看法是把原本定的型一誤差αT除以其排序,變成該組的型一誤差αT'。如果p值相同,則乘上較大的序號。Holm的校正方法會比Bonferroni法更具統計檢定力。
The Holm-Sidak t Test他的校正方法結合了上面的Bonferroni和Holm t test,假設原本的定的型一誤差為αT,而兩兩比較後,假設其中一組的p值排序(大到小)是第k個,則這一組的型一誤差(調整後的αT) αT'=1-(1-αT)1k。
補充:2組資料求得的F(單因子獨立樣本變異數分析)其實就提t2
獨立樣本t檢定公式:
t=X1-X2sp2(1n1+1n2), sp2=s12n1-1+s22n2-1n1+n2-2
2組資料求F(MSE/MST)
先求MSE:其實sp2就是MSE,因為分母n1+n2-2就是自由度、
分母s12n1-1+s22n2-1就是組內離差平方的和
所以MSE=sp2
再求MST(每項數據的組間離差平方和):全部的平均X=n1X1+n2X2n1+n2
而MST=12-1[n1(X1-n1X1+n2X2n1+n2)2+n2(X2-n1X1+n2X2n1+n2)2]
=n1n22(X1-X2)2+n12n2(X2-X1)2(n1+n2)2
=n1n2(X1-X2)2n1+n2=(X1-X2)21n1+1n2
則F=MSTMSE=(X1-X2)2sp2(1n1+1n2)=t2
所以兩組資料求F也就是兩組資料求t2