生物統計學習筆記從概念、推導到實務判讀

CHAPTER 04 · TOPIC 02

t 檢定概念

t 檢定(t test)用來檢驗母體平均數或平均數差。它和 Z 檢定具有同一個基本結構:先計算觀察到的差異,再用這個差異的標準誤進行標準化。兩者真正的分界,不是公式外觀,而是母體標準差 σ 是否已知。

本頁內容
  1. 先從 Z 檢定開始
  2. 現實中通常不知道母體標準差 σ
  3. 從 Z 統計量推到 t 統計量
  4. 為什麼 t 分配需要自由度?
  5. Z 檢定與 t 檢定的比較
  6. t 檢定不是只有一種
  7. t 檢定的基本假設
  8. 本頁符號說明

t 檢定(t test)用來檢驗母體平均數或平均數差。它和 Z 檢定具有同一個基本結構:先計算觀察到的差異,再用這個差異的標準誤進行標準化。兩者真正的分界,不是公式外觀,而是母體標準差 σ 是否已知。

先從 Z 檢定開始

對個別觀察值而言,Z 分數描述 Xi 距離母體平均數 μ 有多少個母體標準差。研究樣本平均數時,則必須改用樣本平均數的標準誤 σ/√n。

個別觀察值的 Z 分數Zi=XiμσZ_i=\frac{X_i-\mu}{\sigma}
抽樣平均數的中心E(Xˉ)=μE(\bar X)=\mu
抽樣平均數的標準誤SE(Xˉ)=σn\operatorname{SE}(\bar X)=\frac{\sigma}{\sqrt n}
平均數的 Z 統計量Z=Xˉμ0σ/nZ=\frac{\bar X-\mu_0}{\sigma/\sqrt n}

在 H₀: μ=μ₀ 成立且抽樣分配為常態或可合理近似常態時,這個 Z 統計量服從標準常態分配,因此可利用 Z 分配求臨界值與 p 值。

現實中通常不知道母體標準差 σ

完整母體往往無法全部觀察,因此母體平均數 μ 未知時,母體標準差 σ 通常也未知。我們只能由同一份樣本計算樣本標準差 s,作為 σ 的估計。

樣本變異數s2=1n1i=1n(XiXˉ)2s^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2
樣本標準差s=i=1n(XiXˉ)2n1s=\sqrt{\frac{\sum_{i=1}^{n}(X_i-\bar X)^2}{n-1}}
估計後的標準誤SE^(Xˉ)=sn\widehat{\operatorname{SE}}(\bar X)=\frac{s}{\sqrt n}

從 Z 統計量推到 t 統計量

如果只是把 Z 公式中的 σ 換成 s,公式外觀看似只改了一個符號;但 σ 是固定的母體參數,s 卻是隨樣本變動的隨機變數。要理解 t 分配為何出現,必須把這一層隨機性寫出來。以下假設 X₁,…,Xₙ 為來自常態母體的獨立樣本。

平均數標準化後為標準常態Z=Xˉμσ/nN(0,1)Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1)
樣本變異數形成卡方變數U=(n1)s2σ2χn12U=\frac{(n-1)s^2}{\sigma^2}\sim\chi^2_{n-1}
常態樣本下兩者互相獨立ZUZ\perp U
t 分配的建立方式T=ZU/(n1)tn1T=\frac{Z}{\sqrt{U/(n-1)}}\sim t_{n-1}

把 Z 與 U 的定義完整代回去,可以看到未知的 σ 如何被消去:

代入 Z 與 UT=Xˉμσ/n(n1)s2/σ2n1T=\frac{\dfrac{\bar X-\mu}{\sigma/\sqrt n}}{\sqrt{\dfrac{(n-1)s^2/\sigma^2}{n-1}}}
化簡根號中的式子(n1)s2/σ2n1=s2σ2=sσ\sqrt{\frac{(n-1)s^2/\sigma^2}{n-1}}=\sqrt{\frac{s^2}{\sigma^2}}=\frac{s}{\sigma}
消去 σT=Xˉμσ/nσs=Xˉμs/nT=\frac{\bar X-\mu}{\sigma/\sqrt n}\cdot\frac{\sigma}{s}=\frac{\bar X-\mu}{s/\sqrt n}
單一樣本 t 統計量t=Xˉμ0s/n,ν=n1t=\frac{\bar X-\mu_0}{s/\sqrt n},\qquad \nu=n-1

為什麼 t 分配需要自由度?

t 統計量的分母使用 s,而 s 的穩定程度取決於估計它時有多少獨立資訊。自由度較低時,s 的波動較大,t 分配必須配置更多尾端機率;自由度增加後,s 逐漸穩定,t 分配也逐漸接近標準常態分配。

tννdN(0,1)t_\nu\xrightarrow[\nu\to\infty]{d}N(0,1)
符號在這組公式中的意義
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

Z 檢定與 t 檢定的比較

比較項目Z 檢定t 檢定
母體標準差σ 已知σ 未知,以 s 估計
平均數的標準誤σ/√ns/√n
H₀ 下的參考分配標準常態 N(0,1)t 分配
是否需要自由度不需要需要;單一樣本時 ν=n−1
尾端較薄低自由度時較厚
樣本增加後維持標準常態逐漸接近標準常態

t 檢定不是只有一種

三種常見 t 檢定都在比較平均數,但研究設計不同,真正拿來形成 t 統計量的『差異』與標準誤也不同。不能只因為都有兩欄數字,就使用相同公式。

方法要回答的問題真正分析的量
單一樣本 t 檢定一個母體平均數是否等於指定值 μ₀?X̄−μ₀
相依/配對樣本 t 檢定同一受試者前後或成對資料的平均差是否為 0?先算每一對差值 di,再分析 d̄
獨立樣本 t 檢定兩個互不相依母體的平均數是否相同?X̄₁−X̄₂

t 檢定的基本假設

  • 資料應來自隨機抽樣或適當的隨機分派,觀察單位之間的獨立性必須符合研究設計。
  • 依變數為可合理計算平均數與差值的數值資料。
  • 單一樣本 t 檢定要求觀察值所來自的母體近似常態;配對 t 檢定關心的是『配對差值』的分配;獨立樣本 t 檢定則關心各組與模型誤差。
  • t 檢定對輕微偏離常態通常具有一定穩健性,但小樣本下的明顯偏態與離群值可能造成很大影響。
  • 獨立樣本 t 檢定還要區分等變異的 pooled t 與不要求等變異的 Welch t;這會在後續頁面說明。

本頁符號說明

符號代表意義
Xi第 i 個觀察值;抽樣前視為隨機變數
樣本平均數
μ、μ₀母體平均數、H₀ 指定的母體平均數
σ母體標準差;在 t 檢定情境中未知
s由樣本估計的標準差
n樣本數
ν自由度;單一樣本時 ν=n−1
U由樣本變異數形成的卡方隨機變數
自由度為 ν 的 t 分配