生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02 · TOPIC 05

t 分配

t 分配(t-distribution),也稱為 Student's t distribution,用來描述母體標準差未知時,樣本平均數經標準化後的變動。它由 William Sealy Gosset 以「Student」為筆名發表,因此得

本頁內容
  1. t 分配如何形成?
  2. t 分配與標準常態分配的差異
  3. 自由度如何影響 t 分配?
  4. 什麼時候會用到 t 分配?
  5. t 分配的機率密度函數

t 分配(t-distribution),也稱為 Student's t distribution,用來描述母體標準差未知時,樣本平均數經標準化後的變動。它由 William Sealy Gosset 以「Student」為筆名發表,因此得名。

t 分配如何形成?#

t 分配可以由一個標準常態變數 Z,以及一個與 Z 獨立、自由度為 ν 的卡方變數 U 建立。分母中的 U/ν 反映使用樣本資料估計變異數所帶來的不確定性。

由標準常態與卡方變數建立T=ZU/νtνT=\frac{Z}{\sqrt{U/\nu}}\sim t_{\nu}
單一樣本平均數的 t 統計量T=XˉμS/ntn1T=\frac{\bar X-\mu}{S/\sqrt n}\sim t_{n-1}
符號代表意義
T服從 t 分配的隨機變數或 t 統計量
Z標準常態變數
U與 Z 獨立的卡方變數
νt 分配的自由度
樣本平均數
μ母體平均數或假設中的平均數
S樣本標準差,用來估計未知的 σ
n樣本數;單一樣本情境下 ν=n−1

t 分配與標準常態分配的差異#

t 分配和標準常態分配都以 0 為中心、左右對稱,也具有鐘形外觀。差別在於 t 分配的尾端較厚,表示離中心較遠的值具有較高機率。這是在母體標準差未知、必須使用樣本標準差估計時,對額外不確定性的反映。

比較標準常態分配t 分配
中心00
形狀左右對稱、鐘形左右對稱、鐘形
尾端較薄自由度低時較厚
決定形狀的參數固定為 N(0,1)自由度 ν
常見情境母體標準差已知或使用常態近似母體標準差未知,以樣本標準差估計

自由度如何影響 t 分配?#

自由度較低通常代表估計標準差所依賴的獨立資訊較少,因此不確定性較大,t 分配的尾端也較厚。隨著樣本數與自由度增加,樣本標準差對母體標準差的估計通常更穩定,t 分配便逐漸接近標準常態分配。

自由度為 1、2、3、5、10 與 100 的 t 分配密度曲線,並與標準常態分配比較;自由度增加時 t 分配逐漸接近標準常態分配
自由度較低時,t 分配的中央較低、尾端較厚;自由度增加後,曲線逐漸接近標準常態分配 N(0,1)。來源:本站依 t 分配密度函數製作

什麼時候會用到 t 分配?#

  • 利用單一樣本平均數推論母體平均數
  • 比較兩組獨立樣本的平均數
  • 比較成對或重複測量資料的平均差
  • 檢定迴歸係數或相關係數
  • 建立母體平均數或迴歸係數的信賴區間

t 分配的機率密度函數#

自由度為 ν 的 t 分配具有以下機率密度函數。公式以 0 為中心且只含 t²,因此正負相同大小的 t 值具有相同密度,這正對應到 t 分配左右對稱的特性。

f(t)=Γ ⁣((ν+1)/2)νπΓ ⁣(ν/2)(1+t2ν)(ν+1)/2,<t<f(t)=\frac{\Gamma\!\left((\nu+1)/2\right)}{\sqrt{\nu\pi}\,\Gamma\!\left(\nu/2\right)}\left(1+\frac{t^2}{\nu}\right)^{-(\nu+1)/2},\qquad -\infty<t<\infty
符號代表意義
f(t)t 分配在 t 位置的機率密度
tt 隨機變數的可能值,可為任意實數
νt 分配的自由度
ΓGamma 函數;階乘概念的延伸
π圓周率
補充:t 密度函數的推導

第一步:從 t 變數的定義出發

令 Z 服從標準常態分配,U 服從自由度為 ν 的卡方分配,而且 Z 與 U 彼此獨立。定義 T=Z/√(U/ν)。為了求 T 的密度,同時保留一個輔助變數 V=U。

變數轉換T=ZU/ν,V=UT=\frac{Z}{\sqrt{U/\nu}},\qquad V=U
反向表示Z=TV/ν,U=VZ=T\sqrt{V/\nu},\qquad U=V
Jacobian(z,u)(t,v)=vν\left|\frac{\partial(z,u)}{\partial(t,v)}\right|=\sqrt{\frac{v}{\nu}}

獨立性使 Z 與 U 的聯合密度可以寫成兩個密度的乘積。進行變數轉換後,再乘上 Jacobian,便得到 T 與 V 的聯合密度。

fT,V(t,v)=fZ ⁣(tv/ν)fU(v)vνf_{T,V}(t,v)=f_Z\!\left(t\sqrt{v/\nu}\right)f_U(v)\sqrt{\frac{v}{\nu}}

第二步:把輔助變數 V 積分掉

把標準常態密度與卡方密度代入,再對所有可能的 v>0 積分,就能只留下 T 的邊際密度。

fT(t)=12πν2ν/2Γ(ν/2)0v(ν+1)/21exp ⁣[v2(1+t2ν)]dvf_T(t)=\frac{1}{\sqrt{2\pi\nu}\,2^{\nu/2}\Gamma(\nu/2)}\int_0^{\infty}v^{(\nu+1)/2-1}\exp\!\left[-\frac{v}{2}\left(1+\frac{t^2}{\nu}\right)\right]dv

積分部分具有 Gamma 積分的形式。利用下列關係,可以把積分直接化簡。

0va1ebvdv=Γ(a)ba,a>0, b>0\int_0^{\infty}v^{a-1}e^{-bv}\,dv=\frac{\Gamma(a)}{b^a},\qquad a>0,\ b>0

第三步:得到 t 密度

fT(t)=Γ ⁣((ν+1)/2)νπΓ ⁣(ν/2)(1+t2ν)(ν+1)/2,<t<f_T(t)=\frac{\Gamma\!\left((\nu+1)/2\right)}{\sqrt{\nu\pi}\,\Gamma\!\left(\nu/2\right)}\left(1+\frac{t^2}{\nu}\right)^{-(\nu+1)/2},\qquad -\infty<t<\infty

因此,t 密度確實是從標準常態密度、卡方密度與 T 的定義推導而來。Gamma 函數之所以出現,是因為把卡方變數積分掉時,積分正好具有 Gamma 函數的形式。

符號在推導中的意義
V為了進行變數轉換而保留的輔助變數,等於 U
fT,VT 與 V 的聯合密度
∂(z,u)/∂(t,v)多變數轉換的 Jacobian 行列式
a、b套用 Gamma 積分時使用的暫時參數
補充:Gamma 函數是什麼?

Gamma 函數(Gamma function)把階乘的概念延伸到正整數以外的數值。對正整數 n 而言,Γ(n)=(n−1)!;因此它可以在含有半數自由度等非整數參數的密度函數中,扮演類似階乘的角色。

Gamma 函數的定義Γ(a)=0xa1exdx,a>0\Gamma(a)=\int_0^{\infty}x^{a-1}e^{-x}\,dx,\qquad a>0
遞迴關係Γ(a+1)=aΓ(a)\Gamma(a+1)=a\,\Gamma(a)
與階乘的關係Γ(n)=(n1)!,n=1,2,3,\Gamma(n)=(n-1)!,\qquad n=1,2,3,\ldots
常見的半整數值Γ ⁣(12)=π\Gamma\!\left(\frac12\right)=\sqrt{\pi}

在 t 分配的密度函數中,Gamma 函數主要出現在前方的常數係數,用來依自由度調整曲線,並確保整條密度曲線下的總面積等於 1。理解 t 分配時不必手動計算 Gamma 函數,但知道它的角色,就不會把 Γ 當成沒有意義的裝飾符號。