CHAPTER 02 · TOPIC 05
t 分配
t 分配(t-distribution),也稱為 Student's t distribution,用來描述母體標準差未知時,樣本平均數經標準化後的變動。它由 William Sealy Gosset 以「Student」為筆名發表,因此得
t 分配(t-distribution),也稱為 Student's t distribution,用來描述母體標準差未知時,樣本平均數經標準化後的變動。它由 William Sealy Gosset 以「Student」為筆名發表,因此得名。
t 分配如何形成?#
t 分配可以由一個標準常態變數 Z,以及一個與 Z 獨立、自由度為 ν 的卡方變數 U 建立。分母中的 U/ν 反映使用樣本資料估計變異數所帶來的不確定性。
| 符號 | 代表意義 |
| T | 服從 t 分配的隨機變數或 t 統計量 |
| Z | 標準常態變數 |
| U | 與 Z 獨立的卡方變數 |
| ν | t 分配的自由度 |
| X̄ | 樣本平均數 |
| μ | 母體平均數或假設中的平均數 |
| S | 樣本標準差,用來估計未知的 σ |
| n | 樣本數;單一樣本情境下 ν=n−1 |
t 分配與標準常態分配的差異#
t 分配和標準常態分配都以 0 為中心、左右對稱,也具有鐘形外觀。差別在於 t 分配的尾端較厚,表示離中心較遠的值具有較高機率。這是在母體標準差未知、必須使用樣本標準差估計時,對額外不確定性的反映。
| 比較 | 標準常態分配 | t 分配 |
| 中心 | 0 | 0 |
| 形狀 | 左右對稱、鐘形 | 左右對稱、鐘形 |
| 尾端 | 較薄 | 自由度低時較厚 |
| 決定形狀的參數 | 固定為 N(0,1) | 自由度 ν |
| 常見情境 | 母體標準差已知或使用常態近似 | 母體標準差未知,以樣本標準差估計 |
自由度如何影響 t 分配?#
自由度較低通常代表估計標準差所依賴的獨立資訊較少,因此不確定性較大,t 分配的尾端也較厚。隨著樣本數與自由度增加,樣本標準差對母體標準差的估計通常更穩定,t 分配便逐漸接近標準常態分配。
什麼時候會用到 t 分配?#
- 利用單一樣本平均數推論母體平均數
- 比較兩組獨立樣本的平均數
- 比較成對或重複測量資料的平均差
- 檢定迴歸係數或相關係數
- 建立母體平均數或迴歸係數的信賴區間
t 分配的機率密度函數#
自由度為 ν 的 t 分配具有以下機率密度函數。公式以 0 為中心且只含 t²,因此正負相同大小的 t 值具有相同密度,這正對應到 t 分配左右對稱的特性。
| 符號 | 代表意義 |
| f(t) | t 分配在 t 位置的機率密度 |
| t | t 隨機變數的可能值,可為任意實數 |
| ν | t 分配的自由度 |
| Γ | Gamma 函數;階乘概念的延伸 |
| π | 圓周率 |
補充:t 密度函數的推導
第一步:從 t 變數的定義出發
令 Z 服從標準常態分配,U 服從自由度為 ν 的卡方分配,而且 Z 與 U 彼此獨立。定義 T=Z/√(U/ν)。為了求 T 的密度,同時保留一個輔助變數 V=U。
獨立性使 Z 與 U 的聯合密度可以寫成兩個密度的乘積。進行變數轉換後,再乘上 Jacobian,便得到 T 與 V 的聯合密度。
第二步:把輔助變數 V 積分掉
把標準常態密度與卡方密度代入,再對所有可能的 v>0 積分,就能只留下 T 的邊際密度。
積分部分具有 Gamma 積分的形式。利用下列關係,可以把積分直接化簡。
第三步:得到 t 密度
因此,t 密度確實是從標準常態密度、卡方密度與 T 的定義推導而來。Gamma 函數之所以出現,是因為把卡方變數積分掉時,積分正好具有 Gamma 函數的形式。
| 符號 | 在推導中的意義 |
| V | 為了進行變數轉換而保留的輔助變數,等於 U |
| fT,V | T 與 V 的聯合密度 |
| ∂(z,u)/∂(t,v) | 多變數轉換的 Jacobian 行列式 |
| a、b | 套用 Gamma 積分時使用的暫時參數 |
補充:Gamma 函數是什麼?
Gamma 函數(Gamma function)把階乘的概念延伸到正整數以外的數值。對正整數 n 而言,Γ(n)=(n−1)!;因此它可以在含有半數自由度等非整數參數的密度函數中,扮演類似階乘的角色。
在 t 分配的密度函數中,Gamma 函數主要出現在前方的常數係數,用來依自由度調整曲線,並確保整條密度曲線下的總面積等於 1。理解 t 分配時不必手動計算 Gamma 函數,但知道它的角色,就不會把 Γ 當成沒有意義的裝飾符號。