生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02 · TOPIC 02

自由度

自由度(degrees of freedom, df)用來描述:在既定條件或限制下,一組資料中仍有多少個彼此獨立、可以自由變動的資訊。它不是資料的大小,也不是可以任意刪除的資料筆數,而是計算某個統計量時實際保留下來的獨立資訊量。

本頁內容
  1. 用固定平均數理解自由度
  2. 從線性代數理解自由度
  3. 為什麼樣本變異數使用 n−1?
  4. 自由度不一定都是 n−1

自由度(degrees of freedom, df)用來描述:在既定條件或限制下,一組資料中仍有多少個彼此獨立、可以自由變動的資訊。它不是資料的大小,也不是可以任意刪除的資料筆數,而是計算某個統計量時實際保留下來的獨立資訊量。

用固定平均數理解自由度#

假設有 4 筆資料,而且已知它們的平均數為 10。這表示四個數值的總和必須等於 40。前三個數值可以自由選擇,但選定後,第四個數值就不能再任意改變,否則平均數將不再是 10。

平均數所形成的限制x1+x2+x3+x44=10x1+x2+x3+x4=40\frac{x_1+x_2+x_3+x_4}{4}=10\quad\Longrightarrow\quad x_1+x_2+x_3+x_4=40
前三個值決定第四個值x4=40(x1+x2+x3)x_4=40-(x_1+x_2+x_3)
可以自由變動的資訊量df=41=3df=4-1=3

例如前三個數值若為 8、11、13,第四個數值就只能是 8,四個數值的平均數才會維持為 10。因此,雖然資料共有 4 筆,真正能自由決定的只有 3 筆。

符號代表意義
n資料筆數或樣本數
df自由度;能提供獨立資訊的數量
xᵢ第 i 筆觀察值
樣本平均數
n−1估計一個平均數後,剩餘的自由度

從線性代數理解自由度#

自由度與線性代數中的「維度」和「獨立方向」有很深的關係。若一組資料有 n 個數值,而且沒有任何限制,可以把它想成能在 n 個彼此獨立的方向上變動;此時具有 n 個自由度。加入一個真正獨立的限制後,其中一個方向便不再能自由變動,所以通常只剩下 n−1 個自由度。

前面的固定平均數例子正是如此。四個數值原本可以各自改變,相當於有四個變動方向;當總和必須固定為 40,其中一個方向便受到限制,資料只能在仍符合總和為 40 的範圍內移動。因此,這組資料雖然仍有四個數值,卻只剩三個彼此獨立的變動方向。

這也說明了為什麼計算自由度時,重點不只是限制條件有幾條,而是其中有幾條彼此獨立。如果兩個限制其實表達同一件事,或其中一個可以由另一個推得,它們不會各自再拿走一個自由度。

為什麼樣本變異數使用 n−1?#

計算樣本變異數時,會先用同一批資料估計樣本平均數。相對於樣本平均數的 n 個離差必須加總為 0,因此只要知道前 n−1 個離差,最後一個離差就已被決定。這些離差只有 n−1 個自由度,所以樣本變異數以 n−1 作為分母。

離差受到的限制i=1n(xixˉ)=0\sum_{i=1}^{n}(x_i-\bar{x})=0
樣本變異數s2=1n1i=1n(xixˉ)2s^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})^2

自由度不一定都是 n−1#

自由度取決於分析中有多少獨立資訊,以及資料受到哪些限制或估計了多少參數。因此,不同統計方法會有不同的自由度公式,不能看到樣本數就一律減 1。

情境常見自由度直覺
單一樣本變異數或單一樣本 t 檢定n−1估計了 1 個平均數
兩獨立樣本合併變異數 t 檢定n₁+n₂−2兩組各估計 1 個平均數
列聯表卡方獨立性檢定(r−1)(c−1)列與欄的合計形成限制
單因子 ANOVA 組間k−1比較 k 個組別平均數
簡單線性迴歸的誤差n−2估計了截距與斜率 2 個參數