CHAPTER 07 · TOPIC 01
簡單線性迴歸
簡單線性迴歸(simple linear regression)使用一個定量解釋變數 X,描述或預測另一個定量結果變數 Y。它以一條直線概括 X 與 Y 的平均關係,並把每個觀察值與直線之間的差距視為未被模型解釋的誤差。
本頁內容
- 可以回答哪些問題?
- 從散布圖開始
- 母體模型與樣本迴歸線
- 截距與斜率如何解釋?
- 最小平方法如何選出一條線?
- 模型成立需要哪些條件?
- 簡單線性迴歸和 ANOVA 的關聯
- 把 Y 的變異拆成模型與誤差
- 迴歸 ANOVA 表與整體 F 檢定
- 三種自由度為什麼是 n−1、1、n−2?
- 總自由度:n−1
- 迴歸自由度:1
- 誤差自由度:n−2
- 誤差標準差如何估計?
- 從虛無假設檢定截距與斜率
- 第一條虛無假設:檢定截距
- 第二條虛無假設:檢定斜率
- 為什麼斜率檢定滿足 F=t²?
- 解釋與預測要分開報告
- 建議的分析順序
簡單線性迴歸(simple linear regression)使用一個定量解釋變數 X,描述或預測另一個定量結果變數 Y。它以一條直線概括 X 與 Y 的平均關係,並把每個觀察值與直線之間的差距視為未被模型解釋的誤差。
可以回答哪些問題?
- 行銷費用是否能預測營業額?
- 壓力分數是否能預測血糖值?
- 高等教育人口比例是否能預測國家人均所得?
| 角色 | 資料形式 | 其他名稱 |
| X | 一個定量變數 | 解釋變數、預測變數、自變數 |
| Y | 一個定量變數 | 結果變數、效標變數、依變數 |
若解釋變數是類別資料,不能直接把類別編碼當成連續數值解釋;通常要建立虛擬變數(dummy variables),再以迴歸模型表示組別差異。只有一個二元類別變數時,這種模型與兩組平均數比較有密切關係。
從散布圖開始
計算迴歸線以前,應先畫出 X 與 Y 的散布圖。散布圖能顯示關係是否大致線性、是否存在離群值、資料是否分成不同群體,以及 Y 的變動程度是否會隨 X 改變。若資料型態明顯不是直線關係,只報告一條直線可能會掩蓋重要結構。
圖中同一個 Xᵢ 對應一個觀察值 Yᵢ;迴歸線在該位置給出的高度是預測值 Ŷᵢ。兩者的垂直差就是殘差 eᵢ。殘差可以為正或負,代表觀察值位於迴歸線上方或下方。
| 符號 | 在這組公式中的意義 |
| X、Y | 解釋變數與結果變數 |
| b₀、b₁ | 由樣本估計的截距與斜率 |
| β₁ | 母體迴歸斜率 |
| S(Y|X) | 固定 X 時,Y 對迴歸線的殘差標準差 |
| n−2 | 簡單線性迴歸估計兩個參數後的誤差自由度 |
母體模型與樣本迴歸線
母體模型描述固定 X 時,Y 的條件平均數如何改變;樣本迴歸線則用樣本資料估計未知的母體截距與斜率。這兩層符號不應混在一起。
| 符號 | 意義 |
| β₀、β₁ | 母體截距與母體斜率,通常未知 |
| b₀、b₁ | 由樣本估計的截距與斜率 |
| εᵢ | 母體模型中的隨機誤差,無法直接觀察 |
| eᵢ | 樣本中可計算的殘差,用來估計誤差 |
| Ŷᵢ | 把 Xᵢ 代入樣本迴歸線得到的預測值 |
截距與斜率如何解釋?
斜率 β₁ 表示 X 每增加一單位時,Y 的條件平均值預期改變多少。正斜率表示平均關係向上,負斜率表示平均關係向下。截距 β₀ 是 X=0 時 Y 的條件平均值;只有當 X=0 位於合理且有資料支持的範圍內,截距才通常具有直接實質意義。
最小平方法如何選出一條線?
不同的截距與斜率會產生不同預測值,也會產生不同殘差。普通最小平方法(ordinary least squares, OLS)選擇使殘差平方和 SSE 最小的 b₀ 與 b₁。平方能避免正負殘差互相抵銷,也會讓較大的垂直誤差受到較大權重。
| 符號 | 在這組公式中的意義 |
| X、Y | 解釋變數與結果變數 |
| b₀、b₁ | 由樣本估計的截距與斜率 |
| β₁ | 母體迴歸斜率 |
| S(Y|X) | 固定 X 時,Y 對迴歸線的殘差標準差 |
| n−2 | 簡單線性迴歸估計兩個參數後的誤差自由度 |
| Σ | 求和符號;將指定範圍內的各項全部加總 |
| Xᵢ | 第 i 個隨機變數或第 i 筆觀察值;依本段定義 |
由 b₀=Ȳ−b₁X̄ 可知,含截距的最小平方法迴歸線一定通過樣本平均點 (X̄,Ȳ)。
補充:從最小平方法推導迴歸係數與平方和分解
以下從最小平方法的目標函數開始,依序求出斜率 b₁ 與截距 b₀,再利用同一組條件說明殘差的性質及平方和分解。
1. 寫出預測值、殘差與目標函數
Xᵢ、Yᵢ 是已知資料;要選擇的是 b₀、b₁。最小平方法的目標,就是找出使 Q(b₀,b₁) 最小的兩個係數。
2. 分別對 b₀、b₁ 偏微分
在最小值的位置,Q 對兩個未知係數的一階偏導數都必須等於 0。第二式是對 b₁ 微分,因此鏈鎖律會多出 −Xᵢ。
移除共同因子 −2 並展開後,得到兩條 normal equations(常態方程式):
3. 先由第一式解出截距
利用 ΣYᵢ=nȲ 與 ΣXᵢ=nX̄,把第一條常態方程式除以 n:
把 b₀ 代回 Ŷ=b₀+b₁X,可得 Ŷ−Ȳ=b₁(X−X̄)。因此含截距的最小平方法迴歸線一定通過平均點 (X̄,Ȳ)。
4. 將截距代回第二式,解出斜率
只要 X 不是全部相同,分母 Σ(Xᵢ−X̄)² 就大於 0。Q 是 b₀、b₁ 的凸二次函數,因此這組一階條件找到的是全域最小值,而不是最大值。
5. 由常態方程式得到殘差的三個性質
把 eᵢ=Yᵢ−b₀−b₁Xᵢ 代回兩條常態方程式,可直接得到前兩個性質;再利用 Ŷᵢ=b₀+b₁Xᵢ,就得到第三個性質。
這些等式不是額外假設,而是含截距 OLS 解本身的代數結果。它們表示殘差已經無法再沿著常數方向或 X 的線性方向調整來降低 Q。
6. 證明 SST=SSE+SSR
先把每個觀察值相對總平均的離差,加上再減去 Ŷᵢ:
平方後加總,會出現 SSE、SSR 與一個交叉項:
模型成立需要哪些條件?
固定 X 時,Y 近似常態且具有相同標準差,是傳統簡單線性迴歸推論的基礎。各項條件分別負責不同部分:
- 線性:固定 X 時,Y 的條件平均可由 β₀+β₁X 表示。
- 獨立性:不同觀察值的誤差彼此獨立;時間序列、群聚或重複測量資料通常不符合這項條件。
- 等變異性:固定不同 X 時,誤差具有相同變異數 σ²。
- 常態性:進行小樣本 t、F 檢定與信賴區間時,通常假設固定 X 下的誤差近似常態。
- 解釋變數具有足夠變化,且沒有單一極端 X 值過度主導迴歸線。
簡單線性迴歸和 ANOVA 的關聯
ANOVA 與簡單線性迴歸表面上處理不同問題:ANOVA 用組別解釋平均數差異,迴歸則用連續的 X 與一條直線解釋 Y。不過兩者的核心相同,都是把每個觀察值拆成「模型能解釋的部分」與「模型不能解釋的誤差」,再比較這兩種變異。ANOVA 是用各組平均數建立模型;簡單線性迴歸則尋找一條最能描述資料的方程式。
| 比較項目 | 單因子 ANOVA | 簡單線性迴歸 |
| 解釋變數 | 類別組別 | 連續變數 X |
| 模型給出的平均 | 該組平均數 | 迴歸線上的預測值 Ŷᵢ |
| 模型解釋的離差 | 組平均數−總平均數 | Ŷᵢ−Ȳ |
| 未解釋的離差 | 觀察值−組平均數 | Yᵢ−Ŷᵢ |
| 總離差 | 觀察值−總平均數 | Yᵢ−Ȳ |
固定 X 時,Y 近似常態且具有相同標準差,是迴歸與 ANOVA 能以同一套 F 檢定架構處理的原因。ANOVA 假設各組內有共同的誤差變異數;迴歸則假設不同 X 位置周圍的 Y 也有共同的誤差變異數。因此,各組或各 X 位置的誤差資訊可以合併成一個 SSE,再除以共同的誤差自由度,得到 MSE。
把 Y 的變異拆成模型與誤差
每個觀察值相對於總平均的總離差,可以拆成迴歸線解釋的部分與未解釋的殘差:
| 符號 | 在這組公式中的意義 |
| X、Y | 解釋變數與結果變數 |
| b₀、b₁ | 由樣本估計的截距與斜率 |
| β₁ | 母體迴歸斜率 |
| S(Y|X) | 固定 X 時,Y 對迴歸線的殘差標準差 |
| n−2 | 簡單線性迴歸估計兩個參數後的誤差自由度 |
這就是 ANOVA 的「總離差=組間離差+組內離差」在迴歸中的版本。把三種離差平方後加總,含截距的最小平方法模型便得到同樣的平方和分解:
迴歸 ANOVA 表與整體 F 檢定
| 變異來源 | 平方和 SS | 自由度 df | 均方 MS | F 值 |
| Regression | SSR | 1 | MSR=SSR/1 | MSR/MSE |
| Error | SSE=SST−SSR | n−2 | MSE=SSE/(n−2) | |
| Total | SST | n−1 |
F 的分子衡量迴歸線所解釋的變異,分母衡量資料在迴歸線周圍剩下的變異。若 H₀:β₁=0 成立,加入 X 不應帶來超出隨機誤差的解釋力;只有當 MSR 相對 MSE 足夠大時,才有理由拒絕這條虛無假設。
三種自由度為什麼是 n−1、1、n−2?
總自由度:n−1
總平方和以樣本平均數 Ȳ 為中心。n 個離差 Yᵢ−Ȳ 必須滿足 Σ(Yᵢ−Ȳ)=0;因此知道前 n−1 個離差後,最後一個就被總和為 0 的條件決定,只剩 n−1 個可以自由變動的資訊。
| 符號 | 在這組公式中的意義 |
| X、Y | 解釋變數與結果變數 |
| b₀、b₁ | 由樣本估計的截距與斜率 |
| β₁ | 母體迴歸斜率 |
| S(Y|X) | 固定 X 時,Y 對迴歸線的殘差標準差 |
| n−2 | 簡單線性迴歸估計兩個參數後的誤差自由度 |
迴歸自由度:1
含截距的最小平方法迴歸線一定通過 (X̄,Ȳ)。當這個平均點固定後,只要再決定斜率 b₁,整條直線以及所有 Ŷᵢ 就都確定了;也可以想成平均點再加上一個不在平均點上的擬合點,就足以決定直線。因此,簡單線性迴歸用一份獨立資訊描述 Y 隨 X 改變的線性方向,迴歸自由度是 1。
誤差自由度:n−2
n 個觀察值原本提供 n 份 Y 資訊,但資料已經先用來估計截距 b₀ 與斜率 b₁ 兩個參數,所以殘差不能再各自任意變動。含截距的最小平方法殘差必須同時滿足「殘差總和為 0」以及「殘差與 X 的線性方向互相抵銷」兩個限制,因此只剩 n−2 份獨立的誤差資訊。這就是 MSE 的分母必須使用 n−2,而不是 n 或 n−1 的理由。
誤差標準差如何估計?
MSE 估計母體誤差變異數 σ²;開根號後得到殘差標準差,也常記為 s、S(Y|X) 或 residual standard error。它描述觀察值在迴歸線周圍的典型垂直變動量。
從虛無假設檢定截距與斜率
前面曾遇過:當比較兩組、組間自由度為 1 時,可以用 t 值或 F 值檢定,而且 F=t²。簡單線性迴歸的迴歸自由度同樣是 1,因此也能用 t 檢定分析。由於母體方程式 Yᵢ=β₀+β₁Xᵢ+εᵢ 同時包含截距 β₀ 與斜率 β₁,所以要先分清楚研究問題是在檢定哪一個母體參數,再各自寫出虛無假設。
| 符號 | 在檢定中的角色 |
| β₀、β₁ | 真正想推論但未知的母體截距與母體斜率 |
| b₀、b₁ | 從樣本算出的估計值,用來和虛無假設比較 |
| c₀、c₁ | 研究者在虛無假設中指定的截距值與斜率值 |
以下令 Sxx=Σ(Xᵢ−X̄)²。每一個 t 值都遵循同一個邏輯:用「樣本估計值−虛無假設指定值」除以該估計值的標準誤。
| 符號 | 在這組公式中的意義 |
| X、Y | 解釋變數與結果變數 |
| b₀、b₁ | 由樣本估計的截距與斜率 |
| β₁ | 母體迴歸斜率 |
| S(Y|X) | 固定 X 時,Y 對迴歸線的殘差標準差 |
| n−2 | 簡單線性迴歸估計兩個參數後的誤差自由度 |
| Σ | 求和符號;將指定範圍內的各項全部加總 |
| Xᵢ | 第 i 個隨機變數或第 i 筆觀察值;依本段定義 |
第一條虛無假設:檢定截距
截距檢定問的是:當 X=0 時,母體平均 Y 是否等於事先指定的 c₀?因此先從 H₀:β₀=c₀ 出發,再拿樣本截距 b₀ 與 c₀ 的差距進行檢定;雙尾對立假設則是 H₁:β₀≠c₀。
- 先依研究問題指定虛無假設中的截距 c₀;不是先看資料後才挑一個值。
- 由樣本求出 b₀,並以 SSE/(n−2) 求得 S(Y|X)。
- 計算 SE(b₀) 與 t,再用自由度 n−2 的 t 分配求 p 值。
- 依事先設定的顯著水準決定是否拒絕 H₀,並回到 X=0 的實質意義解釋結果。
第二條虛無假設:檢定斜率
斜率檢定問的是:X 每增加一單位時,母體平均 Y 的改變量是否等於指定的 c₁?因此 H₀:β₁=c₁。最常見的設定是 c₁=0;此時虛無假設表示沒有線性關係,而不是宣稱 X 與 Y 在任何形式下都完全無關。
- 先寫出 H₀:β₁=c₁;若研究問題是有沒有線性關係,通常令 c₁=0。
- 由樣本求出 b₁,並計算 SE(b₁)=S(Y|X)/√Sxx。
- 以 b₁−c₁ 除以 SE(b₁),得到自由度 n−2 的 t 值與 p 值。
- 若拒絕 H₀,再依 b₁ 的正負號、大小與信賴區間說明關係方向及幅度。
若不拒絕 H₀:β₁=0,只能說資料沒有提供足夠證據支持非零的線性關係;不能把它寫成已證明沒有關係。關係可能較弱、樣本資訊不足,或真實型態並不是直線。
為什麼斜率檢定滿足 F=t²?
當斜率檢定採用 H₀:β₁=0 時,簡單線性迴歸的整體 F 檢定與斜率 t 檢定檢定的是同一條虛無假設。由於 Regression 只有 1 個自由度,可以從斜率 t 值一步一步得到 F:
解釋與預測要分開報告
| 目標 | 主要關心 | 常見輸出 |
| 解釋 | 斜率方向、大小及不確定性 | b₁、信賴區間、t、p、R² |
| 預測平均結果 | 指定 X 時的平均 Y | Ŷ 與平均反應信賴區間 |
| 預測個別結果 | 指定 X 時一個新個體的 Y | Ŷ 與較寬的預測區間 |
個別預測除了迴歸線估計的不確定性,還包含個體本身相對於直線的隨機誤差,因此預測區間會比平均反應的信賴區間寬。只提供單一 Ŷ 而不呈現不確定性,容易讓讀者誤以為模型能精確預測每個個體。
建議的分析順序
- 先確認 X、Y 的定義、測量尺度與研究設計,再畫散布圖。
- 檢查關係是否大致線性,以及是否有離群點、高槓桿值或不同群體。
- 估計 b₀、b₁、預測值與殘差,並查看殘差對預測值圖及常態診斷。
- 依研究目的報告斜率、信賴區間、t 或 F 檢定、R² 與殘差標準差。
- 需要預測時,說明適用的 X 範圍,並區分平均反應信賴區間與個別預測區間。