生物統計學習筆記從概念、推導到實務判讀

CHAPTER 07 · TOPIC 01

簡單線性迴歸

簡單線性迴歸(simple linear regression)使用一個定量解釋變數 X,描述或預測另一個定量結果變數 Y。它以一條直線概括 X 與 Y 的平均關係,並把每個觀察值與直線之間的差距視為未被模型解釋的誤差。

本頁內容
  1. 可以回答哪些問題?
  2. 從散布圖開始
  3. 母體模型與樣本迴歸線
  4. 截距與斜率如何解釋?
  5. 最小平方法如何選出一條線?
  6. 模型成立需要哪些條件?
  7. 簡單線性迴歸和 ANOVA 的關聯
  8. 把 Y 的變異拆成模型與誤差
  9. 迴歸 ANOVA 表與整體 F 檢定
  10. 三種自由度為什麼是 n−1、1、n−2?
  11. 總自由度:n−1
  12. 迴歸自由度:1
  13. 誤差自由度:n−2
  14. 誤差標準差如何估計?
  15. 從虛無假設檢定截距與斜率
  16. 第一條虛無假設:檢定截距
  17. 第二條虛無假設:檢定斜率
  18. 為什麼斜率檢定滿足 F=t²?
  19. 解釋與預測要分開報告
  20. 建議的分析順序

簡單線性迴歸(simple linear regression)使用一個定量解釋變數 X,描述或預測另一個定量結果變數 Y。它以一條直線概括 X 與 Y 的平均關係,並把每個觀察值與直線之間的差距視為未被模型解釋的誤差。

可以回答哪些問題?

  • 行銷費用是否能預測營業額?
  • 壓力分數是否能預測血糖值?
  • 高等教育人口比例是否能預測國家人均所得?
角色資料形式其他名稱
X一個定量變數解釋變數、預測變數、自變數
Y一個定量變數結果變數、效標變數、依變數

若解釋變數是類別資料,不能直接把類別編碼當成連續數值解釋;通常要建立虛擬變數(dummy variables),再以迴歸模型表示組別差異。只有一個二元類別變數時,這種模型與兩組平均數比較有密切關係。

從散布圖開始

計算迴歸線以前,應先畫出 X 與 Y 的散布圖。散布圖能顯示關係是否大致線性、是否存在離群值、資料是否分成不同群體,以及 Y 的變動程度是否會隨 X 改變。若資料型態明顯不是直線關係,只報告一條直線可能會掩蓋重要結構。

最小平方法與殘差示意圖:藍點為觀察值,紅線為估計迴歸線,固定 X_i 時觀察值 Y_i 與預測值 Y-hat_i 的垂直距離為殘差 e_i
最小平方法選擇使殘差平方和最小的直線;殘差是同一個 X 位置上,觀察值與迴歸線預測值之間的垂直距離。來源:本站依原始筆記圖重製

圖中同一個 Xᵢ 對應一個觀察值 Yᵢ;迴歸線在該位置給出的高度是預測值 Ŷᵢ。兩者的垂直差就是殘差 eᵢ。殘差可以為正或負,代表觀察值位於迴歸線上方或下方。

ei=YiY^ie_i=Y_i-\hat Y_i
符號在這組公式中的意義
X、Y解釋變數與結果變數
b₀、b₁由樣本估計的截距與斜率
β₁母體迴歸斜率
S(Y|X)固定 X 時,Y 對迴歸線的殘差標準差
n−2簡單線性迴歸估計兩個參數後的誤差自由度

母體模型與樣本迴歸線

母體模型描述固定 X 時,Y 的條件平均數如何改變;樣本迴歸線則用樣本資料估計未知的母體截距與斜率。這兩層符號不應混在一起。

母體模型Yi=β0+β1Xi+εiY_i=\beta_0+\beta_1X_i+\varepsilon_i
固定 X 時的母體平均E(YiXi)=β0+β1XiE(Y_i\mid X_i)=\beta_0+\beta_1X_i
樣本估計線Y^i=b0+b1Xi\hat Y_i=b_0+b_1X_i
樣本殘差ei=YiY^ie_i=Y_i-\hat Y_i
符號意義
β₀、β₁母體截距與母體斜率,通常未知
b₀、b₁由樣本估計的截距與斜率
εᵢ母體模型中的隨機誤差,無法直接觀察
eᵢ樣本中可計算的殘差,用來估計誤差
Ŷᵢ把 Xᵢ 代入樣本迴歸線得到的預測值

截距與斜率如何解釋?

斜率 β₁ 表示 X 每增加一單位時,Y 的條件平均值預期改變多少。正斜率表示平均關係向上,負斜率表示平均關係向下。截距 β₀ 是 X=0 時 Y 的條件平均值;只有當 X=0 位於合理且有資料支持的範圍內,截距才通常具有直接實質意義。

最小平方法如何選出一條線?

不同的截距與斜率會產生不同預測值,也會產生不同殘差。普通最小平方法(ordinary least squares, OLS)選擇使殘差平方和 SSE 最小的 b₀ 與 b₁。平方能避免正負殘差互相抵銷,也會讓較大的垂直誤差受到較大權重。

(b0,b1)=argmina,ci=1n[Yi(a+cXi)]2(b_0,b_1)=\arg\min_{a,c}\sum_{i=1}^{n}[Y_i-(a+cX_i)]^2
符號在這組公式中的意義
X、Y解釋變數與結果變數
b₀、b₁由樣本估計的截距與斜率
β₁母體迴歸斜率
S(Y|X)固定 X 時,Y 對迴歸線的殘差標準差
n−2簡單線性迴歸估計兩個參數後的誤差自由度
Σ求和符號;將指定範圍內的各項全部加總
Xᵢ第 i 個隨機變數或第 i 筆觀察值;依本段定義
斜率估計值b1=i=1n(XiXˉ)(YiYˉ)i=1n(XiXˉ)2b_1=\frac{\sum_{i=1}^{n}(X_i-\bar X)(Y_i-\bar Y)}{\sum_{i=1}^{n}(X_i-\bar X)^2}
截距估計值b0=Yˉb1Xˉb_0=\bar Y-b_1\bar X

由 b₀=Ȳ−b₁X̄ 可知,含截距的最小平方法迴歸線一定通過樣本平均點 (X̄,Ȳ)。

補充:從最小平方法推導迴歸係數與平方和分解

以下從最小平方法的目標函數開始,依序求出斜率 b₁ 與截距 b₀,再利用同一組條件說明殘差的性質及平方和分解。

1. 寫出預測值、殘差與目標函數

樣本資料(Xi,Yi),i=1,2,,n(X_i,Y_i),\qquad i=1,2,\ldots,n
迴歸線上的預測值Y^i=b0+b1Xi\hat Y_i=b_0+b_1X_i
殘差ei=YiY^i=Yib0b1Xie_i=Y_i-\hat Y_i=Y_i-b_0-b_1X_i
殘差平方和Q(b0,b1)=i=1nei2=i=1n(Yib0b1Xi)2Q(b_0,b_1)=\sum_{i=1}^{n}e_i^2=\sum_{i=1}^{n}(Y_i-b_0-b_1X_i)^2

Xᵢ、Yᵢ 是已知資料;要選擇的是 b₀、b₁。最小平方法的目標,就是找出使 Q(b₀,b₁) 最小的兩個係數。

2. 分別對 b₀、b₁ 偏微分

在最小值的位置,Q 對兩個未知係數的一階偏導數都必須等於 0。第二式是對 b₁ 微分,因此鏈鎖律會多出 −Xᵢ。

對截距 b₀ 微分Qb0=2i=1n(Yib0b1Xi)=0\frac{\partial Q}{\partial b_0}=-2\sum_{i=1}^{n}(Y_i-b_0-b_1X_i)=0
對斜率 b₁ 微分Qb1=2i=1nXi(Yib0b1Xi)=0\frac{\partial Q}{\partial b_1}=-2\sum_{i=1}^{n}X_i(Y_i-b_0-b_1X_i)=0

移除共同因子 −2 並展開後,得到兩條 normal equations(常態方程式):

第一條常態方程式Yinb0b1Xi=0\sum Y_i-nb_0-b_1\sum X_i=0
第二條常態方程式XiYib0Xib1Xi2=0\sum X_iY_i-b_0\sum X_i-b_1\sum X_i^2=0

3. 先由第一式解出截距

利用 ΣYᵢ=nȲ 與 ΣXᵢ=nX̄,把第一條常態方程式除以 n:

除以 nYˉb0b1Xˉ=0\bar Y-b_0-b_1\bar X=0
截距b0=Yˉb1Xˉb_0=\bar Y-b_1\bar X

把 b₀ 代回 Ŷ=b₀+b₁X,可得 Ŷ−Ȳ=b₁(X−X̄)。因此含截距的最小平方法迴歸線一定通過平均點 (X̄,Ȳ)。

4. 將截距代回第二式,解出斜率

代入 b₀=Ȳ−b₁X̄XiYi(Yˉb1Xˉ)Xib1Xi2=0\sum X_iY_i-(\bar Y-b_1\bar X)\sum X_i-b_1\sum X_i^2=0
整理 b₁ 的項XiYinXˉYˉ=b1(Xi2nXˉ2)\sum X_iY_i-n\bar X\bar Y=b_1(\sum X_i^2-n\bar X^2)
改寫成離均差(XiXˉ)(YiYˉ)=b1(XiXˉ)2\sum(X_i-\bar X)(Y_i-\bar Y)=b_1\sum(X_i-\bar X)^2
斜率b1=(XiXˉ)(YiYˉ)(XiXˉ)2b_1=\frac{\sum(X_i-\bar X)(Y_i-\bar Y)}{\sum(X_i-\bar X)^2}

只要 X 不是全部相同,分母 Σ(Xᵢ−X̄)² 就大於 0。Q 是 b₀、b₁ 的凸二次函數,因此這組一階條件找到的是全域最小值,而不是最大值。

5. 由常態方程式得到殘差的三個性質

把 eᵢ=Yᵢ−b₀−b₁Xᵢ 代回兩條常態方程式,可直接得到前兩個性質;再利用 Ŷᵢ=b₀+b₁Xᵢ,就得到第三個性質。

殘差總和為 0ei=(Yib0b1Xi)=0\sum e_i=\sum(Y_i-b_0-b_1X_i)=0
殘差與 X 的乘積和為 0Xiei=Xi(Yib0b1Xi)=0\sum X_ie_i=\sum X_i(Y_i-b_0-b_1X_i)=0
殘差與預測值的乘積和為 0Y^iei=(b0+b1Xi)ei=b0ei+b1Xiei=0\sum\hat Y_ie_i=\sum(b_0+b_1X_i)e_i=b_0\sum e_i+b_1\sum X_ie_i=0

這些等式不是額外假設,而是含截距 OLS 解本身的代數結果。它們表示殘差已經無法再沿著常數方向或 X 的線性方向調整來降低 Q。

6. 證明 SST=SSE+SSR

先把每個觀察值相對總平均的離差,加上再減去 Ŷᵢ:

YiYˉ=(YiY^i)+(Y^iYˉ)=ei+(Y^iYˉ)Y_i-\bar Y=(Y_i-\hat Y_i)+(\hat Y_i-\bar Y)=e_i+(\hat Y_i-\bar Y)

平方後加總,會出現 SSE、SSR 與一個交叉項:

展開平方(YiYˉ)2=ei2+(Y^iYˉ)2+2ei(Y^iYˉ)\sum(Y_i-\bar Y)^2=\sum e_i^2+\sum(\hat Y_i-\bar Y)^2+2\sum e_i(\hat Y_i-\bar Y)
交叉項ei(Y^iYˉ)=ei(b0+b1XiYˉ)\sum e_i(\hat Y_i-\bar Y)=\sum e_i(b_0+b_1X_i-\bar Y)
拆開交叉項=(b0Yˉ)ei+b1Xiei=0=(b_0-\bar Y)\sum e_i+b_1\sum X_ie_i=0
平方和分解SST=SSE+SSRSS_T=SS_E+SS_R

模型成立需要哪些條件?

固定 X 時,Y 近似常態且具有相同標準差,是傳統簡單線性迴歸推論的基礎。各項條件分別負責不同部分:

  • 線性:固定 X 時,Y 的條件平均可由 β₀+β₁X 表示。
  • 獨立性:不同觀察值的誤差彼此獨立;時間序列、群聚或重複測量資料通常不符合這項條件。
  • 等變異性:固定不同 X 時,誤差具有相同變異數 σ²。
  • 常態性:進行小樣本 t、F 檢定與信賴區間時,通常假設固定 X 下的誤差近似常態。
  • 解釋變數具有足夠變化,且沒有單一極端 X 值過度主導迴歸線。
誤差平均數E(εiXi)=0E(\varepsilon_i\mid X_i)=0
共同誤差變異數Var(εiXi)=σ2\operatorname{Var}(\varepsilon_i\mid X_i)=\sigma^2
常態誤差模型εiXiN(0,σ2)\varepsilon_i\mid X_i\sim N(0,\sigma^2)

簡單線性迴歸和 ANOVA 的關聯

ANOVA 與簡單線性迴歸表面上處理不同問題:ANOVA 用組別解釋平均數差異,迴歸則用連續的 X 與一條直線解釋 Y。不過兩者的核心相同,都是把每個觀察值拆成「模型能解釋的部分」與「模型不能解釋的誤差」,再比較這兩種變異。ANOVA 是用各組平均數建立模型;簡單線性迴歸則尋找一條最能描述資料的方程式。

比較項目單因子 ANOVA簡單線性迴歸
解釋變數類別組別連續變數 X
模型給出的平均該組平均數迴歸線上的預測值 Ŷᵢ
模型解釋的離差組平均數−總平均數Ŷᵢ−Ȳ
未解釋的離差觀察值−組平均數Yᵢ−Ŷᵢ
總離差觀察值−總平均數Yᵢ−Ȳ

固定 X 時,Y 近似常態且具有相同標準差,是迴歸與 ANOVA 能以同一套 F 檢定架構處理的原因。ANOVA 假設各組內有共同的誤差變異數;迴歸則假設不同 X 位置周圍的 Y 也有共同的誤差變異數。因此,各組或各 X 位置的誤差資訊可以合併成一個 SSE,再除以共同的誤差自由度,得到 MSE。

把 Y 的變異拆成模型與誤差

每個觀察值相對於總平均的總離差,可以拆成迴歸線解釋的部分與未解釋的殘差:

YiYˉ總離差=Y^iYˉ迴歸解釋+YiY^i殘差\underbrace{Y_i-\bar Y}_{\text{總離差}}=\underbrace{\hat Y_i-\bar Y}_{\text{迴歸解釋}}+\underbrace{Y_i-\hat Y_i}_{\text{殘差}}
符號在這組公式中的意義
X、Y解釋變數與結果變數
b₀、b₁由樣本估計的截距與斜率
β₁母體迴歸斜率
S(Y|X)固定 X 時,Y 對迴歸線的殘差標準差
n−2簡單線性迴歸估計兩個參數後的誤差自由度

這就是 ANOVA 的「總離差=組間離差+組內離差」在迴歸中的版本。把三種離差平方後加總,含截距的最小平方法模型便得到同樣的平方和分解:

總平方和SST=i=1n(YiYˉ)2SS_T=\sum_{i=1}^{n}(Y_i-\bar Y)^2
迴歸平方和SSR=i=1n(Y^iYˉ)2=b12i=1n(XiXˉ)2SS_R=\sum_{i=1}^{n}(\hat Y_i-\bar Y)^2=b_1^2\sum_{i=1}^{n}(X_i-\bar X)^2
誤差平方和SSE=i=1n(YiY^i)2SS_E=\sum_{i=1}^{n}(Y_i-\hat Y_i)^2
平方和分解SST=SSR+SSESS_T=SS_R+SS_E

迴歸 ANOVA 表與整體 F 檢定

變異來源平方和 SS自由度 df均方 MSF 值
RegressionSSR1MSR=SSR/1MSR/MSE
ErrorSSE=SST−SSRn−2MSE=SSE/(n−2)
TotalSSTn−1
整體虛無假設H0:β1=0H_0:\beta_1=0
整體 F 統計量F=MSRMSE=SSR/1SSE/(n2)F=\frac{MS_R}{MS_E}=\frac{SS_R/1}{SS_E/(n-2)}
H₀ 成立時FF1,n2F\sim F_{1,n-2}

F 的分子衡量迴歸線所解釋的變異,分母衡量資料在迴歸線周圍剩下的變異。若 H₀:β₁=0 成立,加入 X 不應帶來超出隨機誤差的解釋力;只有當 MSR 相對 MSE 足夠大時,才有理由拒絕這條虛無假設。

三種自由度為什麼是 n−1、1、n−2?

總自由度:n−1

總平方和以樣本平均數 Ȳ 為中心。n 個離差 Yᵢ−Ȳ 必須滿足 Σ(Yᵢ−Ȳ)=0;因此知道前 n−1 個離差後,最後一個就被總和為 0 的條件決定,只剩 n−1 個可以自由變動的資訊。

dfT=n1df_T=n-1
符號在這組公式中的意義
X、Y解釋變數與結果變數
b₀、b₁由樣本估計的截距與斜率
β₁母體迴歸斜率
S(Y|X)固定 X 時,Y 對迴歸線的殘差標準差
n−2簡單線性迴歸估計兩個參數後的誤差自由度

迴歸自由度:1

含截距的最小平方法迴歸線一定通過 (X̄,Ȳ)。當這個平均點固定後,只要再決定斜率 b₁,整條直線以及所有 Ŷᵢ 就都確定了;也可以想成平均點再加上一個不在平均點上的擬合點,就足以決定直線。因此,簡單線性迴歸用一份獨立資訊描述 Y 隨 X 改變的線性方向,迴歸自由度是 1。

模型離差Y^iYˉ=b1(XiXˉ)\hat Y_i-\bar Y=b_1(X_i-\bar X)
迴歸自由度dfR=1df_R=1

誤差自由度:n−2

n 個觀察值原本提供 n 份 Y 資訊,但資料已經先用來估計截距 b₀ 與斜率 b₁ 兩個參數,所以殘差不能再各自任意變動。含截距的最小平方法殘差必須同時滿足「殘差總和為 0」以及「殘差與 X 的線性方向互相抵銷」兩個限制,因此只剩 n−2 份獨立的誤差資訊。這就是 MSE 的分母必須使用 n−2,而不是 n 或 n−1 的理由。

第一個限制i=1nei=0\sum_{i=1}^{n}e_i=0
第二個限制i=1n(XiXˉ)ei=0\sum_{i=1}^{n}(X_i-\bar X)e_i=0
誤差自由度dfE=n2df_E=n-2

誤差標準差如何估計?

MSE 估計母體誤差變異數 σ²;開根號後得到殘差標準差,也常記為 s、S(Y|X) 或 residual standard error。它描述觀察值在迴歸線周圍的典型垂直變動量。

殘差標準差SYX=MSE=(YiY^i)2n2S_{Y\mid X}=\sqrt{MS_E}=\sqrt{\frac{\sum(Y_i-\hat Y_i)^2}{n-2}}
等價計算式SYX=Yi2b0Yib1XiYin2S_{Y\mid X}=\sqrt{\frac{\sum Y_i^2-b_0\sum Y_i-b_1\sum X_iY_i}{n-2}}

從虛無假設檢定截距與斜率

前面曾遇過:當比較兩組、組間自由度為 1 時,可以用 t 值或 F 值檢定,而且 F=t²。簡單線性迴歸的迴歸自由度同樣是 1,因此也能用 t 檢定分析。由於母體方程式 Yᵢ=β₀+β₁Xᵢ+εᵢ 同時包含截距 β₀ 與斜率 β₁,所以要先分清楚研究問題是在檢定哪一個母體參數,再各自寫出虛無假設。

符號在檢定中的角色
β₀、β₁真正想推論但未知的母體截距與母體斜率
b₀、b₁從樣本算出的估計值,用來和虛無假設比較
c₀、c₁研究者在虛無假設中指定的截距值與斜率值

以下令 Sxx=Σ(Xᵢ−X̄)²。每一個 t 值都遵循同一個邏輯:用「樣本估計值−虛無假設指定值」除以該估計值的標準誤。

Sxx=i=1n(XiXˉ)2S_{xx}=\sum_{i=1}^{n}(X_i-\bar X)^2
符號在這組公式中的意義
X、Y解釋變數與結果變數
b₀、b₁由樣本估計的截距與斜率
β₁母體迴歸斜率
S(Y|X)固定 X 時,Y 對迴歸線的殘差標準差
n−2簡單線性迴歸估計兩個參數後的誤差自由度
Σ求和符號;將指定範圍內的各項全部加總
Xᵢ第 i 個隨機變數或第 i 筆觀察值;依本段定義

第一條虛無假設:檢定截距

截距檢定問的是:當 X=0 時,母體平均 Y 是否等於事先指定的 c₀?因此先從 H₀:β₀=c₀ 出發,再拿樣本截距 b₀ 與 c₀ 的差距進行檢定;雙尾對立假設則是 H₁:β₀≠c₀。

截距的假設H0:β0=c0H1:β0c0H_0:\beta_0=c_0\qquad H_1:\beta_0\ne c_0
截距的標準誤SE(b0)=SYX1n+Xˉ2SxxSE(b_0)=S_{Y\mid X}\sqrt{\frac{1}{n}+\frac{\bar X^2}{S_{xx}}}
截距的 t 值t=b0c0SYX1n+Xˉ2Sxx,df=n2t=\frac{b_0-c_0}{S_{Y\mid X}\sqrt{\frac{1}{n}+\frac{\bar X^2}{S_{xx}}}},\qquad df=n-2
  1. 先依研究問題指定虛無假設中的截距 c₀;不是先看資料後才挑一個值。
  2. 由樣本求出 b₀,並以 SSE/(n−2) 求得 S(Y|X)。
  3. 計算 SE(b₀) 與 t,再用自由度 n−2 的 t 分配求 p 值。
  4. 依事先設定的顯著水準決定是否拒絕 H₀,並回到 X=0 的實質意義解釋結果。

第二條虛無假設:檢定斜率

斜率檢定問的是:X 每增加一單位時,母體平均 Y 的改變量是否等於指定的 c₁?因此 H₀:β₁=c₁。最常見的設定是 c₁=0;此時虛無假設表示沒有線性關係,而不是宣稱 X 與 Y 在任何形式下都完全無關。

斜率的假設H0:β1=c1H1:β1c1H_0:\beta_1=c_1\qquad H_1:\beta_1\ne c_1
斜率的標準誤SE(b1)=SYXSxxSE(b_1)=\frac{S_{Y\mid X}}{\sqrt{S_{xx}}}
斜率的 t 值t=b1c1SYX/Sxx,df=n2t=\frac{b_1-c_1}{S_{Y\mid X}/\sqrt{S_{xx}}},\qquad df=n-2
  1. 先寫出 H₀:β₁=c₁;若研究問題是有沒有線性關係,通常令 c₁=0。
  2. 由樣本求出 b₁,並計算 SE(b₁)=S(Y|X)/√Sxx。
  3. 以 b₁−c₁ 除以 SE(b₁),得到自由度 n−2 的 t 值與 p 值。
  4. 若拒絕 H₀,再依 b₁ 的正負號、大小與信賴區間說明關係方向及幅度。

若不拒絕 H₀:β₁=0,只能說資料沒有提供足夠證據支持非零的線性關係;不能把它寫成已證明沒有關係。關係可能較弱、樣本資訊不足,或真實型態並不是直線。

為什麼斜率檢定滿足 F=t²?

當斜率檢定採用 H₀:β₁=0 時,簡單線性迴歸的整體 F 檢定與斜率 t 檢定檢定的是同一條虛無假設。由於 Regression 只有 1 個自由度,可以從斜率 t 值一步一步得到 F:

從斜率 t 值開始t=b10SYX/Sxxt=\frac{b_1-0}{S_{Y\mid X}/\sqrt{S_{xx}}}
平方t2=b12SxxSYX2t^2=\frac{b_1^2S_{xx}}{S_{Y\mid X}^2}
代入迴歸平方和b12Sxx=i=1n(Y^iYˉ)2=SSRb_1^2S_{xx}=\sum_{i=1}^{n}(\hat Y_i-\bar Y)^2=SS_R
代入誤差均方SYX2=SSEn2=MSES_{Y\mid X}^2=\frac{SS_E}{n-2}=MS_E
得到相同的 F 值t2=SSR/1SSE/(n2)=MSRMSE=Ft^2=\frac{SS_R/1}{SS_E/(n-2)}=\frac{MS_R}{MS_E}=F

解釋與預測要分開報告

目標主要關心常見輸出
解釋斜率方向、大小及不確定性b₁、信賴區間、t、p、R²
預測平均結果指定 X 時的平均 YŶ 與平均反應信賴區間
預測個別結果指定 X 時一個新個體的 YŶ 與較寬的預測區間

個別預測除了迴歸線估計的不確定性,還包含個體本身相對於直線的隨機誤差,因此預測區間會比平均反應的信賴區間寬。只提供單一 Ŷ 而不呈現不確定性,容易讓讀者誤以為模型能精確預測每個個體。

建議的分析順序

  1. 先確認 X、Y 的定義、測量尺度與研究設計,再畫散布圖。
  2. 檢查關係是否大致線性,以及是否有離群點、高槓桿值或不同群體。
  3. 估計 b₀、b₁、預測值與殘差,並查看殘差對預測值圖及常態診斷。
  4. 依研究目的報告斜率、信賴區間、t 或 F 檢定、R² 與殘差標準差。
  5. 需要預測時,說明適用的 X 範圍,並區分平均反應信賴區間與個別預測區間。