生物統計學習筆記從概念、推導到實務判讀

CHAPTER 07 · TOPIC 02

Pearson 相關係數

Pearson 相關係數(Pearson correlation coefficient)以 r 表示樣本中的線性相關程度,以 ρ 表示母體中的線性相關程度。它同時呈現關係方向與標準化後的強度,但只描述線性關係,不等於因果效果。

本頁內容
  1. Pearson r 如何計算?
  2. 使用 Pearson r 前要看什麼?
  3. Pearson r 與迴歸斜率
  4. r²、R² 與解釋變異
  5. 檢定母體相關係數是否為 0
  6. 為什麼相關檢定與迴歸 F 檢定相同?
  7. 建議如何報告?

Pearson 相關係數(Pearson correlation coefficient)以 r 表示樣本中的線性相關程度,以 ρ 表示母體中的線性相關程度。它同時呈現關係方向與標準化後的強度,但只描述線性關係,不等於因果效果。

Pearson r 如何計算?

先將每一對觀察值分別減去 X 與 Y 的樣本平均數,再把兩個離差的乘積加總。最後用 X、Y 各自的離差平方和標準化,使結果不受原始測量單位影響。

r=i=1n(XiXˉ)(YiYˉ)i=1n(XiXˉ)2i=1n(YiYˉ)2r=\frac{\sum_{i=1}^{n}(X_i-\bar X)(Y_i-\bar Y)}{\sqrt{\sum_{i=1}^{n}(X_i-\bar X)^2}\sqrt{\sum_{i=1}^{n}(Y_i-\bar Y)^2}}
符號在這組公式中的意義
r樣本 Pearson 相關係數
X̄、ȲX 與 Y 的樣本平均數
SSR、SSE、SST迴歸平方和、誤差平方和與總平方和
MSR、MSE迴歸均方與誤差均方
Σ求和符號;將指定範圍內的各項全部加總
平方根;常用來把變異數轉成標準差
Xᵢ第 i 個隨機變數或第 i 筆觀察值;依本段定義
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準
以樣本共變異數表示r=sXYsXsYr=\frac{s_{XY}}{s_Xs_Y}
由 Cauchy–Schwarz 不等式1r1-1\leq r\leq1
r 的情況線性關係的讀法
r>0X 較大時,Y 平均而言也傾向較大
r<0X 較大時,Y 平均而言傾向較小
r≈0沒有明顯線性關係,但仍可能存在曲線關係
|r|=1所有點完全落在同一條非水平直線上

使用 Pearson r 前要看什麼?

  • 每一筆資料必須是同一觀察單位的一對 X、Y 測量,且不同觀察單位彼此獨立。
  • X 與 Y 應為定量變數,兩者的關係大致呈線性。
  • 先看散布圖;單一離群點或高槓桿點可能大幅改變 r。
  • 若要使用後面的 t 或 Fisher Z 推論,通常還需考慮二變量常態或相應的大樣本近似。
  • 資料範圍被限制時,即使母體關係不弱,樣本 r 也可能被壓低。

Pearson r 與迴歸斜率

在含截距的簡單線性迴歸中,樣本斜率 b₁ 與 Pearson r 具有直接關係:

b1=rsYsXb_1=r\frac{s_Y}{s_X}
符號在這組公式中的意義
r樣本 Pearson 相關係數
X̄、ȲX 與 Y 的樣本平均數
SSR、SSE、SST迴歸平方和、誤差平方和與總平方和
MSR、MSE迴歸均方與誤差均方

r 是沒有單位的標準化關係;b₁ 則保留測量單位,表示 X 每增加一單位時 Y 平均改變多少。因為標準差皆為正,r 與 b₁ 的正負方向一定相同。若把 X、Y 都轉成 z 分數,迴歸斜率就等於 r。

r²、R² 與解釋變異

原文以「100×r²% 的變異可由另一變數得知」描述 r²。在含截距的簡單線性迴歸中,更精確的說法是:r² 等於 R²,也等於迴歸平方和占總平方和的比例,表示樣本中 Y 的總變異有多少比例被 X 的線性模型解釋。

簡單線性迴歸r2=R2=SSRSSTr^2=R^2=\frac{SS_R}{SS_T}
百分比表示100r2%100r^2\%

例如 r=−0.60 時,r²=0.36,表示線性模型解釋樣本中 36% 的 Y 變異;負號所代表的下降方向不能從 r² 看出。這個比例不代表 X 造成 36% 的 Y,也不代表個別 Y 能被精確預測。

檢定母體相關係數是否為 0

若觀察值獨立,且母體可合理視為二變量常態,可用 t 統計量檢定母體 Pearson 相關係數 ρ 是否為 0。

雙尾假設H0:ρ=0,H1:ρ0H_0:\rho=0,\qquad H_1:\rho\ne0
t 統計量t=rn21r2=r(1r2)/(n2)t=\frac{r\sqrt{n-2}}{\sqrt{1-r^2}}=\frac{r}{\sqrt{(1-r^2)/(n-2)}}
自由度df=n2df=n-2

原文把 √[(1−r²)/(n−2)] 稱為變異數;在這個 t 公式中,它應理解為把 r 標準化所使用的分母形式,不是 r 在任意 ρ 下的通用精確標準誤。若要檢定非零的 ρ₀ 或建立 ρ 的信賴區間,下一頁的 Fisher Z 轉換較方便。

為什麼相關檢定與迴歸 F 檢定相同?

含截距的簡單線性迴歸中,檢定 ρ=0、檢定斜率 β₁=0,以及整體迴歸 F 檢定,都在回答是否存在非零線性關係。原文由平方和完整連結這三種寫法。

先保留 r 的方向r=sign(b1)SSRSSTr=\operatorname{sign}(b_1)\sqrt{\frac{SS_R}{SS_T}}
平方後r2=SSRSSTr^2=\frac{SS_R}{SS_T}

將 r²=SSR/SST 與 SST=SSR+SSE 代入 t²:

由相關係數 t 檢定開始t2=r2(n2)1r2t^2=\frac{r^2(n-2)}{1-r^2}
代入平方和比例t2=(SSR/SST)(n2)SSE/SSTt^2=\frac{(SS_R/SS_T)(n-2)}{SS_E/SS_T}
整理成均方比t2=SSR/1SSE/(n2)=MSRMSE=Ft^2=\frac{SS_R/1}{SS_E/(n-2)}=\frac{MS_R}{MS_E}=F

因此相關係數的雙尾 t 檢定、簡單迴歸斜率的雙尾 t 檢定與整體 F 檢定會得到相同 p 值。t 與 r 保留正負方向,F 與 r² 則只保留關係大小。

建議如何報告?

  1. 先提供散布圖,說明線性型態與是否存在影響結果的離群點。
  2. 報告 Pearson r、樣本數 n、信賴區間與 p 值。
  3. 用實際變數名稱描述正負方向,不只寫正相關或負相關。
  4. 若同時解釋 r²,明確限定為樣本中的線性解釋比例,不作因果解讀。