生物統計学 学習ノート概念・導出から実践的な解釈まで

CHAPTER 07 · TOPIC 06

重回帰分析

複数説明変数の条件付き係数、全体F、ダミー変数、交絡調整とモデル診断を学びます。

このページの内容
  1. 複数係数の解釈
  2. Yの変動を分解する
  3. 全体F検定
  4. 各係数の個別検定
  5. カテゴリー変数とANOVAの関係
  6. ダミー変数の符号化
  7. 交絡因子をモデルへ入れる理由
  8. Crude、部分調整、完全モデル
  9. 成立条件と診断
  10. 分析と報告の順序

重回帰分析は複数の説明変数を同じ線形モデルへ入れ、他の変数を一定とした各変数の条件付き関連を推定します。予測、交絡調整、複数因子の同時比較に使われます。

母集団モデルYi=β0+β1X1i++βpXpi+εiY_i=\beta_0+\beta_1X_{1i}+\cdots+\beta_pX_{pi}+\varepsilon_i
標本予測式Y^i=b0+b1X1i++bpXpi\hat Y_i=b_0+b_1X_{1i}+\cdots+b_pX_{pi}

複数係数の解釈#

E(Weight)=β0+β1(Age)+β2(Female)+β3(Height)E(\text{Weight})=\beta_0+\beta_1(\text{Age})+\beta_2(\text{Female})+\beta_3(\text{Height})

β₁は性別と身長が同じ対象を比べたとき、年齢1単位増加に伴う平均体重差です。β₂は年齢と身長を一定にした女性と基準性別の平均差です。「他を一定にする」という条件付き解釈が単回帰との重要な違いです。

Yの変動を分解する#

偏差分解YiYˉ=(Y^iYˉ)+(YiY^i)Y_i-\bar Y=(\hat Y_i-\bar Y)+(Y_i-\hat Y_i)
全平方和SST=(YiYˉ)2SS_T=\sum(Y_i-\bar Y)^2
回帰平方和SSR=(Y^iYˉ)2SS_R=\sum(\hat Y_i-\bar Y)^2
誤差平方和SSE=(YiY^i)2SS_E=\sum(Y_i-\hat Y_i)^2
分解SST=SSR+SSESS_T=SS_R+SS_E

全体F検定#

H0:β1=β2==βp=0H1:少なくとも一つの βj0H_0:\beta_1=\beta_2=\cdots=\beta_p=0\qquad H_1:\text{少なくとも一つの }\beta_j\ne0
変動源平方和自由度均方
回帰SSRpSSR/p
誤差SSEn−p−1SSE/(n−p−1)
全体SSTn−1
モデル均方MSR=SSRpMS_R=\frac{SS_R}{p}
誤差均方MSE=SSEnp1MS_E=\frac{SS_E}{n-p-1}
F統計量F=SSR/pSSE/(np1)F=\frac{SS_R/p}{SS_E/(n-p-1)}
H₀下FFp,np1F\sim F_{p,n-p-1}

各係数の個別検定#

個別仮説H0:βj=0H1:βj0H_0:\beta_j=0\qquad H_1:\beta_j\ne0
t統計量t=bjSE(bj),df=np1t=\frac{b_j}{SE(b_j)},\qquad df=n-p-1

全体Fが有意でも全係数が有意とは限らず、個別tが非有意でも変数群として有用な場合があります。複数係数の共同仮説には部分F検定やWald検定を使います。

カテゴリー変数とANOVAの関係#

J群のダミー変数数p=J1p=J-1
誤差自由度np1=nJn-p-1=n-J

J水準の因子はJ−1個のダミー変数で表し、一水準を基準群とします。因子だけの回帰モデルの全体F検定は一元配置ANOVAと同じです。

ダミー変数の符号化#

X₁X₂平均
基準群00β₀
群210β₀+β₁
群301β₀+β₂
E(Y)=β0+β1X1+β2X2E(Y)=\beta_0+\beta_1X_1+\beta_2X_2

β₁とβ₂はそれぞれ基準群との差です。異なる群同士の比較や全体効果には適切な対比を使い、多重性も考慮します。

交絡因子をモデルへ入れる理由#

未調整E(Vision)=β0+β1(Wealth)E(\text{Vision})=\beta_0+\beta_1(\text{Wealth})
年齢調整E(Vision)=β0+β1(Wealth)+β2(Age)E(\text{Vision})=\beta_0+\beta_1(\text{Wealth})+\beta_2(\text{Age})

年齢が富と視力の両方に関連するなら未調整係数は交絡され得ます。年齢を加えたβ₁は同年齢での条件付き関連です。ただし線形性、交互作用、測定誤差、overlapも確認します。

Crude、部分調整、完全モデル#

モデル目的
Crude曝露と結果の未調整関連
部分調整主要な事前指定交絡因子を加え、係数変化を確認
完全モデル因果図・研究計画に基づく必要変数と形を含める

成立条件と診断#

  • 平均構造が各連続変数について適切(必要なら非線形項)
  • 観測・誤差が独立
  • 残差分散が概ね一定
  • 小標本推論では残差が概ね正規
  • 完全多重共線性がなく、VIFや条件数も確認
  • 影響点、欠測、外挿、モデル選択の不確実性を評価

分析と報告の順序#

  1. 研究課題、推定対象、変数選択を事前定義
  2. 分布、欠測、相関、符号化を確認
  3. 線形性・交互作用を研究上必要な形で指定
  4. 全体F、係数、95%信頼区間、p値、R²・調整R²を推定
  5. 残差、多重共線性、影響点、予測性能を診断
  6. 未調整・調整結果、単位、基準群、限界を明記