生物統計學習筆記從概念、推導到實務判讀

CHAPTER 05 · TOPIC 01

二項分布檢定

二項分布檢定(binomial test)用來推論母體中的事件比例。每個觀察單位只有兩種互斥結果,例如有病/沒病、成功/失敗或陽性/陰性;研究問題可以是單一母體比例是否等於指定值,也可以是兩個獨立母體的比例是否相同。

本頁內容
  1. 從成功次數轉成樣本比例
  2. 單一母體比例的假設
  3. 單一比例的信賴區間
  4. 平均數檢定與比例檢定的對照
  5. 兩個獨立母體比例
  6. 從母體變異數到樣本估計
  7. 兩比例相等的假設檢定
  8. 兩比例差的信賴區間
  9. 常態近似與精確方法
  10. 檢定步驟

二項分布檢定(binomial test)用來推論母體中的事件比例。每個觀察單位只有兩種互斥結果,例如有病/沒病、成功/失敗或陽性/陰性;研究問題可以是單一母體比例是否等於指定值,也可以是兩個獨立母體的比例是否相同。

從成功次數轉成樣本比例

假設從母體抽取 n 個彼此獨立的觀察單位,其中 x 個出現所關心的事件。若每個觀察單位的事件機率皆為 π,成功次數 X 服從二項分配;樣本比例 p̂=X/n 則是母體比例 π 的估計值。

成功次數XBinomial(n,π)X\sim\operatorname{Binomial}(n,\pi)
樣本比例p^=Xn=xn\hat p=\frac{X}{n}=\frac{x}{n}
樣本比例的平均數E(p^)=πE(\hat p)=\pi
樣本比例的變異數與標準誤Var(p^)=π(1π)n,SE(p^)=π(1π)n\operatorname{Var}(\hat p)=\frac{\pi(1-\pi)}{n},\qquad \operatorname{SE}(\hat p)=\sqrt{\frac{\pi(1-\pi)}{n}}

單一母體比例的假設

雙尾:比例是否不同H0:π=π0,H1:ππ0H_0:\pi=\pi_0,\qquad H_1:\pi\ne\pi_0
右尾:比例是否較高H0:ππ0,H1:π>π0H_0:\pi\leq\pi_0,\qquad H_1:\pi>\pi_0
左尾:比例是否較低H0:ππ0,H1:π<π0H_0:\pi\geq\pi_0,\qquad H_1:\pi<\pi_0

在 H₀ 成立時,樣本比例以 π₀ 為中心。當二項分配可以合理地用常態分配近似時,將 p̂ 減去 π₀,再除以 H₀ 下的標準誤,就得到近似標準常態的 Z 統計量。

Z=p^π0π0(1π0)/nN(0,1)(H0 成立時)Z=\frac{\hat p-\pi_0}{\sqrt{\pi_0(1-\pi_0)/n}}\approx N(0,1)\qquad(H_0\text{ 成立時})
符號在這組公式中的意義
平方根;常用來把變異數轉成標準差
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

單一比例的信賴區間

檢定的標準誤使用 H₀ 指定的 π₀,因為 p 值是在 H₀ 世界中計算;估計母體比例的信賴區間則必須使用樣本提供的比例資訊。最直接的常態近似區間為:

p^±z1α/2p^(1p^)n\hat p\pm z_{1-\alpha/2}\sqrt{\frac{\hat p(1-\hat p)}{n}}
符號在這組公式中的意義
平方根;常用來把變異數轉成標準差
z標準化後的 z 統計量;下標通常表示指定尾端機率的臨界值
α顯著水準或信賴區間兩端所使用的尾端機率
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

平均數檢定與比例檢定的對照

比較項目平均數的 Z 檢定單一比例的 Z 檢定
母體參數平均數 μ\mu比例 π\pi
樣本估計值Xˉ\bar Xp^=X/n\hat p=X/n
H0H_0 指定值μ0\mu_0π0\pi_0
H0H_0 下的標準誤σ/n\sigma/\sqrt nπ0(1π0)/n\sqrt{\pi_0(1-\pi_0)/n}
標準化Xˉμ0σ/n\dfrac{\bar X-\mu_0}{\sigma/\sqrt n}p^π0π0(1π0)/n\dfrac{\hat p-\pi_0}{\sqrt{\pi_0(1-\pi_0)/n}}

兩種方法的共同結構都是「樣本估計值−H₀ 指定值」,再除以該估計值在 H₀ 下的標準誤。比例檢定的平均數與變異數不是另外背出的公式,而是由二項分配推得。

兩個獨立母體比例

若第 1 組有 n₁ 個觀察值、其中 x₁ 個事件,第 2 組有 n₂ 個觀察值、其中 x₂ 個事件,兩組樣本比例分別為 p̂₁=x₁/n₁ 與 p̂₂=x₂/n₂。研究的統計量是兩個獨立樣本比例之差。

兩組樣本比例p^1=x1n1,p^2=x2n2\hat p_1=\frac{x_1}{n_1},\qquad \hat p_2=\frac{x_2}{n_2}
比例差的平均數E(p^1p^2)=π1π2E(\hat p_1-\hat p_2)=\pi_1-\pi_2
比例差的變異數Var(p^1p^2)=π1(1π1)n1+π2(1π2)n2\operatorname{Var}(\hat p_1-\hat p_2)=\frac{\pi_1(1-\pi_1)}{n_1}+\frac{\pi_2(1-\pi_2)}{n_2}

從母體變異數到樣本估計

母體層次的變異數含有未知參數 π₁、π₂,實際分析時無法直接計算。若只是估計兩組比例差的一般抽樣變異,可以分別用 p̂₁、p̂₂ 代替 π₁、π₂,得到 unpooled variance estimate。

母體比例差的變異數Var(p^1p^2)=π1(1π1)n1+π2(1π2)n2\operatorname{Var}(\hat p_1-\hat p_2)=\frac{\pi_1(1-\pi_1)}{n_1}+\frac{\pi_2(1-\pi_2)}{n_2}
以兩組樣本比例分別估計Var^(p^1p^2)=p^1(1p^1)n1+p^2(1p^2)n2\widehat{\operatorname{Var}}(\hat p_1-\hat p_2)=\frac{\hat p_1(1-\hat p_1)}{n_1}+\frac{\hat p_2(1-\hat p_2)}{n_2}
一般估計標準誤SE^(p^1p^2)=p^1(1p^1)n1+p^2(1p^2)n2\widehat{\operatorname{SE}}(\hat p_1-\hat p_2)=\sqrt{\frac{\hat p_1(1-\hat p_1)}{n_1}+\frac{\hat p_2(1-\hat p_2)}{n_2}}

兩比例相等的假設檢定

雙尾假設H0:π1=π2,H1:π1π2H_0:\pi_1=\pi_2,\qquad H_1:\pi_1\ne\pi_2
等價寫法H0:π1π2=0,H1:π1π20H_0:\pi_1-\pi_2=0,\qquad H_1:\pi_1-\pi_2\ne0

H₀: π₁=π₂ 不是說觀察到的 p̂₁ 與 p̂₂ 必須剛好相等,而是先假設兩組資料來自同一個未知母體比例 π。既然 H₀ 世界中只有一個共同的 π,就應使用全部 n₁+n₂ 個觀察值共同估計它,而不是各自保留兩個比例參數。

H₀ 下兩組共用同一個比例π1=π2=π\pi_1=\pi_2=\pi
以所有事件數估計共同 πp^=x1+x2n1+n2=n1p^1+n2p^2n1+n2\hat p=\frac{x_1+x_2}{n_1+n_2}=\frac{n_1\hat p_1+n_2\hat p_2}{n_1+n_2}
把共同估計值代入兩組變異數Var^0(p^1p^2)=p^(1p^)n1+p^(1p^)n2\widehat{\operatorname{Var}}_0(\hat p_1-\hat p_2)=\frac{\hat p(1-\hat p)}{n_1}+\frac{\hat p(1-\hat p)}{n_2}
提出共同因子Var^0(p^1p^2)=p^(1p^)(1n1+1n2)\widehat{\operatorname{Var}}_0(\hat p_1-\hat p_2)=\hat p(1-\hat p)\left(\frac1{n_1}+\frac1{n_2}\right)
變異數開根號得到 H₀ 下的標準誤SE^0(p^1p^2)=p^(1p^)(1n1+1n2)\widehat{\operatorname{SE}}_0(\hat p_1-\hat p_2)=\sqrt{\hat p(1-\hat p)\left(\frac1{n_1}+\frac1{n_2}\right)}
兩獨立比例的 Z 統計量Z=p^1p^2p^(1p^)(1/n1+1/n2)Z=\frac{\hat p_1-\hat p_2}{\sqrt{\hat p(1-\hat p)(1/n_1+1/n_2)}}

單尾問題可依研究方向把對立假設改為 π₁>π₂ 或 π₁<π₂;公式不變,但 p 值只計算指定方向的尾端機率。

兩比例差的信賴區間

建立信賴區間時,不再假設 π₁=π₂,因此兩組變異數必須分別用各自的樣本比例估計,不能沿用檢定時的 pooled 標準誤。

(p^1p^2)±z1α/2p^1(1p^1)n1+p^2(1p^2)n2(\hat p_1-\hat p_2)\pm z_{1-\alpha/2}\sqrt{\frac{\hat p_1(1-\hat p_1)}{n_1}+\frac{\hat p_2(1-\hat p_2)}{n_2}}
用途比例的處理方式標準誤
檢定 H0:π1=π2H_0:\pi_1=\pi_2合併為共同比例 p^\hat pp^(1p^)(1/n1+1/n2)\sqrt{\hat p(1-\hat p)(1/n_1+1/n_2)}
估計 π1π2\pi_1-\pi_2 的信賴區間兩組比例分開估計p^1(1p^1)/n1+p^2(1p^2)/n2\sqrt{\hat p_1(1-\hat p_1)/n_1+\hat p_2(1-\hat p_2)/n_2}

常態近似與精確方法

Z 檢定依賴二項分配的常態近似。單一比例檢定應檢查 H₀ 下的 nπ₀ 與 n(1−π₀);兩比例檢定則要確認兩組在 H₀ 下的預期事件數與非事件數都不過小。近似條件不足時,不應只因總樣本數看起來很大就直接查 Z 表。

情況可考慮的方法
單一比例、樣本足夠單一比例 Z 檢定
單一比例、樣本小或事件罕見精確二項檢定
兩個獨立比例、預期次數足夠兩比例 Z 檢定;2×2 表中與 Pearson 卡方檢定等價
兩個獨立比例、預期次數過小Fisher 精確檢定等精確方法

檢定步驟

  1. 確認結果為二元資料,觀察值彼此獨立,而且研究的是一個比例或兩個獨立比例。
  2. 依研究問題設定 H₀、H₁、單尾或雙尾方向,以及顯著水準 α。
  3. 檢查常態近似條件;條件不足時改用適合的精確方法。
  4. 計算樣本比例與檢定標準誤,得到 Z 值及 p 值,再回到研究問題作出判讀。