CHAPTER 05 · TOPIC 03
2×2 列聯表
2×2 列聯表(2×2 contingency table)用來整理兩個二元類別變項的聯合分布。例如,一個變項表示是否暴露於某項因子,另一個變項表示是否發生疾病;四個儲存格記錄兩種分類交叉後的觀察次數。
本頁內容
- 2×2 表格的結構
- 從次數表寫成聯合機率
- 如果 X 與 Y 彼此獨立
- 研究設計決定表格要怎麼讀
- 勝算與勝算比 OR
- 為什麼對 OR 取自然對數?
- 相對風險 RR
- ln(RR) 的標準誤與信賴區間
- OR 與 RR 的關係
- 取 ln 後的公式比較
- 分析時還要注意什麼?
2×2 列聯表(2×2 contingency table)用來整理兩個二元類別變項的聯合分布。例如,一個變項表示是否暴露於某項因子,另一個變項表示是否發生疾病;四個儲存格記錄兩種分類交叉後的觀察次數。
2×2 表格的結構
| 有疾病(case) | 無疾病(control) | 合計 | |
| 有暴露(exposed) | A | B | A+B |
| 無暴露(unexposed) | C | D | C+D |
| 合計 | A+C | B+D | N=A+B+C+D |
表格內的 A、B、C、D 是聯合次數;列合計與欄合計則是邊際次數。同一張表可以沿著列比較疾病比例,也可以沿著欄比較暴露比例,但應該沿哪個方向解讀,取決於研究如何抽樣,而不是表格外觀看起來如何。
| 符號 | 代表的觀察 |
| A | 有暴露且有疾病 |
| B | 有暴露但無疾病 |
| C | 無暴露但有疾病 |
| D | 無暴露且無疾病 |
從次數表寫成聯合機率
令 X=1 表示有暴露、Y=1 表示有疾病。Pᵢⱼ 表示 X=i 且 Y=j 的聯合機率,四個聯合機率相加等於 1。
| Y=1 | Y=0 | X 的邊際機率 | |
| X=1 | |||
| X=0 | |||
| Y 的邊際機率 | 1 |
如果 X 與 Y 彼此獨立
獨立表示知道 X 的結果,不會改變 Y 的機率;因此每一格的聯合機率等於對應邊際機率的乘積。
| Y=1 | Y=0 | |
| X=1 | ||
| X=0 |
下一篇卡方獨立性檢定會把這個機率條件轉成各格的期望次數,再比較實際觀察次數與獨立情況下的期望次數。本頁先集中處理 2×2 表本身及其效果量。
研究設計決定表格要怎麼讀
| 研究設計 | 如何取得樣本 | 主要比較方向 | 可直接估計的效果量 |
| 病例對照研究(case-control study) | 先依疾病狀態選取病例與對照,再回溯過去暴露 | 比較病例與對照的暴露勝算 | 勝算比 OR |
| 世代研究(cohort study) | 先依暴露狀態形成群組,再觀察疾病結果 | 比較暴露組與未暴露組的疾病風險 | 相對風險 RR、風險差 |
例如,病例對照研究可以比較口腔癌病例與非病例過去嚼檳榔的情形;世代研究則可先找出嚼檳榔與未嚼檳榔者,再追蹤兩組後續發生疾病的比例。世代研究可以是前瞻、回溯或雙向設計,關鍵在於研究者依暴露形成風險集合,而不是單看資料收集發生在過去或未來。
勝算與勝算比 OR
若某事件發生的機率為 p,勝算(odds)是事件發生機率與未發生機率的比值。機率是「發生者占全部的比例」,勝算則是「發生者相對於未發生者有多少」。
| 符號 | 在這組公式中的意義 |
| A、B、C、D | 2×2 列聯表四個格子的觀察次數;實際位置依頁面上的表格標示 |
| OR | 勝算比(odds ratio) |
| p₁、p₂ | 兩組事件發生的機率 |
| L | 取自然對數後的效果量,例如 ln(OR) 或 ln(RR) |
| n | 本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準 |
在病例對照研究中,可以比較病例與對照的暴露勝算;等價地,也可以比較暴露組與未暴露組的疾病勝算。兩種方向最後都得到相同的交叉乘積比。
| OR 的值 | 資料層次的解讀 |
| OR=1 | 兩組勝算相同,沒有觀察到關聯 |
| OR>1 | 暴露與較高的疾病勝算相關 |
| OR<1 | 暴露與較低的疾病勝算相關 |
為什麼對 OR 取自然對數?
OR 只能大於 0,且其抽樣分布通常右偏。取自然對數後,無關聯的 OR=1 會轉成 ln(OR)=0,兩個勝算相除也會轉成對數勝算相減;在四格次數足夠時,ln(OR) 的抽樣分布較接近常態分布,方便建立 Z 統計量與信賴區間。
L、U 是 ln(OR) 信賴區間的下限與上限。最後必須取指數轉回 OR 尺度;若 OR 的信賴區間包含 1,便與相同顯著水準下無法拒絕 H₀:OR=1 相對應。這些大樣本公式可由 delta method(泰勒展開的一階近似)推得。
相對風險 RR
世代研究可以直接計算兩組的疾病風險。暴露組的風險為 A/(A+B),未暴露組的風險為 C/(C+D);兩者相除就是相對風險(relative risk)。
| RR 的值 | 資料層次的解讀 |
| RR=1 | 兩組疾病風險相同 |
| RR>1 | 暴露組的疾病風險較高 |
| RR<1 | 暴露組的疾病風險較低 |
ln(RR) 的標準誤與信賴區間
RR 也只能大於 0,取自然對數後,RR=1 會變成 ln(RR)=0。在兩組獨立且計數足夠時,可利用 ln(RR) 的近似常態分布進行推論。
OR 與 RR 的關係
| 比較項目 | OR | RR |
| 比較內容 | 兩組勝算的比值 | 兩組風險的比值 |
| 無關聯值 | 1 | 1 |
| 病例對照研究 | 通常可估計 | 通常不能直接估計 |
| 世代研究/隨機試驗 | 可估計 | 可估計 |
| 效果解讀 | 勝算變成幾倍 | 風險變成幾倍 |
疾病在兩組中都很少見時,A 相對於 B 很小、C 相對於 D 也很小,因此 A+B≈B、C+D≈D,OR 會接近 RR。
| 符號 | 在這組公式中的意義 |
| A、B、C、D | 2×2 列聯表四個格子的觀察次數;實際位置依頁面上的表格標示 |
| OR | 勝算比(odds ratio) |
| p₁、p₂ | 兩組事件發生的機率 |
| L | 取自然對數後的效果量,例如 ln(OR) 或 ln(RR) |
取 ln 後的公式比較
把單一二項比例、病例對照研究的 ln(OR) 與世代研究的 ln(RR) 放在同一張表,可以看出三者共享相同的推論骨架:先決定樣本估計值與其變異數,再以「估計值−H₀ 指定值」除以標準誤,最後用同一個標準誤建立信賴區間。
| 比較項目 | 單一二項比例 | 病例對照研究:ln(OR) | 世代研究:ln(RR) |
| 樣本估計值 | |||
| 估計變異數 | |||
| 標準化 | |||
| 信賴區間 |
補充:資料轉換、ln(OR) 與 ln(RR) 的完整推導
資料轉換後的平均數與變異數
先處理推導共同使用的數學工具。設隨機變數 X 的平均數為 μ、變異數為 σ²,經過函數轉換後得到 Y=f(X)。在 μ 附近展開 f(X):
求轉換後的平均數
求轉換後的變異數
將結果用在 ln(OR)
病例組的暴露比例為 p₁=A/(A+C)、樣本數為 n₁=A+C;對照組的暴露比例為 p₂=B/(B+D)、樣本數為 n₂=B+D。
先將兩組比例分別轉換成對數勝算,再用線性組合把兩組相減:
ln(OR) 的平均數
ln(OR) 的變異數
由二項比例 Var(p̂)=p(1−p)/n,以及 logit 函數的導數,先求單一組別的對數勝算變異數:
將結果用在 ln(RR)
暴露組的疾病比例為 p₁=A/(A+B)、樣本數為 n₁=A+B;未暴露組的疾病比例為 p₂=C/(C+D)、樣本數為 n₂=C+D。
兩組比例先取自然對數,再將兩組相減:
ln(RR) 的平均數
ln(RR) 的變異數
對 h(p)=ln(p) 微分,再代入二項比例的變異數:
分析時還要注意什麼?
- 確認四格的列、欄定義與參考組;交換疾病、暴露或參考組方向,可能使 OR 或 RR 變成倒數。
- 確認觀察值彼此獨立。若是同一批受試者前後配對的二元結果,應使用配對方法,而不是獨立 2×2 表的方法。
- 四格次數很小時,ln(OR) 與 ln(RR) 的常態近似可能不可靠;若任一格為 0,上述含倒數與對數的公式也不能直接使用。
- 效果量應搭配信賴區間,而不是只報告 p 值;統計關聯仍需結合研究設計判斷偏差、混雜與因果關係。