CHAPTER 03 · TOPIC 01
抽樣與抽樣分配
抽樣(sampling)是從母體中選取一部分觀察單位形成樣本,再利用樣本提供的資訊推論母體。它是推論統計的重要起點:我們實際觀察的是樣本,真正想了解的通常是尚未完整觀察的母體。
本頁內容
抽樣(sampling)是從母體中選取一部分觀察單位形成樣本,再利用樣本提供的資訊推論母體。它是推論統計的重要起點:我們實際觀察的是樣本,真正想了解的通常是尚未完整觀察的母體。
母體、樣本、參數與統計量#
母體(population)是研究問題所關心的全部對象;樣本(sample)是實際被選取並觀察的一部分。描述母體的數值稱為參數,根據樣本計算的數值稱為統計量。統計推論就是利用統計量估計或檢驗未知的母體參數。
| 層級 | 對象 | 常見數值 | 性質 |
| 母體 | 研究問題所關心的全部單位 | 平均數 μ、變異數 σ²、比例 p | 通常未知,是推論的目標 |
| 樣本 | 從母體中實際選取的 n 個單位 | 平均數 X̄、變異數 s²、比例 p̂ | 可由觀察資料計算,用來推論母體 |
| 符號 | 代表意義 |
| N | 母體中的單位總數 |
| n | 樣本中的單位數 |
| Xᵢ | 樣本中的第 i 個觀察值 |
| μ、σ² | 母體平均數與母體變異數 |
| X̄、s² | 樣本平均數與樣本變異數 |
| p、p̂ | 母體比例與樣本比例 |
為什麼需要抽樣?#
- 母體可能過大或無法完整列舉,全面調查在實務上不可行
- 抽樣通常能降低時間、人力與成本
- 有些測量具有破壞性,不可能測量母體中的每一個單位
- 較小的研究有時能投入更多訓練、測量與品質控制
- 使用機率抽樣時,可以用統計方法評估抽樣造成的不確定性
抽樣誤差與抽樣偏差不同#
同一母體反覆抽樣時,不同樣本通常會得到不同統計量,這種隨機波動稱為抽樣誤差(sampling error)。若某些個體較容易或較不容易被選入,使樣本系統性偏離目標母體,則屬於抽樣偏差(sampling bias)。
| 問題 | 形成原因 | 增加樣本數能否改善? |
| 抽樣誤差 | 隨機抽取不同個體造成的自然波動 | 通常可以降低 |
| 抽樣偏差 | 抽樣框、納入方式或未回覆造成系統性失真 | 不能只靠增加樣本數消除 |
常見的機率抽樣方法#
1. 簡單隨機抽樣#
簡單隨機抽樣(simple random sampling)是從抽樣框中隨機選取個體,使每一個大小為 n 的可能樣本具有相同被選中的機會。概念最直接,但前提是能取得完整抽樣框,實務上不一定容易。
2. 系統抽樣#
系統抽樣(systematic sampling)先將抽樣框依固定順序排列,在前 k 個單位中隨機選擇起點,之後每隔 k 個單位抽取一人。它容易執行,但如果名單中存在和抽樣間隔相同的週期結構,可能造成偏差。
| 符號 | 在這組公式中的意義 |
| N | 母體中的觀察單位總數 |
| n | 由母體抽出的樣本數 |
| xᵢ | 母體或樣本中的第 i 個觀察值 |
| i、j | 不同觀察值的索引編號 |
| sd | 標準差;依公式所在位置可能指資料標準差或抽樣平均數的標準誤 |
3. 分層抽樣#
分層抽樣(stratified sampling)先依重要特徵將母體分成彼此不重疊的層,再從每一層分別進行隨機抽樣。它能確保重要子群體都被納入,也可以依各層大小採比例分配,或刻意增加小族群樣本後再使用權重分析。
4. 群集抽樣#
群集抽樣(cluster sampling)先把母體分成自然形成的群集,例如醫院、學校或社區,再隨機抽取其中一些群集。單階段群集抽樣會調查被抽中群集內的全部個體;若再從群集內抽取部分個體,則屬於兩階段或多階段抽樣。
| 方法 | 先做什麼? | 從哪裡抽? | 主要優點 | 主要風險 |
| 簡單隨機 | 建立完整抽樣框 | 整個母體名單 | 概念與分析直接 | 完整名單可能難以取得 |
| 系統抽樣 | 隨機起點並決定間隔 k | 每隔 k 個單位 | 執行方便 | 名單週期可能造成偏差 |
| 分層抽樣 | 依重要特徵分層 | 每一層都抽 | 確保子群體代表性 | 不等比例抽樣時需權重 |
| 群集抽樣 | 建立自然群集 | 只抽部分群集 | 降低地理與執行成本 | 群集內相似會降低有效資訊量 |
中央極限定理#
中央極限定理(central limit theorem, CLT)說明:若觀察值彼此獨立、來自相同分布,且母體具有有限平均數 μ 與有限變異數 σ²,當 n 增加時,樣本平均數經過標準化後,其分布會逐漸接近標準常態分配。
若母體本身服從常態分配,無論 n 大小,樣本平均數都精確服從常態分配;若母體不是常態,則需要 n 足夠大才有良好近似。常見的 n≥30 只是經驗法則,不是普遍保證:母體越偏斜、尾端越厚或離群值越多,通常需要更大的樣本。
從一次樣本走向所有可能樣本#
假設有限母體中共有 N 個單位,每次以簡單隨機方式、不放回地抽取 n 個單位,而且不考慮抽取順序,所有可能樣本數為 C(N,n)。每一個可能樣本都能算出一個樣本平均數。
| 母體 | 大小為 n 的可能樣本 | 該樣本的平均數 |
| N 個單位,平均數 μ、標準差 σ | X₁₁, X₁₂, …, X₁ₙ | X̄₁ |
| X₂₁, X₂₂, …, X₂ₙ | X̄₂ | |
| ⋮ | ⋮ | |
| Xₘ₁, Xₘ₂, …, Xₘₙ | X̄ₘ |
什麼是抽樣分配?#
將所有可能樣本或概念上反覆抽樣所得的統計量整理成機率分配,就得到該統計量的抽樣分配(sampling distribution)。例如,把每次樣本平均數 X̄ 記錄下來,其分配就是樣本平均數的抽樣分配。
| 分布 | 其中的數值是什麼? | 回答的問題 |
| 母體分布 | 母體中每個個體的觀察值 | 整個母體長什麼樣子? |
| 樣本資料分布 | 某一次樣本中的 n 個觀察值 | 這次抽到的資料長什麼樣子? |
| 統計量的抽樣分配 | 重複抽樣得到的 X̄、p̂ 等統計量 | 如果研究重做,統計結果會怎麼變? |
樣本平均數的抽樣分配#
若 X₁,…,Xₙ 是來自同一母體、彼此獨立且具有平均數 μ、變異數 σ²的觀察值,則樣本平均數是一個不偏估計量:重複抽樣所得的樣本平均數,其平均會等於母體平均數。
| 符號 | 代表意義 |
| E(X̄) | 重複抽樣時,樣本平均數的長期平均 |
| Var(X̄) | 樣本平均數在不同樣本間的變異程度 |
| SE(X̄) | 樣本平均數抽樣分配的標準差 |
| σ | 個體觀察值在母體中的標準差 |
| n | 每一次抽樣的樣本數 |
補充一:隨機變數的線性組合
隨機變數的線性組合(linear combination of random variables)是資料合併時會反覆用到的方法。在看公式以前,必須先分清楚公式中的符號代表什麼。
| 抽樣階段 | 符號 | 代表什麼? | 可以回答什麼? |
| 抽樣以前/概念上重複抽樣 | Xᵢ(隨機變數) | 第 i 次抽樣可能得到的結果 | 期望值、變異數與抽樣分配 |
| 抽樣完成以後 | xᵢ(觀察值) | 這一次實際得到的固定數字 | 這份樣本的加總、平均與其他描述值 |
設 X₁,…,Xₙ 為隨機變數,c₁,…,cₙ 為常數,則:
和、差與平均都是線性組合
例如有兩個隨機變數 X₁、X₂,可以形成下列不同的線性組合:
1. 線性組合的期望值
這裡先利用期望值對加法的線性性,再把常數 cᵢ 提到期望值之外。這一串等式不要求 X₁,…,Xₙ 彼此獨立。
2. 線性組合的變異數
依照你原文採用的獨立隨機變數情況,變異數可逐步寫成:
若隨機變數之間可能相關,就不能省略交叉的協方差項,完整形式為:
補充二:抽樣平均數的平均與標準誤完整推導
法一:列出有限母體的所有可能樣本
設有限母體為 x₁,…,x_N,母體大小為 N;每次不放回抽出 n 個且不計順序,因此共有 C(N,n) 個可能樣本。以下保留原推導使用的技巧:先展開平方,再計算單項與交叉項在所有樣本中各出現幾次。為避免重複計數,交叉項一律記為 Σᵢ<ⱼxᵢxⱼ。
第一步:所有樣本平均數的平均
固定一個 xᵢ 後,其餘 n−1 個位置可從另外 N−1 個母體值中選,所以每個 xᵢ 會出現在 C(N−1,n−1) 個樣本中。這個出現次數就是原推導的第一個組合計數技巧。
第二步:先求 E(X̄²),再扣掉 [E(X̄)]²
將每個樣本平均數平方後,會出現 xᵢ² 與 2xᵢxⱼ。固定一個 xᵢ 時,它出現 C(N−1,n−1) 次;固定一對 xᵢ、xⱼ 時,其餘 n−2 個位置可從 N−2 個值中選,所以這一對出現 C(N−2,n−2) 次。這就是原推導中交叉項係數的來源。
接著使用第二個組合化簡技巧:
當 N 相對於 n 很大時,有限母體修正 √[(N−n)/(N−1)] 接近 1,因此得到常用形式 SE(X̄)=σ/√n。
法二:利用隨機變數的線性組合
把 n 次抽樣看成取得 X₁,…,Xₙ;每個 Xᵢ 都有 E(Xᵢ)=μ、Var(Xᵢ)=σ²。若它們彼此獨立,樣本平均數就是係數皆為 1/n 的線性組合。
當 σ 未知時,實務上常以樣本標準差 s 估計,因此使用 s/√n 作為估計標準誤。若從有限母體中不放回抽樣,而且抽樣比例 n/N 不可忽略,還要加入有限母體修正。
樣本變異數為什麼使用 n−1?#
樣本平均數 X̄ 是由同一批資料估計而來,因此 n 個離差 Xᵢ−X̄ 必須加總為 0,只剩 n−1 個可以獨立變動。使用 n−1 作為分母,可以使樣本變異數成為母體變異數 σ²的不偏估計量。
補充三:抽樣變異數的平均如何推估母體變異數(完整推導)
這裡沿用原文的有限母體列舉法。先令每個樣本以 n 為分母計算組內變異數 v;再把所有 C(N,n) 個可能樣本的 v 取平均。推導的關鍵仍是展開平方,以及計算 xᵢ² 與 xᵢxⱼ 在所有樣本中出現的次數。
對所有樣本加總時,每個 xᵢ² 出現 C(N−1,n−1) 次;每一對 xᵢxⱼ 出現 C(N−2,n−2) 次。因此:
因此若母體變異數 σ²採用分母 N 的定義,從有限母體不放回抽樣得到的精確修正為:
實務上通常看不到所有可能樣本,只看到其中一個樣本。以該樣本的 v 代替 E(v),並在 N 很大時令 (N−1)/N≈1,就得到熟悉的 n−1 修正:
所以正文中的根號公式是樣本標準差 s;而推估母體變異數的核心是先證明樣本變異數 s²在相應定義下具有不偏性。
樣本數如何影響標準誤?#
標準誤和 √n 成反比,因此增加樣本數會讓樣本平均數的抽樣分配更集中,但改善並非線性。若希望把標準誤減半,樣本數必須增加為原來的四倍。
| 符號 | 在這組公式中的意義 |
| N | 母體中的觀察單位總數 |
| n | 由母體抽出的樣本數 |
| xᵢ | 母體或樣本中的第 i 個觀察值 |
| i、j | 不同觀察值的索引編號 |
| sd | 標準差;依公式所在位置可能指資料標準差或抽樣平均數的標準誤 |
| √ | 平方根;常用來把變異數轉成標準差 |