生物統計學習筆記從概念、推導到實務判讀

CHAPTER 01 · TOPIC 03

敘述統計

敘述統計(descriptive statistics)是用來整理、摘要與呈現資料的方法。它不只是在論文的 Table 1 列出數字,而是幫助我們先看懂樣本:資料有哪些類型、中心落在哪裡、彼此差異有多大,以及分布是否對稱或出現離群值。

本頁內容
  1. 先看資料的型態
  2. 集中趨勢:資料的中心在哪裡?
  3. 眾數
  4. 中位數
  5. 算術平均數
  6. 修剪平均數與幾何平均數
  7. 變異程度:資料彼此差多少?
  8. 全距與四分位距
  9. 變異數與標準差
  10. 變異係數
  11. 分布形狀:偏度與峰度
  12. 如何完整報告敘述統計?

敘述統計(descriptive statistics)是用來整理、摘要與呈現資料的方法。它不只是在論文的 Table 1 列出數字,而是幫助我們先看懂樣本:資料有哪些類型、中心落在哪裡、彼此差異有多大,以及分布是否對稱或出現離群值。

先看資料的型態#

不同型態的資料需要不同的摘要方式。類別資料通常報告次數與百分比;數值資料則需要同時描述中心位置、變異程度與分布形狀。樣本數通常以 n 表示。

資料型態常用摘要常見呈現
類別資料次數、百分比次數分配表、長條圖
數值資料平均數與標準差,或中位數與四分位距直方圖、盒鬚圖、密度圖
補充應用:ABC 分析法

ABC 分析法也稱為帕累托分析,是把大量分析對象按照某項指標的貢獻度分級,找出少數影響最大的對象,讓時間、成本與管理資源可以優先投入重點項目。它常用於商品銷售、客戶貢獻、成本、問題原因與庫存管理等分析。

  1. 決定要分析的對象與指標,例如商品銷售額、客戶營收或問題發生次數。
  2. 彙整每個對象的數值,並由高到低排列成長條圖。
  3. 計算各項占總數的比例,再依序加總為累積百分比。
  4. 按照累積百分比切分 A、B、C 類,並為不同類別安排不同的管理方式。
ABC 分析圖:分析對象依指標貢獻度由高至低排列,並以累積百分比區分 A、B、C 類
ABC 分析將對象依貢獻度由高至低排列,再按照累積百分比分類;圖中界線為示意。來源:本站製作
分類代表意義處理方式
A 類數量較少,但對結果的貢獻最大優先分析並集中資源處理
B 類貢獻程度居中定期追蹤並採一般管理
C 類數量可能很多,但單項貢獻較小簡化管理,避免投入過多成本

A、B、C 的分界不是固定規定。圖中的 70% 與 90% 是常見示意,實際上應依分析目的、資料特性與管理成本調整。

集中趨勢:資料的中心在哪裡?#

集中趨勢(central tendency)是用一個具有代表性的數值描述資料的中心位置。常見指標包括眾數、中位數與平均數;它們回答的問題不同,不能只依習慣選擇。

眾數#

眾數(mode)是資料中出現次數最多的值。它可用於類別資料與數值資料,而且一組資料可能沒有眾數,也可能有一個以上的眾數。

中位數#

中位數(median)是將資料由小到大排列後,位於中間位置的數值。若資料數量為奇數,取正中央的觀察值;若為偶數,通常取中間兩個觀察值的平均。

奇數筆資料的位置=n+12\text{奇數筆資料的位置}=\frac{n+1}{2}
第一步:找出中間兩個位置n2 與 (n2+1)\frac{n}{2}\text{ 與 }\left(\frac{n}{2}+1\right)
第二步:取中間兩個觀察值的平均Median=x(n/2)+x(n/2+1)2\operatorname{Median}=\frac{x_{(n/2)}+x_{(n/2+1)}}{2}
中位數公式的符號代表意義
n資料的總筆數
x₍ₖ₎資料由小到大排列後,第 k 個位置的觀察值
Median中位數;偶數筆資料時為中央兩個觀察值的平均

中位數較不容易受到極端值影響,因此當分布明顯偏斜或存在離群值時,通常比平均數更能代表典型位置。不過,中位數沒有充分利用每個觀察值的實際大小,在某些統計推論中也不如平均數方便。

算術平均數#

算術平均數(arithmetic mean)是所有觀察值總和除以資料筆數。它會使用每一筆資料,因此能反映整體數值,但也容易受到極端值影響。

xˉ=1ni=1nxi\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i
平均數公式的符號代表意義
樣本的算術平均數
xᵢ第 i 筆觀察值
n資料的總筆數
Σ求和符號;把第 1 筆到第 n 筆觀察值全部加總
i觀察值的編號,由 1 依序到 n

修剪平均數與幾何平均數#

修剪平均數(trimmed mean)會先依大小排序,再從兩端各移除固定比例的觀察值後計算平均。它不是先判定哪些值是錯誤的離群值再刪除,而是在平均數與中位數之間取得對極端值較穩健的摘要。

幾何平均數(geometric mean)適合描述正值資料的乘法變化,例如成長倍數、比率或對數常態資料。對於明顯右偏且數值皆為正的資料,常會先取自然對數(ln);取 ln 後,較大的數值會被壓縮,資料可能變得較為對稱,並可能更接近常態分布,方便進行後續分析。若資料包含零或負值,便不能直接使用一般的對數轉換與幾何平均數。

連乘形式G=(i=1nxi)1/n,xi>0G=\left(\prod_{i=1}^{n}x_i\right)^{1/n},\quad x_i>0
等價的對數形式G=exp ⁣(1ni=1nlnxi)G=\exp\!\left(\frac{1}{n}\sum_{i=1}^{n}\ln x_i\right)
幾何平均數公式的符號代表意義
G幾何平均數
xᵢ第 i 筆觀察值,且每一筆都必須大於 0
n資料的總筆數
Π連乘符號;把第 1 筆到第 n 筆觀察值全部相乘
Σ求和符號;此處是把每筆資料取 ln 後全部相加
ln自然對數
expln 的反函數,用來把結果轉回原始尺度

變異程度:資料彼此差多少?#

只知道中心位置仍不足以描述資料。即使兩組資料的平均數相同,分散程度也可能完全不同,因此需要全距、四分位距、變異數或標準差等指標。

全距與四分位距#

全距=xmaxxmin\text{全距}=x_{\max}-x_{\min}
IQR=Q3Q1\operatorname{IQR}=Q_3-Q_1
全距與四分位距的符號代表意義
xₘₐₓ資料中的最大值
xₘᵢₙ資料中的最小值
Q₁第一四分位數;約有 25% 的資料不大於它
Q₃第三四分位數;約有 75% 的資料不大於它
IQR四分位距,表示中間 50% 資料涵蓋的範圍

全距只使用最大值與最小值,因此容易受到極端值影響。四分位距(interquartile range, IQR)描述中間 50% 資料的範圍,對極端值較穩健,特別適合與中位數一起報告。

變異數與標準差#

變異數以每個觀察值和平均數之間的平方距離衡量分散程度;標準差是變異數的平方根,因此與原始資料具有相同單位,通常更容易解讀。

母體的變異數與標準差σ2=1Ni=1N(xiμ)2,σ=σ2\sigma^2=\frac{1}{N}\sum_{i=1}^{N}(x_i-\mu)^2,\qquad \sigma=\sqrt{\sigma^2}
樣本的變異數與標準差s2=1n1i=1n(xixˉ)2,s=s2s^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})^2,\qquad s=\sqrt{s^2}

這兩組公式先計算每筆資料離平均數有多遠,再將距離平方後加總。結果愈大,表示資料愈分散;最後開平方得到標準差,使單位回到與原始資料相同。

變異數與標準差的符號代表意義
N、n母體大小與樣本筆數
xᵢ第 i 筆觀察值
μ、x̄母體平均數與樣本平均數
σ²、s²母體變異數與樣本變異數
σ、s母體標準差與樣本標準差
Σ將每筆資料與平均數之間的平方距離全部加總
n−1樣本變異數使用的自由度

變異係數#

變異係數(coefficient of variation, CV)以標準差相對於平均數的大小描述相對變異,常以百分比表示。它適合比較單位或平均水準不同、且具有有意義絕對零點的正值資料;當平均數接近零或資料可為負值時,CV 容易失去解釋性。

CV=sxˉ×100%\operatorname{CV}=\frac{s}{\bar{x}}\times 100\%
變異係數公式的符號代表意義
CV變異係數,通常以百分比表示
s樣本標準差
樣本平均數
×100%將標準差占平均數的比例換算成百分比

分布形狀:偏度與峰度#

偏度(skewness)描述分布的不對稱程度。判讀正負時要看長尾的方向:長尾朝左是負偏態,長尾朝右是正偏態;對稱分布的偏度接近 0。

負偏態與正偏態分布比較:負偏態的長尾朝左,正偏態的長尾朝右
偏度的正負由分布長尾的方向判斷,而不是看最高點偏向哪一側。來源:依原始筆記圖重製
γ1=E ⁣[(Xμσ)3]=μ3σ3=κ3κ23/2\gamma_1=\operatorname{E}\!\left[\left(\frac{X-\mu}{\sigma}\right)^3\right]=\frac{\mu_3}{\sigma^3}=\frac{\kappa_3}{\kappa_2^{3/2}}

這個公式先把資料相對於平均數的距離標準化,再取三次方。三次方會保留正負方向,因此右側與左側的長尾不會互相抵銷,最後可用正負號表示偏斜方向。

偏度公式的符號代表意義
γ₁母體偏度
X隨機變數
E[·]期望值,可直覺理解為長期平均
μ、σ母體平均數與母體標準差
μ₃三階中央動差,即 E[(X−μ)³]
κ₂、κ₃第二與第三累積量;κ₂ 等於變異數,κ₃ 等於三階中央動差

峰度(kurtosis)常被直覺描述成曲線尖不尖,但更精確地說,它反映分布尾端的厚重程度與出現極端值的傾向。不同分布可能具有相近的峰高,卻有不同的峰度,因此不能只看中央最高點。

β2=E ⁣[(Xμσ)4],γ2=β23\beta_2=\operatorname{E}\!\left[\left(\frac{X-\mu}{\sigma}\right)^4\right],\qquad \gamma_2=\beta_2-3

峰度使用四次方,因此離平均數很遠的觀察值會被大幅放大,用來反映分布尾端與極端值的影響。減去 3 是為了讓常態分布的超額峰度以 0 作為比較基準。

峰度公式的符號代表意義
β₂峰度;常態分布的 β₂ 為 3
γ₂超額峰度,等於 β₂−3;常態分布以 0 為基準
X隨機變數
E[·]期望值
μ、σ母體平均數與母體標準差

常態分布的峰度 β₂ 為 3;若使用超額峰度 γ₂,常態分布則以 0 為基準。因此閱讀軟體輸出時,要先確認它報告的是峰度還是超額峰度。

如何完整報告敘述統計?#

  1. 先辨認資料型態與測量尺度。
  2. 類別資料報告次數與百分比。
  3. 數值資料同時報告中心位置與變異程度。
  4. 查看分布圖與離群值,再決定使用平均數與標準差,或中位數與四分位距。
  5. 必要時補充偏度、峰度與適合的圖形,但不要只靠單一統計量判斷分布。