CHAPTER 01 · TOPIC 03
敘述統計
敘述統計(descriptive statistics)是用來整理、摘要與呈現資料的方法。它不只是在論文的 Table 1 列出數字,而是幫助我們先看懂樣本:資料有哪些類型、中心落在哪裡、彼此差異有多大,以及分布是否對稱或出現離群值。
敘述統計(descriptive statistics)是用來整理、摘要與呈現資料的方法。它不只是在論文的 Table 1 列出數字,而是幫助我們先看懂樣本:資料有哪些類型、中心落在哪裡、彼此差異有多大,以及分布是否對稱或出現離群值。
先看資料的型態#
不同型態的資料需要不同的摘要方式。類別資料通常報告次數與百分比;數值資料則需要同時描述中心位置、變異程度與分布形狀。樣本數通常以 n 表示。
| 資料型態 | 常用摘要 | 常見呈現 |
| 類別資料 | 次數、百分比 | 次數分配表、長條圖 |
| 數值資料 | 平均數與標準差,或中位數與四分位距 | 直方圖、盒鬚圖、密度圖 |
補充應用:ABC 分析法
ABC 分析法也稱為帕累托分析,是把大量分析對象按照某項指標的貢獻度分級,找出少數影響最大的對象,讓時間、成本與管理資源可以優先投入重點項目。它常用於商品銷售、客戶貢獻、成本、問題原因與庫存管理等分析。
- 決定要分析的對象與指標,例如商品銷售額、客戶營收或問題發生次數。
- 彙整每個對象的數值,並由高到低排列成長條圖。
- 計算各項占總數的比例,再依序加總為累積百分比。
- 按照累積百分比切分 A、B、C 類,並為不同類別安排不同的管理方式。

| 分類 | 代表意義 | 處理方式 |
| A 類 | 數量較少,但對結果的貢獻最大 | 優先分析並集中資源處理 |
| B 類 | 貢獻程度居中 | 定期追蹤並採一般管理 |
| C 類 | 數量可能很多,但單項貢獻較小 | 簡化管理,避免投入過多成本 |
A、B、C 的分界不是固定規定。圖中的 70% 與 90% 是常見示意,實際上應依分析目的、資料特性與管理成本調整。
集中趨勢:資料的中心在哪裡?#
集中趨勢(central tendency)是用一個具有代表性的數值描述資料的中心位置。常見指標包括眾數、中位數與平均數;它們回答的問題不同,不能只依習慣選擇。
眾數#
眾數(mode)是資料中出現次數最多的值。它可用於類別資料與數值資料,而且一組資料可能沒有眾數,也可能有一個以上的眾數。
中位數#
中位數(median)是將資料由小到大排列後,位於中間位置的數值。若資料數量為奇數,取正中央的觀察值;若為偶數,通常取中間兩個觀察值的平均。
| 中位數公式的符號 | 代表意義 |
| n | 資料的總筆數 |
| x₍ₖ₎ | 資料由小到大排列後,第 k 個位置的觀察值 |
| Median | 中位數;偶數筆資料時為中央兩個觀察值的平均 |
中位數較不容易受到極端值影響,因此當分布明顯偏斜或存在離群值時,通常比平均數更能代表典型位置。不過,中位數沒有充分利用每個觀察值的實際大小,在某些統計推論中也不如平均數方便。
算術平均數#
算術平均數(arithmetic mean)是所有觀察值總和除以資料筆數。它會使用每一筆資料,因此能反映整體數值,但也容易受到極端值影響。
| 平均數公式的符號 | 代表意義 |
| x̄ | 樣本的算術平均數 |
| xᵢ | 第 i 筆觀察值 |
| n | 資料的總筆數 |
| Σ | 求和符號;把第 1 筆到第 n 筆觀察值全部加總 |
| i | 觀察值的編號,由 1 依序到 n |
修剪平均數與幾何平均數#
修剪平均數(trimmed mean)會先依大小排序,再從兩端各移除固定比例的觀察值後計算平均。它不是先判定哪些值是錯誤的離群值再刪除,而是在平均數與中位數之間取得對極端值較穩健的摘要。
幾何平均數(geometric mean)適合描述正值資料的乘法變化,例如成長倍數、比率或對數常態資料。對於明顯右偏且數值皆為正的資料,常會先取自然對數(ln);取 ln 後,較大的數值會被壓縮,資料可能變得較為對稱,並可能更接近常態分布,方便進行後續分析。若資料包含零或負值,便不能直接使用一般的對數轉換與幾何平均數。
| 幾何平均數公式的符號 | 代表意義 |
| G | 幾何平均數 |
| xᵢ | 第 i 筆觀察值,且每一筆都必須大於 0 |
| n | 資料的總筆數 |
| Π | 連乘符號;把第 1 筆到第 n 筆觀察值全部相乘 |
| Σ | 求和符號;此處是把每筆資料取 ln 後全部相加 |
| ln | 自然對數 |
| exp | ln 的反函數,用來把結果轉回原始尺度 |
變異程度:資料彼此差多少?#
只知道中心位置仍不足以描述資料。即使兩組資料的平均數相同,分散程度也可能完全不同,因此需要全距、四分位距、變異數或標準差等指標。
全距與四分位距#
| 全距與四分位距的符號 | 代表意義 |
| xₘₐₓ | 資料中的最大值 |
| xₘᵢₙ | 資料中的最小值 |
| Q₁ | 第一四分位數;約有 25% 的資料不大於它 |
| Q₃ | 第三四分位數;約有 75% 的資料不大於它 |
| IQR | 四分位距,表示中間 50% 資料涵蓋的範圍 |
全距只使用最大值與最小值,因此容易受到極端值影響。四分位距(interquartile range, IQR)描述中間 50% 資料的範圍,對極端值較穩健,特別適合與中位數一起報告。
變異數與標準差#
變異數以每個觀察值和平均數之間的平方距離衡量分散程度;標準差是變異數的平方根,因此與原始資料具有相同單位,通常更容易解讀。
這兩組公式先計算每筆資料離平均數有多遠,再將距離平方後加總。結果愈大,表示資料愈分散;最後開平方得到標準差,使單位回到與原始資料相同。
| 變異數與標準差的符號 | 代表意義 |
| N、n | 母體大小與樣本筆數 |
| xᵢ | 第 i 筆觀察值 |
| μ、x̄ | 母體平均數與樣本平均數 |
| σ²、s² | 母體變異數與樣本變異數 |
| σ、s | 母體標準差與樣本標準差 |
| Σ | 將每筆資料與平均數之間的平方距離全部加總 |
| n−1 | 樣本變異數使用的自由度 |
變異係數#
變異係數(coefficient of variation, CV)以標準差相對於平均數的大小描述相對變異,常以百分比表示。它適合比較單位或平均水準不同、且具有有意義絕對零點的正值資料;當平均數接近零或資料可為負值時,CV 容易失去解釋性。
| 變異係數公式的符號 | 代表意義 |
| CV | 變異係數,通常以百分比表示 |
| s | 樣本標準差 |
| x̄ | 樣本平均數 |
| ×100% | 將標準差占平均數的比例換算成百分比 |
分布形狀:偏度與峰度#
偏度(skewness)描述分布的不對稱程度。判讀正負時要看長尾的方向:長尾朝左是負偏態,長尾朝右是正偏態;對稱分布的偏度接近 0。

這個公式先把資料相對於平均數的距離標準化,再取三次方。三次方會保留正負方向,因此右側與左側的長尾不會互相抵銷,最後可用正負號表示偏斜方向。
| 偏度公式的符號 | 代表意義 |
| γ₁ | 母體偏度 |
| X | 隨機變數 |
| E[·] | 期望值,可直覺理解為長期平均 |
| μ、σ | 母體平均數與母體標準差 |
| μ₃ | 三階中央動差,即 E[(X−μ)³] |
| κ₂、κ₃ | 第二與第三累積量;κ₂ 等於變異數,κ₃ 等於三階中央動差 |
峰度(kurtosis)常被直覺描述成曲線尖不尖,但更精確地說,它反映分布尾端的厚重程度與出現極端值的傾向。不同分布可能具有相近的峰高,卻有不同的峰度,因此不能只看中央最高點。
峰度使用四次方,因此離平均數很遠的觀察值會被大幅放大,用來反映分布尾端與極端值的影響。減去 3 是為了讓常態分布的超額峰度以 0 作為比較基準。
| 峰度公式的符號 | 代表意義 |
| β₂ | 峰度;常態分布的 β₂ 為 3 |
| γ₂ | 超額峰度,等於 β₂−3;常態分布以 0 為基準 |
| X | 隨機變數 |
| E[·] | 期望值 |
| μ、σ | 母體平均數與母體標準差 |
常態分布的峰度 β₂ 為 3;若使用超額峰度 γ₂,常態分布則以 0 為基準。因此閱讀軟體輸出時,要先確認它報告的是峰度還是超額峰度。
如何完整報告敘述統計?#
- 先辨認資料型態與測量尺度。
- 類別資料報告次數與百分比。
- 數值資料同時報告中心位置與變異程度。
- 查看分布圖與離群值,再決定使用平均數與標準差,或中位數與四分位距。
- 必要時補充偏度、峰度與適合的圖形,但不要只靠單一統計量判斷分布。