生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02 · TOPIC 09

卜瓦松分配

卜瓦松分配(Poisson distribution)是一種離散型機率分配,用來描述固定時間、面積、體積或其他區間內,某事件發生次數 X 的機率。

本頁內容
  1. 什麼情況適合使用?
  2. 參數 λ 代表什麼?
  3. 機率質量函數
  4. λ 如何改變分布形狀?
  5. 平均數與變異數相同
  6. 常用機率
  7. 由二項分配近似
  8. 與指數分配的關係
  9. 獨立 Poisson 次數可以相加

卜瓦松分配(Poisson distribution)是一種離散型機率分配,用來描述固定時間、面積、體積或其他區間內,某事件發生次數 X 的機率。

什麼情況適合使用?#

  1. X 計算固定區間內的事件發生次數
  2. 事件以大致固定的平均發生率出現
  3. 互不重疊區間內的事件次數可視為彼此獨立
  4. 在非常短的區間內,發生兩次以上事件的機率可以忽略

參數 λ 代表什麼?#

λ 表示所選觀察區間內的預期事件次數。若每單位時間的平均發生率為 r,觀察長度為 t,則該區間的參數為 λ=rt。因此改變觀察區間長度時,λ 也會跟著改變。

分配記法XPoisson(λ),λ>0X\sim\operatorname{Poisson}(\lambda),\qquad \lambda>0
發生率與區間參數λ=rt\lambda=rt
可能取值x=0,1,2,x=0,1,2,\ldots
符號代表意義
X所選區間內的事件發生次數
xX 的某個可能取值
λ所選區間內的預期事件次數
r每單位區間的平均發生率
t觀察區間的長度

機率質量函數#

因為 X 只能取非負整數,Poisson 分配使用的是機率質量函數,而不是連續型分配的機率密度函數。下式計算區間內剛好發生 x 次事件的機率。

P(X=x)=eλλxx!,x=0,1,2,P(X=x)=\frac{e^{-\lambda}\lambda^x}{x!},\qquad x=0,1,2,\ldots
公式部分代表意義
P(X=x)固定區間內剛好發生 x 次的機率
e^(−λ)整個區間一次事件都沒有發生的機率
λ^x與 x 次事件及平均發生次數相關的部分
x!修正 x 次事件排列次序的階乘項

λ 如何改變分布形狀?#

λ 很小時,機率主要集中在 0 與少數幾次,分布明顯右偏;λ 增加後,分布中心向右移、範圍變寬,相對偏斜程度逐漸下降。圖中的點才是 X 真正可以取得的整數位置,連線只用來幫助辨認同一組分布。

參數 λ 分別為 0.5、2、5 與 10 的 Poisson 分配機率圖;λ 增加時分布中心向右移動並逐漸較為對稱
Poisson 分配只能取非負整數。λ 較小時明顯右偏;λ 增加後,中心向右移、範圍變寬,形狀也逐漸較為對稱。連線僅協助辨認同一組分布。來源:本站依 Poisson 機率質量函數製作

平均數與變異數相同#

Poisson 分配的一項重要特徵,是期望值與變異數都等於 λ。因此 λ 越大,不只平均事件數增加,事件次數的絕對波動也會增加;標準差則為 √λ。

期望值E(X)=λE(X)=\lambda
變異數Var(X)=λ\operatorname{Var}(X)=\lambda
標準差SD(X)=λ\operatorname{SD}(X)=\sqrt{\lambda}

常用機率#

沒有事件發生的機率特別重要;利用反事件,可以立刻得到至少發生一次的機率。

一次都沒有P(X=0)=eλP(X=0)=e^{-\lambda}
至少一次P(X1)=1P(X=0)=1eλP(X\ge1)=1-P(X=0)=1-e^{-\lambda}
至多 k 次P(Xk)=x=0keλλxx!P(X\le k)=\sum_{x=0}^{k}\frac{e^{-\lambda}\lambda^x}{x!}
補充:由二項分配完整推導 Poisson 公式

第一步:把觀察區間切成很多小段

假設整個觀察區間平均發生 λ 次事件。將區間切成 n 個很短的小段;當 n 很大時,每小段發生一次事件的機率可近似為 λ/n,而發生兩次以上的機率可以忽略。於是小段是否發生事件可暫時看成二項試驗。

小段的事件機率pn=λnp_n=\frac{\lambda}{n}
有限 n 時的二項模型XnBinomial ⁣(n,λn)X_n\sim\operatorname{Binomial}\!\left(n,\frac{\lambda}{n}\right)
剛好發生 x 次P(Xn=x)=(nx)(λn)x(1λn)nxP(X_n=x)=\binom{n}{x}\left(\frac{\lambda}{n}\right)^x\left(1-\frac{\lambda}{n}\right)^{n-x}

第二步:把式子拆成三個可以分別取極限的部分

先展開組合數,再把 λ^x/x!、與 n 有關的排列比值,以及沒有事件的小段機率分開。原文中的三個極限就是在這一步出現。

P(Xn=x)=n!nx(nx)!Anλxx!(1λn)nBn(1λn)xCnP(X_n=x)=\underbrace{\frac{n!}{n^x(n-x)!}}_{A_n}\frac{\lambda^x}{x!}\underbrace{\left(1-\frac{\lambda}{n}\right)^n}_{B_n}\underbrace{\left(1-\frac{\lambda}{n}\right)^{-x}}_{C_n}

第三步:分別計算三個極限

取極限時 x 保持固定,而 n 越來越大。第一項可以寫成有限個接近 1 的因子乘積;第二項使用指數函數的經典極限;第三項的底數趨近 1、次方固定,所以也趨近 1。

排列比值An=n(n1)(nx+1)nx=j=0x1(1jn)1A_n=\frac{n(n-1)\cdots(n-x+1)}{n^x}=\prod_{j=0}^{x-1}\left(1-\frac{j}{n}\right)\longrightarrow1
指數極限Bn=(1λn)neλB_n=\left(1-\frac{\lambda}{n}\right)^n\longrightarrow e^{-\lambda}
固定次方Cn=(1λn)x1C_n=\left(1-\frac{\lambda}{n}\right)^{-x}\longrightarrow1

將三個極限代回,便得到 Poisson 機率質量函數。

limnP(Xn=x)=1λxx!eλ1=eλλxx!\lim_{n\to\infty}P(X_n=x)=1\cdot\frac{\lambda^x}{x!}\cdot e^{-\lambda}\cdot1=\frac{e^{-\lambda}\lambda^x}{x!}
符號在推導中的意義
n切分的小區間數,最後令 n→∞
λ/n每一小區間內發生事件的近似機率
x整個區間內觀察到的事件數;取極限時保持固定
Aₙ從組合數與 n^x 形成的排列比值
Bₙ所有小段大致沒有事件所形成的指數極限
Cₙ拆開 n−x 次方後留下的固定次方修正

由二項分配近似#

上述推導也解釋了實務上的近似:當二項分配的 n 很大、p 很小,而且 λ=np 維持適中的大小時,可以用 Poisson(λ) 近似成功次數。這適合大量機會中少數事件發生的情況。

XBinomial(n,p),n large, p small, λ=npXPoisson(λ)X\sim\operatorname{Binomial}(n,p),\quad n\text{ large},\ p\text{ small},\ \lambda=np\quad\Longrightarrow\quad X\approx\operatorname{Poisson}(\lambda)
符號在這組公式中的意義
~服從某個機率分配
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準

與指數分配的關係#

在發生率為 r 的 Poisson 過程中,N(t) 計算長度 t 內的事件次數,因此 N(t)~Poisson(rt);等待下一次事件的時間 T 則服從 Exp(r)。一個數事件次數,另一個量事件間隔。

固定時間內的事件次數N(t)Poisson(rt)N(t)\sim\operatorname{Poisson}(rt)
下一次事件的等待時間TExp(r)T\sim\operatorname{Exp}(r)
等待超過 t 等於期間內沒有事件P(T>t)=P(N(t)=0)=ertP(T>t)=P(N(t)=0)=e^{-rt}

獨立 Poisson 次數可以相加#

若不同來源的事件次數彼此獨立,總事件數仍服從 Poisson 分配,參數等於各來源參數相加。這讓不同時間區段、地區或事件來源的計數可以自然合併。

XiPoisson(λi) independentlyi=1mXiPoisson ⁣(i=1mλi)X_i\sim\operatorname{Poisson}(\lambda_i)\text{ independently}\quad\Longrightarrow\quad\sum_{i=1}^{m}X_i\sim\operatorname{Poisson}\!\left(\sum_{i=1}^{m}\lambda_i\right)
符號在這組公式中的意義
Σ求和符號;將指定範圍內的各項全部加總
~服從某個機率分配
Xᵢ第 i 個隨機變數或第 i 筆觀察值;依本段定義
n本段使用的觀察數、樣本數或試驗次數;以公式前的研究設定為準