生物統計學習筆記從概念、推導到實務判讀

CHAPTER 02 · TOPIC 07

指數分配

指數分配(exponential distribution)是一種連續型機率分配,常用來描述:事件以固定的平均發生率、彼此獨立地出現時,從現在開始直到下一次事件發生需要等待多久。

本頁內容
  1. 什麼情況適合使用?
  2. 指數分配的定義
  3. λ 如何改變曲線?
  4. 從密度換成機率
  5. 平均等待時間與變異
  6. 無記憶性
  7. 與卜瓦松過程的關係
  8. 與存活分析的關係

指數分配(exponential distribution)是一種連續型機率分配,常用來描述:事件以固定的平均發生率、彼此獨立地出現時,從現在開始直到下一次事件發生需要等待多久。

什麼情況適合使用?#

例如等待下一通電話、下一位顧客抵達,或設備在固定失效率假設下的失效時間。使用指數分配時,除了資料必須代表等待時間,也要考慮事件的平均發生率是否大致固定,以及不同時間區段內的事件是否可視為獨立。

指數分配的定義#

令隨機變數 X 表示等待下一次事件的時間,若事件的平均發生率為 λ,則可記為 X 服從參數 λ 的指數分配。

分配記法XExp(λ),λ>0X\sim\operatorname{Exp}(\lambda),\qquad \lambda>0
機率密度函數f(x)={λeλx,x0,0,x<0.f(x)=\begin{cases}\lambda e^{-\lambda x},&x\ge 0,\\0,&x<0.\end{cases}
符號代表意義
X等待下一次事件發生的時間
xX 的某個可能取值
λ單位時間內事件的平均發生率,且 λ>0
f(x)等待時間在 x 附近的機率密度
e自然對數的底數

λ 如何改變曲線?#

密度在 x=0 時為 f(0)=λ,之後隨等待時間增加而下降。λ 越大,代表事件發生得越頻繁,曲線起點越高、下降越快,典型等待時間也越短;λ 越小則相反。

發生率 λ 分別為 0.5、1.0 與 1.5 的指數分配密度曲線;λ 越大,曲線起點越高且下降越快
λ 越大,事件平均發生得越頻繁,等待時間越集中在靠近 0 的位置;三條曲線下的總面積都等於 1。來源:本站依指數分配密度函數製作

從密度換成機率#

指數分配是連續型分配,所以單一時間點的機率為 0。要計算「在某段時間內發生」或「超過某段時間仍未發生」,必須使用曲線下的面積。

累積分布函數F(x)=P(Xx)=1eλx,x0F(x)=P(X\le x)=1-e^{-\lambda x},\qquad x\ge0
存活函數S(x)=P(X>x)=eλx,x0S(x)=P(X>x)=e^{-\lambda x},\qquad x\ge0
落在一段區間內P(a<Xb)=F(b)F(a)=eλaeλbP(a<X\le b)=F(b)-F(a)=e^{-\lambda a}-e^{-\lambda b}
符號代表意義
f(x)x 位置的機率密度,不是單一點的機率
F(x)等待時間不超過 x 的累積機率
S(x)等待超過 x、事件仍未發生的機率
a、b所關心區間的起點與終點,0≤a<b

平均等待時間與變異#

發生率與平均等待時間互為倒數。λ 越大,等待時間的平均值與變異程度都越小。

期望值E(X)=1λE(X)=\frac{1}{\lambda}
變異數與標準差Var(X)=1λ2,SD(X)=1λ\operatorname{Var}(X)=\frac{1}{\lambda^2},\qquad \operatorname{SD}(X)=\frac{1}{\lambda}

無記憶性#

指數分配具有無記憶性(memoryless property):在已經等待 s 時間而事件仍未發生的條件下,還要再等待超過 t 的機率,與一開始就等待超過 t 的機率相同。

P(X>s+tX>s)=P(X>t)=eλtP(X>s+t\mid X>s)=P(X>t)=e^{-\lambda t}
符號在這組公式中的意義
exp、e指數函數;是自然對數 ln 的反函數
補充:從小時間區間推導指數分配

把長度為 x 的等待時間切成 n 個很短的區間,每段長度為 Δt=x/n。若事件以固定發生率 λ 出現,則在一小段內發生事件的機率約為 λx/n,沒有事件的機率約為 1-λx/n。

每一小段沒有事件P(no event in Δt)1λxnP(\text{no event in }\Delta t)\approx 1-\lambda\frac{x}{n}
前 n 段都沒有事件P(X>x)(1λxn)nP(X>x)\approx\left(1-\lambda\frac{x}{n}\right)^n
令區間越切越細S(x)=P(X>x)=limn(1λxn)n=eλxS(x)=P(X>x)=\lim_{n\to\infty}\left(1-\lambda\frac{x}{n}\right)^n=e^{-\lambda x}

這個極限首先得到的是存活函數:到時間 x 為止仍沒有事件發生的機率。用 1 減去它可得到累積分布函數,再對 x 微分便得到機率密度函數。

由存活函數得到累積機率F(x)=1S(x)=1eλxF(x)=1-S(x)=1-e^{-\lambda x}
由累積機率得到密度f(x)=F(x)=S(x)=λeλxf(x)=F'(x)=-S'(x)=\lambda e^{-\lambda x}
補充:為什麼平均等待時間是 1/λ?

對非負隨機變數而言,期望值可以寫成存活函數下的面積。將 S(x)=e^{-λx} 代入積分,就得到 1/λ。

E(X)=0S(x)dx=0eλxdx=1λE(X)=\int_0^{\infty}S(x)\,dx=\int_0^{\infty}e^{-\lambda x}\,dx=\frac{1}{\lambda}

與卜瓦松過程的關係#

若 N(t) 表示時間 t 內的事件次數,且 N(t) 服從平均數為 λt 的卜瓦松分配,那麼等待第一次事件的時間 X 便服從參數 λ 的指數分配。等待超過 t,等價於時間 t 內一次事件都沒有發生。

事件次數N(t)Poisson(λt)N(t)\sim\operatorname{Poisson}(\lambda t)
等待時間P(X>t)=P(N(t)=0)=eλtP(X>t)=P(N(t)=0)=e^{-\lambda t}

與存活分析的關係#

在存活分析中,指數分配相當於危險率固定為 λ 的模型。危險率表示已存活到時間 x 的條件下,接下來一小段時間內發生事件的瞬時速率。

h(x)=f(x)S(x)=λh(x)=\frac{f(x)}{S(x)}=\lambda