生物統計学 学習ノート概念・導出から実践的な解釈まで

CHAPTER 02 · TOPIC 07

指数分布

一定発生率の下での待ち時間、無記憶性、生存関数、ポアソン過程との関係を学びます。

このページの内容
  1. どのような場合に使うか?
  2. 指数分布の定義
  3. λは曲線をどう変えるか?
  4. 密度から確率を求める
  5. 平均待ち時間と変動
  6. 無記憶性
  7. ポアソン過程との関係
  8. 生存時間解析との関係

指数分布(exponential distribution)は連続型確率分布で、事象が一定の平均発生率で互いに独立して起こるとき、次の事象までの待ち時間を記述します。

どのような場合に使うか?#

次の電話や顧客の到着までの時間、一定の故障率を仮定した装置の故障時間などに使います。データが待ち時間であるだけでなく、平均発生率がおおむね一定で、異なる時間区間の事象を独立とみなせるかも確認します。

指数分布の定義#

確率変数Xを次の事象までの待ち時間、平均発生率をλとすると、Xは母数λの指数分布に従います。

分布の表記XExp(λ),λ>0X\sim\operatorname{Exp}(\lambda),\qquad \lambda>0
確率密度関数f(x)={λeλx,x0,0,x<0.f(x)=\begin{cases}\lambda e^{-\lambda x},&x\ge 0,\\0,&x<0.\end{cases}
記号意味
X次の事象までの待ち時間
xXの可能値
λ単位時間あたりの平均発生率
f(x)x付近の待ち時間の確率密度
e自然対数の底

λは曲線をどう変えるか?#

密度はx=0でf(0)=λとなり、その後は待ち時間とともに低下します。λが大きいほど事象が頻繁に起こり、曲線は高い位置から急速に低下して、典型的な待ち時間も短くなります。

發生率 λ 分別為 0.5、1.0 與 1.5 的指數分配密度曲線;λ 越大,曲線起點越高且下降越快
λ 越大,事件平均發生得越頻繁,等待時間越集中在靠近 0 的位置;三條曲線下的總面積都等於 1。出典:本站依指數分配密度函數製作

密度から確率を求める#

連続型分布なので一点の確率は0です。一定時間内に起こる確率や、その時間を超えても起こらない確率は曲線下の面積で計算します。

累積分布関数F(x)=P(Xx)=1eλx,x0F(x)=P(X\le x)=1-e^{-\lambda x},\qquad x\ge0
生存関数S(x)=P(X>x)=eλx,x0S(x)=P(X>x)=e^{-\lambda x},\qquad x\ge0
区間に入る確率P(a<Xb)=F(b)F(a)=eλaeλbP(a<X\le b)=F(b)-F(a)=e^{-\lambda a}-e^{-\lambda b}
記号意味
f(x)位置xでの確率密度
F(x)待ち時間がx以下となる累積確率
S(x)xを超えても事象が起こらない確率
a、b0≤a<bである区間の端点

平均待ち時間と変動#

発生率と平均待ち時間は互いに逆数です。λが大きいほど待ち時間の平均と変動は小さくなります。

期待値E(X)=1λE(X)=\frac{1}{\lambda}
分散と標準偏差Var(X)=1λ2,SD(X)=1λ\operatorname{Var}(X)=\frac{1}{\lambda^2},\qquad \operatorname{SD}(X)=\frac{1}{\lambda}

無記憶性#

指数分布には無記憶性があります。すでにs時間待っても事象が起きていないという条件下で、さらにt時間を超えて待つ確率は、最初からt時間を超えて待つ確率と同じです。

P(X>s+tX>s)=P(X>t)=eλtP(X>s+t\mid X>s)=P(X>t)=e^{-\lambda t}
補足:短い時間区間から指数分布を導く

長さxの時間をn個の短い区間Δt=x/nへ分けます。一定の発生率λなら、各区間で事象が起こらない確率は約1−λx/nです。

各区間で事象なしP(no event in Δt)1λxnP(\text{no event in }\Delta t)\approx 1-\lambda\frac{x}{n}
n区間すべてで事象なしP(X>x)(1λxn)nP(X>x)\approx\left(1-\lambda\frac{x}{n}\right)^n
区間を限りなく細かくするS(x)=P(X>x)=limn(1λxn)n=eλxS(x)=P(X>x)=\lim_{n\to\infty}\left(1-\lambda\frac{x}{n}\right)^n=e^{-\lambda x}

この極限はまず生存関数を与えます。1から引けば累積分布関数、xで微分すれば確率密度関数が得られます。

生存関数から累積確率へF(x)=1S(x)=1eλxF(x)=1-S(x)=1-e^{-\lambda x}
累積確率から密度へf(x)=F(x)=S(x)=λeλxf(x)=F'(x)=-S'(x)=\lambda e^{-\lambda x}
補足:平均待ち時間が1/λとなる理由

非負確率変数の期待値は生存関数下の面積で表せます。S(x)=e^(−λx)を積分すると1/λになります。

E(X)=0S(x)dx=0eλxdx=1λE(X)=\int_0^{\infty}S(x)\,dx=\int_0^{\infty}e^{-\lambda x}\,dx=\frac{1}{\lambda}

ポアソン過程との関係#

時間t内の発生回数N(t)が平均λtのポアソン分布に従うなら、最初の事象までの時間Xは母数λの指数分布に従います。tを超えて待つことは、時間t内に事象が一度も起こらないことと同じです。

発生回数N(t)Poisson(λt)N(t)\sim\operatorname{Poisson}(\lambda t)
待ち時間P(X>t)=P(N(t)=0)=eλtP(X>t)=P(N(t)=0)=e^{-\lambda t}

生存時間解析との関係#

生存時間解析では、指数分布はハザード率を一定のλとしたモデルです。ハザード率は時点xまで生存したという条件下で、直後の短い時間に事象が起こる瞬間的な率を表します。

h(x)=f(x)S(x)=λh(x)=\frac{f(x)}{S(x)}=\lambda