프랑스 의
수학자 시메옹 드니 푸아송 (Siméon Denis Poisson)이 1837년에 자신의 저서 『민사 사건과 형사 사건 재판에서의 확률에 관한 연구 및 일반적인 확률 계산 법칙에 관한 서문』(Researches sur la probabilité des judgements en maitière criminelle et en matière civile)에서 처음 소개한
확률 분포 . 그의 이름을 따서
푸아송 분포 (Poisson distribution)라고 한다. 표기에 따라서는
포아송 분포 라고도 한다.
단위시간 동안 혹은 단위공간에서 어떤 사건이 발생하는 횟수를 나타내는 확률분포이며,
n n n 이 충분히 크고
p p p 가 충분히 작아서
n p np n p 의 값이 적당할 때의
이항 분포 의 값을 근사적으로 구할 수 있다. 이항 분포에서
n p = λ np=\lambda n p = λ 를 유지하면서
n → ∞ n\to\infty n → ∞ 일 때, 그 분포는 포아송 분포에 수렴한다. 이에 따라
n n n 과
p p p 의 각각의 값은 모르지만
n p = λ np=\lambda n p = λ 의 값은 알 때 푸아송 분포를 사용하여 이항 분포의 근사치를 알 수 있다.
후술되어 있듯
λ \lambda λ 는 곧 푸아송 분포의 평균과 분산이 되며, '람다'로 읽는
그리스 문자 이다.
푸아송 분포로 유의미한 근삿값을 얻으려면 다음 세 가지 조건을 만족시켜야 한다.
주어진 시간 동안 일어나는 사건의 횟수는 다른 시간에서 일어나는 사건의 횟수와 독립이어야 한다.
주어진 시간을 더 짧은 단위로 나눴을 때, 그 짧은 시간 내에서 사건이 두 번 이상 발생할 확률은 무시할 만큼 매우 작아야 한다.
주어진 시간을 더 짧은 단위로 나눴을 때, 시간의 길이와 사건이 한 번 발생할 확률은 비례한다.
간단히 말하자면,
n ≥ 20 n\geq 20 n ≥ 20 이고
p ≤ 0.05 p\leq 0.05 p ≤ 0.05 이면 어느 정도 충분하고,
n ≥ 100 n\geq 100 n ≥ 100 이고
n p ≤ 10 np\leq 10 n p ≤ 10 이면 매우 훌륭하다.
이항 분포에서
n → ∞ n\to\infty n → ∞ ,
p → 0 p\to 0 p → 0 ,
n p → λ np\to\lambda n p → λ 이면
b ( x ; n , p ) = ( n x ) p x ( 1 − p ) n − x = n ( n − 1 ) ⋯ ( n − x + 1 ) x ! ( λ n ) x ( 1 − λ n ) n − x = 1 x ! ⋅ n ( n − 1 ) ⋯ ( n − x + 1 ) n x λ x { ( 1 − λ n ) − n λ } − λ ( 1 − λ n ) − x \begin{aligned}b(x;n,p)&=\binom{n}{x}p^x(1-p)^{n-x}\\&=\dfrac{n(n-1)\cdots(n-x+1)}{x!}\left(\dfrac{\lambda}n\right)^x\!\!\left(1-\dfrac{\lambda}n\right)^{n-x}\\&=\dfrac1{x!}\cdot\dfrac{n(n-1)\cdots(n-x+1)}{n^x}\lambda^x\left\{\left(1-\dfrac\lambda{n}\right)^{-\dfrac{n}\lambda}\right\}^{-\lambda}\!\!\!\!\left(1-\dfrac\lambda{n}\right)^{-x}\end{aligned} b ( x ; n , p ) = ( x n ) p x ( 1 − p ) n − x = x ! n ( n − 1 ) ⋯ ( n − x + 1 ) ( n λ ) x ( 1 − n λ ) n − x = x ! 1 ⋅ n x n ( n − 1 ) ⋯ ( n − x + 1 ) λ x ⎩ ⎨ ⎧ ( 1 − n λ ) − λ n ⎭ ⎬ ⎫ − λ ( 1 − n λ ) − x
n ( n − 1 ) ⋯ ( n − x + 1 ) n(n-1)\cdots(n-x+1) n ( n − 1 ) ⋯ ( n − x + 1 ) 에서 곱해진 항의 개수는
x x x 개이므로
lim n → ∞ n ( n − 1 ) ⋯ ( n − x + 1 ) n x = 1 \displaystyle\lim_{n\to\infty}\dfrac{n(n-1)\cdots(n-x+1)}{n^x}=1 n → ∞ lim n x n ( n − 1 ) ⋯ ( n − x + 1 ) = 1 − n λ = t -\dfrac{n}\lambda=t − λ n = t 로 치환하면
lim n → ∞ t = − ∞ \displaystyle\lim_{n\to\infty}t=-\infty n → ∞ lim t = − ∞ 이므로
lim n → ∞ ( 1 − λ n ) − n λ = lim t → − ∞ ( 1 + 1 t ) t = \displaystyle\lim_{n\to\infty}\left(1-\dfrac\lambda{n}\right)^{-\dfrac{n}{\lambda}}=\lim_{t\to-\infty}\left(1+\dfrac1t\right)^t= n → ∞ lim ( 1 − n λ ) − λ n = t → − ∞ lim ( 1 + t 1 ) t = [math(e) ]lim n → ∞ ( 1 − λ n ) − x = 1 \displaystyle\lim_{n\to\infty}\left(1-\dfrac\lambda{n}\right)^{-x}=1 n → ∞ lim ( 1 − n λ ) − x = 1
따라서
n → ∞ n\to\infty n → ∞ ,
p → 0 p\to 0 p → 0 ,
n p → λ np\to\lambda n p → λ 이면 다음이 성립한다. 이를
푸아송 극한 정리 라고 한다.
b ( x ; n , p ) ≈ λ x e − λ x ! b(x;n,p)\approx\dfrac{\lambda^x e^{-\lambda}}{x!} b ( x ; n , p ) ≈ x ! λ x e − λ 이렇게 유도되는 푸아송 분포를 Poisson의 머리글자를 따서 다음과 같이 표기한다.
p ( x : λ ) = λ x e − λ x ! p(x:\lambda)=\dfrac{\lambda^x e^{-\lambda}}{x!} p ( x : λ ) = x ! λ x e − λ 이
λ \lambda λ 를
모수 라고 하며, 확률변수
X X X 가 모수
λ \lambda λ 인 푸아송 분포를 따르면
X ∼ P o i ( λ ) X\sim{\rm Poi}(\lambda) X ∼ Poi ( λ ) 로 나타내고
X X X 를 모수가
λ \lambda λ 인
푸아송 변수 라고 한다.
p ( x : λ ) = λ x e − λ x ! p(x:\lambda)=\dfrac{\lambda^x e^{-\lambda}}{x!} p ( x : λ ) = x ! λ x e − λ 이렇게 유도된 푸아송 분포의 확률변수
X X X 는 단위시간 혹은 단위공간 내의 발생 횟수이며, 이를
x x x 에 대입한다. 그리고 해당 단위시간 혹은 단위공간 내에서 평균적으로 발생하는 사건의 횟수를
λ \lambda λ 에 대입하면 해당 확률을 구할 수 있다.
우선
p ( x : λ ) = λ x e − λ x ! p(x:\lambda)=\dfrac{\lambda^x e^{-\lambda}}{x!} p ( x : λ ) = x ! λ x e − λ 의 평균은 애초에 정한 바 그대로
n p = λ np=\lambda n p = λ 이다.
p ( x : λ ) = λ x e − λ x ! p(x:\lambda)=\dfrac{\lambda^x e^{-\lambda}}{x!} p ( x : λ ) = x ! λ x e − λ 의 분산은 다음과 같이 구한다. 본디 이항 분포의 분산은
n p ( 1 − p ) np(1-p) n p ( 1 − p ) 이므로
n p ( 1 − p ) = n p = λ ( ∵ p → 0 ) np(1-p)=np=\lambda\;(\because p\to 0) n p ( 1 − p ) = n p = λ ( ∵ p → 0 ) 따라서 푸아송 분포의 평균과 분산은
λ \lambda λ 로 같다.
M X ( t ) = E ( e t X ) = ∑ x = 0 ∞ e t x m x e − m x ! = ∑ x = 0 ∞ ( e t m ) x e − m x ! = ∑ x = 0 ∞ ( e t m ) x e − e t m e e t m e − m x ! = e e t m e − m ∑ x = 0 ∞ ( e t m ) x e − e t m x ! = e m ( e t − 1 ) \begin{aligned}M_X(t)&=E(e^{tX})\\&=\displaystyle\sum_{x=0}^\infty e^{tx}\dfrac{m^x e^{-m}}{x!}=\sum_{x=0}^\infty\dfrac{(e^tm)^x e^{-m}}{x!}\\&=\sum_{x=0}^\infty\dfrac{(e^tm)^x e^{-e^t m}e^{e^t m}e^{-m}}{x!}\\&=e^{e^t m}e^{-m}\sum_{x=0}^\infty\dfrac{(e^t m)^x e^{-e^t m}}{x!}\\&=e^{m(e^t-1)}\end{aligned} M X ( t ) = E ( e tX ) = x = 0 ∑ ∞ e t x x ! m x e − m = x = 0 ∑ ∞ x ! ( e t m ) x e − m = x = 0 ∑ ∞ x ! ( e t m ) x e − e t m e e t m e − m = e e t m e − m x = 0 ∑ ∞ x ! ( e t m ) x e − e t m = e m ( e t − 1 ) 따라서 푸아송 분포의 적률생성함수는
e m ( e t − 1 ) e^{m(e^t-1)} e m ( e t − 1 ) 이며, 이 함수를 통해 평균과 분산을 계산하면 다음과 같다.
M X ′ ( t ) = e m ( e t − 1 ) m e t M X ′ ′ ( t ) = e m ( e t − 1 ) m e t + e m ( e t − 1 ) ( m e t ) 2 \begin{aligned}M'_X(t)&=e^{m(e^t-1)}me^t\\M''_X(t)&=e^{m(e^t-1)}me^t+e^{m(e^t-1)}(me^t)^2\end{aligned} M X ′ ( t ) M X ′′ ( t ) = e m ( e t − 1 ) m e t = e m ( e t − 1 ) m e t + e m ( e t − 1 ) ( m e t ) 2 ∴ E ( X ) = M X ′ ( 0 ) = m E ( X 2 ) = M X ′ ′ ( 0 ) = m + m 2 V a r ( X ) = E ( X 2 ) − { E ( X ) } 2 = m \begin{aligned}\therefore E(X)&=M'_X(0)=m\\E(X^2)&=M''_X(0)=m+m^2\\{\rm Var}(X)&=E(X^2)-\{E(X)\}^2=m\end{aligned} ∴ E ( X ) E ( X 2 ) Var ( X ) = M X ′ ( 0 ) = m = M X ′′ ( 0 ) = m + m 2 = E ( X 2 ) − { E ( X ) } 2 = m