今回は大数の弱法則について一通り証明したのでまとめてみる。
定義
そもそも大数の法則ってなんだ?という話。
平均 \mu, 分散 \sigma^2 の同一分布に独立に従う X_i \ (1 \leqq i \leqq n) に対し、標本平均 \textstyle \frac{1}{n} \sum_{i=1}^n X_i = \overline{X}_n
を考える。すると、\overline{X}_n は \mu に確率収束する、すなわち
\lim_{n \to \infty} P(|\overline{X}_n - \mu| < \varepsilon) = 1
である。ただし、\varepsilon は任意の定数 (\varepsilon > 0) である。
端的に言えばめちゃくちゃサンプルを取れば標本平均が母平均になるよ、という話である。なお、確率収束といえど \mu は定数である(確率変数ではない)点に注意されたい。
証明
最もオーソドックスな証明手順として、マルコフの不等式→チェビシェフの不等式→大数の弱法則を試してみた。
マルコフの不等式
第一走者、マルコフの不等式は以下である。
確率変数 |X| 及び定数 a (0 < a) に対し、|X| \geqq a となる確率 P[|X| \geqq a] と、 |X| の期待値 E[|X|] の間に、以下の関係が成り立つ。
P[|X| \geqq a] \leqq \frac{E[|X|]}{a}
a がゼロから離れるほど、それより |X| が大きくなる確率はどんどん小さくなる、というわけだ。とはいえ、|X| が従う分布のイメージが湧かない。ということで、図形的理解を導入してみる。
図形的理解
先述の通り絶対値 |X| が分かりづらいので、 |X| = Y とおき、 Y が従う確率密度関数を考えよう。
まず X が従う確率密度関数を f(x) とおく。図示及び後述の証明の簡単のため、(-b \leqq x \leqq b, \ 0 < b) とするが、bが無限であったり、範囲が左右非対称でも議論は同じである。今回の f(x) のグラフは以下。

続いて、
g(x) = f(x) + f(-x) \quad (0 \leqq x \leqq b) \quad \cdots (1)
とする。どういうことかというと、負の部分(水色塗り)を

正に折り返す、ということである。正負それぞれの水色部分の面積が同じである。厳密には
g(0) = f(0) なのだがそこはご愛嬌を。
改めて、 |X| = Y すなわち \pm X = Y なので、以上を用いれば y が従う確率密度関数は
g(y) \quad (0 \leqq y \leqq b) \quad \cdots (2)
である。
証明
あとは先述の確率密度関数について式変形しまくるだけである。まず、E[|X|] について考える。先ほど導入した Y について書き直せば、
E[|X|] = E[Y] = \int_0^b y \, g(y) \, dy \quad \cdots (3)
ここで、a \ (0 < a < b) について考えると、
\int_0^b y \, g(y) \, dy \geqq \int_a^b y \, g(y) \, dy \quad \cdots (4)
右辺についてa \leqq y だから、
\begin{align*}
\int_a^b y \, g(y) \, dy &\geqq \int_a^b a \, g(y) \, dy \\
&= a \int_a^b g(y) \, dy \\
&= a \, P(Y \geqq a) \\
&= a \, P(|X| \geqq a) \quad \cdots (5)
\end{align*}
以上 (3) (4) (5) より、
\begin{align*}
E[|X|] &\geqq a \, P(|X| \geqq a) \\
\rightleftarrows \quad P(|X| \geqq a) &\leqq \frac{E[|X|]}{a}
\end{align*}
が示された。
チェビシェフの不等式
第二走者、チェビシェフの不等式は以下である。
確率変数 X に対し、期待値 E[X] = \mu 、分散 V[X] = \sigma^2 とする。また、定数 a (0 < a) とおくと、以下の関係が成り立つ。
P(|X - \mu| \geqq a) \leqq \frac{\sigma^2}{a^2}
証明
まず、
P(|X| \geqq a) = P(X^2 \geqq a^2) \quad \cdots (6)
である。また、X \to X - \mu とすると、(6) より
\begin{align*}
P(|X - \mu| \geqq a) &= P((X - \mu)^2 \geqq a^2) \\
&= P(|X - \mu|^2 \geqq a^2) \quad \cdots (7)
\end{align*}
である。更に P(|X - \mu|^2 \geqq a^2) に対し、
マルコフの不等式
P(|X| \geqq a) \leqq \frac{E[|X|]}{a}
を適用すると、
\begin{align*}
P(|X - \mu|^2 \geqq a^2) &\leqq \frac{E[|X - \mu|^2]}{a^2} \\
&= \frac{E[(X - \mu)^2]}{a^2} \\
&= \frac{\sigma^2}{a^2} \quad \cdots (8)
\end{align*}
となり、(7) (8) より
P(|X - \mu| \geqq a) \leqq \frac{\sigma^2}{a^2}
が成立する。
大数の弱法則
これまで証明してきた不等式を利用し、大数の弱法則を証明する。念の為大数の弱法則を再掲。
平均 \mu, 分散 \sigma^2 の同一分布に独立に従う X_i \ (1 \leqq i \leqq n) に対し、標本平均 \textstyle \frac{1}{n} \sum_{i=1}^n X_i = \overline{X}_n
を考える。すると、\overline{X}_n は \mu に確率収束する、すなわち
\lim_{n \to \infty} P(|\overline{X}_n - \mu| < \varepsilon) = 1
である。ただし、\varepsilon は任意の定数 (\varepsilon > 0) である。
証明
まず、チェビシェフの不等式
P(|X - \mu| \geqq a) \leqq \frac{V[X]}{a^2}
において、a \to \varepsilon \ (\varepsilon > 0) 、X \to \overline{X}_n とする。
すると、E[\overline{X}_n] = \mu 、 V[\overline{X}_n] = \sigma^2/n より、
P(|\overline{X}_n - \mu| \geqq \varepsilon) \leqq \frac{\sigma^2}{n \varepsilon^2} \quad \cdots (9)
となる。続いて、
1 - P(|\overline{X}_n - \mu| \geqq \varepsilon) = P(|\overline{X}_n - \mu| < \varepsilon) < 1 \quad \cdots (10)
である。(9) (10) より、
1 - \frac{\sigma^2}{n \varepsilon^2} \leqq 1 - P(|\overline{X}_n - \mu| \geqq \varepsilon) = P(|\overline{X}_n - \mu| < \varepsilon) < 1 \quad \cdots (11)
であり、それぞれ n \to \infty の極限をとると、
1 \leqq \lim_{n \to \infty} P(|\overline{X}_n - \mu| < \varepsilon) < 1
すなわち
\lim_{n \to \infty} P(|\overline{X}_n - \mu| < \varepsilon) = 1
である。
おわりに
改めて、大数の弱法則を証明してみた。大数の強法則も目を通してみたのだが、全く理解できず…ということで測度論から勉強しなおすモチベーションになった。
なお、異分野から来た身なので、もし間違っている点等見つけましたらコメントお願いします。
Discussion