確率分布
最終更新:
第4章では「ある特定の事象が起こる確率」を扱いました。第5章では枠を広げ、取り得る値が複数ある「変数」全体の確率パターンを考えます。
第4章(前章)
1つの事象について
「起こる / 起こらない」の確率
例:サイコロで「6が出る」確率は 1/6
第5章(本章)
取り得る全ての値について
「その値が出る確率」のマップ
例:サイコロの目 X について
「1〜6それぞれが出る確率を一覧にする」
世の中に頻出する定番のパターンに名前を付けて使えるようになります(正規分布、二項分布など)。
次章以降の推測統計(推定・検定)はこの定番分布を前提に組み立てられているため、ここを通らないと先に進めません。
確率変数と確率分布
「偶然で決まる数」をきちんと扱う
確率変数 (Random Variable)
確率変数 $X$:試行の結果に応じて値が決まる変数です。大文字で書きます。
実現値 $x$:実際に試行で出た値です。小文字で書きます。
例:$P(X = x)$ は「確率変数 $X$ が値 $x$ をとる確率」です。
$X$ = 「出た目」とすると:
・$X$ がとり得る値:$1, 2, 3, 4, 5, 6$
・確率:$P(X=1) = P(X=2) = \dots = P(X=6) = 1/6$
$X$ = 「その人の身長(cm)」とすると:
・$X$ がとり得る値:150cm〜200cmあたりの実数(170.3cmのような値も含む)
・サイコロと違って、とり得る値を $1, 2, 3, \dots$ と1個ずつ数え上げることができない
同じ「確率変数」でも、①と②はとり得る値のタイプが根本的に違います。この違いは 2 で詳しく扱います。
確率分布 (Probability Distribution)
確率変数 $X$ が「どの値をどの確率でとるか」を表すマップが確率分布です。
サイコロの確率分布:すべての目が等しく 1/6 = 離散一様分布
確率分布のすべての値の合計は必ず 1(全事象の確率=1)。
離散 vs 連続
確率変数の2タイプ
1 の具体例ⅰ(サイコロ)と具体例ⅱ(身長)は、とり得る値のタイプが根本的に違いました。この違いで確率変数は2種類に分けられ、扱い方も変わります。
飛び飛びの値だけをとる変数です(具体例ⅰのサイコロがこのタイプ)。
他の例:合格者数、コインの表回数
棒グラフ。各値ごとに「確率」を直接持つ
- 確率関数 $f(x) = P(X=x)$
- $\sum_x f(x) = 1$
- $P(X=3)$ のように「ちょうどその値」の確率を直接求められる
実数全体(区間)の値をとる変数です(具体例ⅱの身長がこのタイプ)。
他の例:体重、待ち時間、温度
曲線(密度)。区間の面積で確率を表す
- 確率密度関数 $f(x)$(値そのものは確率ではない)
- $\int f(x)\,dx = 1$(全体面積=1)
- $P(X = a) = 0$。確率は一点ではなく区間で考える:$P(a \leq X \leq b)$
①1点の値をとる確率は 0。
連続分布では「ある1点の値をとる確率は 0」です。例えば「身長がぴったり 170.000000... cm」になる確率は 0 です。意味があるのは「身長が 169 〜 171 cm の確率」のような区間の確率です(曲線の下の面積)。
②この曲線、実データのヒストグラムと何が違う?
実は同じものです。全国の男性の身長ヒストグラム(人数)を総人数で割って面積が1になるよう正規化すれば、この曲線とほぼ同じ形になります。曲線がなめらかなのは、実際のギザギザしたヒストグラムを正規分布という理論モデルで近似しているからです。つまりこの曲線は「全国の男性から1人ランダムに選んだときの身長の確率」を表しています。
累積分布関数(CDF)
本題に入る前に、似た略語が3つ出てくるので先に整理します。どれも英語の頭文字です。
| 略語 | 英語(頭文字の元) | 日本語 | 対象 | 記号と意味 |
|---|---|---|---|---|
| PMF | Probability Mass Function | 確率関数 | 離散型 | $f(x)=P(X=x)$ … 各値が持つ確率(棒の高さ) |
| Probability Density Function | 確率密度関数 | 連続型 | $f(x)$ … 曲線の高さ(密度。面積で確率) | |
| CDF | Cumulative Distribution Function | 累積分布関数 | 離散・連続 両方 | $F(x)=P(X\leq x)$ … $x$ 以下になる確率 |
・小文字 $f$(PMF・PDF)=その1点ぶんの確率や密度。
・大文字 $F$(CDF)=それを左端から足し上げた累積。
つまり「大文字 $F$ になったら積み上げ済みの合図」です。$F(x)=P(X \leq x)$ の $F$ が大文字なのはこのためです。
そしてPMF(離散)と PDF(連続)は別物ですが、それを積み上げた CDF はどちらの型でも同じように作れます。だから CDF は離散・連続のどちらにも使えます。
「$X$ が $x$ 以下になる確率」を全部足し合わせた合計です。$x$ を右へ動かすほど増え、最後は $1$ に達します。
「累積」とは確率が積み上がることです。離散型なら棒(確率)を左から足す、連続型なら曲線の下の面積を左から足します。足す対象は違っても、できあがる CDF はどちらも「$0$ から $1$ へ上る」同じ形になります。
- 離散(サイコロ1個):$P(X \leq 3) = P(1)+P(2)+P(3) = \tfrac{1}{6}+\tfrac{1}{6}+\tfrac{1}{6} = \tfrac{1}{2}$ ← 棒を3本ぶん足す
- 連続(成人男性の身長・平均170cm):$P(X \leq 170) = $ 左から170までの面積。この分布は左右対称なので、中心の170で面積はちょうど半分 $= 0.5$ ← 面積を足す
どちらも「左から足し上げる」だけです。足し方が和か面積(積分)かの違いで、考え方は同じです。これが CDF が共通の道具である理由です。
※ 上の $0.5$ は「左右対称だから」成り立つ値です。連続分布は対称とは限らず、待ち時間のように右に裾を引く(歪度>0)分布では、平均の位置での面積は $0.5$ になりません。
$F(b)$ は「$b$ 以下の確率(左から $b$ までの面積)」、$F(a)$ は「$a$ 以下の確率」です。後者を引けば、$a$ と $b$ に挟まれた部分だけが残る:
$$P(a < X \leq b) = F(b) - F(a)$$↑ これは PDF(面積)での引き算。同じ引き算を CDF(縦の高さ)で見ると ↓
CDF 上なら、$F(b)$ と $F(a)$ の高さを読んで引くだけです。面積の差(上の図)=高さの差(この図)=区間の確率で、見方が違うだけの同じ値です。
期待値・分散・標準偏差
確率分布の「中心」と「ばらつき」を数値化
確率分布も第1章のデータ分布と同様に、「中心」と「ばらつき」で要約できます。実はこの3つ(期待値・分散・標準偏差)は、第1章でやった平均・分散・標準偏差の「確率分布版」です。まず対応を押さえましょう。
| 測るもの | 記述統計(手元のデータ) | 確率分布(確率変数 $X$) |
|---|---|---|
| 中心 | 平均 $\bar{x}$ | 期待値 $E[X] = \mu$ |
| ばらつき | 分散 $s^2$ | 分散 $V[X] = \sigma^2$ |
| ばらつき | 標準偏差 $s$ | 標準偏差 $\sigma = \sqrt{V[X]}$ |
| 重み | 各データ $\tfrac{1}{n}$(平等) | 各値の確率 $P(X=x)$ |
いちばん大事なのは、確率分布版では「平均」を「期待値」と呼び $E[\cdot]$ と書くことです。$E[\cdot]$ は「平均をとる」という操作で、$E[X]$ は「$X$ の平均」と読めます(以降「期待値」と「平均」はほぼ同義で使う)。
データ版との違いは重みだけです。データは全部 $\tfrac{1}{n}$ で平等に平均し、確率分布は各値を確率 $P(X=x)$ で重みづけて平均します。
期待値 $E[X]$:平均的にとる値
「とり得る各値 × その確率」をすべて足します。
連続の場合は $E[X] = \int x \cdot f(x)\, dx$ です(積分になるだけ)。
サイコロの期待値:$E[X] = (1+2+\dots+6) \times \frac{1}{6} = 3.5$ → グラフの重心です。
連続型でも考え方は同じです。棒グラフの重心が「曲線(面積)の重心」に変わるだけです。
身長 $X \sim N(170, 6^2)$ の期待値:$E[X] = \int x \cdot f(x)\, dx = 170$ → 曲線(面積)の重心です。左右対称な分布では、山の頂点がそのまま重心になります。
分散 $V[X]$ と標準偏差 $\sigma$
期待値が分布の「中心」なら、分散・標準偏差はその「散らばり(中心からのブレ)」を測る量です。冒頭の対応表のとおり、これも第1章の分散・標準偏差の確率版です。まず「分散が何を測るのか」を図で見てから、公式に進みます。
分散は「散らばり具合」を1つの数にする
期待値が同じでも、散らばり方が違えば分散は変わります。次の2つはどちらも期待値3ですが、分散はまるで違います。
どちらも平均は3で同じです。だが左は中心に集まり(分散0.5)、右は端へ広がります(分散2.0)。分散はこの「平均からの散らばり具合」を1つの数にしたものです。
この「散らばり具合」を数式にすると
分散は「期待値からのブレ($X-\mu$)の2乗」を確率で平均したものです。別形は「2乗の平均 − 平均の2乗」で、手計算がぐっと楽になります。
$X$ = 出た目とすると、$E[X] = 3.5$ です。
① 定義どおり(各ズレの2乗 × 1/6 を合計):
$V[X] = \dfrac{(1-3.5)^2 + (2-3.5)^2 + \cdots + (6-3.5)^2}{6}$
$\qquad = \dfrac{6.25+2.25+0.25+0.25+2.25+6.25}{6} = \dfrac{17.5}{6} = \dfrac{35}{12} \approx 2.92$
② 別形(2乗の平均 − 平均の2乗):
$E[X^2] = \dfrac{1+4+9+16+25+36}{6} = \dfrac{91}{6}$
$\qquad V[X] = \dfrac{91}{6} - 3.5^2 = \dfrac{91}{6} - 12.25 = \dfrac{35}{12} \approx 2.92$
→ どちらも同じ $\tfrac{35}{12}$ です。標準偏差は $\sigma = \sqrt{35/12} \approx 1.71$ です。
期待値・分散の重要な性質
期待値・分散を変換したり組み合わせたりすると、どう変わるかには決まったルールがあります。ここで見るのは次の2つです:
・① 1次変換 $aX+b$:$X$ を定数倍して定数を足すと、期待値・分散はどう変わるか
・② 和 $X+Y$:2つの確率変数を足すと、期待値・分散はどう変わるか
どちらも推定・検定で繰り返し使う性質なので、ここでしっかり押さえます。
① 1次変換 $aX+b$(定数倍して足す)
性質:$X$ を $a$ 倍して $b$ を足すと、期待値も $a$ 倍されて $b$ だけ増えます。散らばり(分散)は $b$ の影響を全く受けず、$a$ 倍にした分だけ大きくなります(ただし $a$ の2乗倍)。
期待値は素直に $a$ 倍して $b$ を足します。分散は$b$ に無関係で、$a$ の2乗倍になります。
なぜ分散は $b$ に無関係で $a$ の2乗倍になるのでしょうか。
+b は分布を横にスライドさせるだけです(散らばり不変)。×a は横に引き伸ばします(σ が $a$ 倍 → 分散は $a^2$ 倍)。だから $V[aX+b]=a^2V[X]$ です。
サイコロを1回振り、「出た目 $X$ × 100円」+「参加賞 50円」がもらえるくじを考えます。もらえる金額は $Y = 100X + 50$ です(円)。出た目は偶然で決まる確率変数なので、賞金 $Y$ も確率変数です。
出た目の期待値は $E[X]=3.5$、分散は $V[X]=\tfrac{35}{12}\approx2.92$ です($\sigma\approx1.71$)。よって:
・期待賞金 $E[Y] = 100\times 3.5 + 50 = $ 400円(=何回も引いたとき1回あたり平均してもらえる額)
・$V[Y] = 100^2 \times \tfrac{35}{12} \approx $ 29167($\sigma_Y = 100\times1.71 = 171$円)
参加賞50円は何が出ても必ずもらえる固定額なので、賞金のばらつきは変えません($+b$ は分散に無関係)。×100は「出目1つ分の差」を「100円の差」に拡大するので、ばらつき σ も100倍です(分散はその2乗で $100^2$ 倍)。
② 和 $X+Y$(2つを足す)
性質:2つの確率変数を足すと、期待値はいつでも足し算になります。分散も足し算になりますが、これは $X$ と $Y$ が独立のときだけ成り立ちます。
期待値はいつでも足し算です。分散が足し算になるのは独立のときだけです。
サイコロ1個(上)より2個の和(下)のほうが、中心が右へ動き(3.5→7=期待値が足し算)、かつ横に広がります(σ 1.71→2.42=独立なので分散が足し算)。
各サイコロ $E=3.5$、$V=\tfrac{35}{12}\approx2.92$ です。和 $X+Y$ は:
・$E[X+Y] = 3.5 + 3.5 = $ 7
・$V[X+Y] = \tfrac{35}{12} + \tfrac{35}{12} = \tfrac{35}{6} \approx $ 5.83($\sigma \approx 2.42$)
独立なので分散をそのまま足せます。期待値は独立でなくても足せます。
① 分散の足し算は独立のときだけ。 一般には共分散が入る:
$V[X+Y] = V[X] + V[Y] + 2\,\text{Cov}(X, Y)$
例:2銘柄の株が連動($\text{Cov}>0$)すると、合計のばらつきは単純な和より大きくなります。逆に逆相関($\text{Cov}<0$)なら打ち消し合って小さくなります。これが分散投資でリスクを下げる原理です。
② 標準偏差は足せない。 $\sigma_{X+Y} \neq \sigma_X + \sigma_Y$(独立でも足せるのは分散の方。$\sigma_{X+Y}=\sqrt{\sigma_X^2+\sigma_Y^2}$)。
離散型の代表分布
飛び飛びの値をとる「定番パターン」5つ
世の中の確率現象には頻出のパターンがいくつかあり、それぞれ名前が付いています。離散型では検定2級で押さえるべき分布が5つあります。
① ベルヌーイ分布:1回試行の成功/失敗
1回の試行で成功($X=1$)か失敗($X=0$)かを表す確率変数:
$$P(X=1) = p,\quad P(X=0) = 1-p$$$E[X] = p$、$V[X] = p(1-p)$
「コインで表が出るか」「広告がクリックされるか」「サイコロで6が出るか」など、結果が2択(成功/失敗)になる試行はすべてベルヌーイ分布です。とり得る値は0と1だけなので、グラフは棒2本です。
成功確率 $p$ の棒(X=1)と、残り $1-p$ の棒(X=0)だけです。2本の高さを足すと1 です。
クリック確率 $p=0.2$、$X=1$(クリック)/$X=0$(クリックしない)とします。
・$E[X] = 0.2$(1回表示あたり平均0.2回クリック=クリック率)
・$V[X] = 0.2 \times 0.8 = 0.16$($\sigma = 0.4$)
期待値:$E[X] = 1\cdot p + 0\cdot(1-p) = p$ です。0か1しかとらないので、期待値は「1になる確率 $p$」と一致します。
分散:ここがポイントです。$X$ は0か1だけなので $X^2 = X$ です($0^2=0,\ 1^2=1$)。よって $E[X^2] = E[X] = p$ です。これを別形に入れると:
$V[X] = E[X^2] - (E[X])^2 = p - p^2 = p(1-p)$
なぜ分散が $p(1-p)$ ?「五分五分」で最大、「確実」でゼロ
分散は「どちらに転ぶか分からない度合い」です。必ず成功($p=1$)や必ず失敗($p=0$)なら結果は確定していてバラつかない→分散0 です。最も読めないのは五分五分($p=0.5$)で分散は最大です。$p(1-p)$ はちょうどこの山なりの形になります。
横軸=成功確率 $p$、縦軸=分散。$p=0$・$p=1$(結果が確実)なら分散0、$p=0.5$(最も読めない)で最大 0.25 です。この山なりがちょうど $V=p(1-p)$ です。
② 二項分布:$n$ 回試行の成功回数
成功確率 $p$ の試行を独立に $n$ 回繰り返したときの、成功回数 $X$ の分布:
$$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}\quad (k = 0,1,\dots,n)$$$E[X] = np$、$V[X] = np(1-p)$
※ $\binom{n}{k}$ は組み合わせの数 $_nC_k$
ある試験の合格率は 30% です。5人受験したとき、ちょうど 2人が合格する確率は?
$X \sim \text{B}(5, 0.3)$ で $P(X=2) = \binom{5}{2} (0.3)^2 (0.7)^3 = 10 \times 0.09 \times 0.343 \approx $ 0.309
$p$ で形がどう変わる?($n=10$ 固定)
$p$ が小さいと左に偏り、$p = 0.5$ で左右対称、$p$ が大きいと右に偏ります。$n$ が大きくなると形がだんだん正規分布に似てきます(中心極限定理、第6章で)。
③ 幾何分布:初めて成功するまでの試行回数
成功確率 $p$ の試行を繰り返し、初めて成功するまでの試行回数 $X$ の分布:
$$P(X = k) = (1-p)^{k-1} \cdot p \quad (k = 1, 2, 3, \dots)$$$E[X] = \dfrac{1}{p}$、$V[X] = \dfrac{1-p}{p^2}$
$p$ が小さいほど成功までの平均試行回数 $1/p$ が大きくなります(直感通り)。
$p = 0.3$ の幾何分布です。指数的に減衰するのが特徴です。
$p = 1/6$ の幾何分布です。
・$P(X=1)$(一発で6):$1/6 \approx 0.167$
・$P(X=3)$(3回目で初6):$(5/6)^2 \cdot (1/6) \approx 0.116$
・期待値 $E[X] = 1/(1/6) = $ 6 回(平均的に6回投げれば1回6が出る)
$p = 1/319$ の幾何分布です。$E[X] = 319$ 回ですが、分布の形はサイコロのときと同じ「単調減少」のままです。$p$ が小さくなった分、裾が数百回先まで長く伸びて、全体になだらかに引き伸ばされます。
山なりの正規分布にはならず、初回が最も確率が高く、そこから緩やかに減っていく形が最後まで続きます。$p\to0$ の極限では、この形は連続版の指数分布に近づきます。
幾何分布の拡張:負の二項分布
幾何分布は「初めて成功するまで」でした。これを「$r$ 回目の成功が出るまで」に広げたものが負の二項分布です。営業で「契約が3件取れるまで訪問を続ける」、ガチャで「当たりが3枚そろうまで引く」といった場面です。
$E[X] = \dfrac{r}{p}$、$V[X] = \dfrac{r(1-p)}{p^2}$(幾何分布の $r$ 倍)
式の読み方:最後の $k$ 回目は必ず成功なので、残る $k-1$ 回のうちどこに $r-1$ 回の成功を置くかが $\binom{k-1}{r-1}$ 通り、あとは成功 $r$ 回と失敗 $k-r$ 回の確率を掛けるだけです。$r=1$ とすると幾何分布の式に戻ります。
成功=6が出る($p=\tfrac16$)、$r=2$、$k=5$ です。 「5回目に2回目の6が出る」とは、5回目は必ず6で、1〜4回目のどこか1回だけ6が出て、残り3回は6以外ということです。 1〜4回目のどこに6を置くかは4通りしかありません:
1〜4回目のどこかに6が1回 → $\binom{4}{1}=4$ 通り
6以外(3回)
$P(X=5) = \underbrace{\binom{4}{1}}_{\text{6の置き場所}} \times \underbrace{\left(\tfrac16\right)^2}_{\text{6が2回}} \times \underbrace{\left(\tfrac56\right)^3}_{\text{6以外が3回}} = 4 \times \tfrac{1}{36} \times \tfrac{125}{216} \approx $ 0.064(約6.4%)
公式の $\binom{k-1}{r-1}$ は「最後の1回を除いた $k-1$ 回のうち、残り $r-1$ 回の成功をどこに置くか」の数です。ここでは $\binom{4}{1}$ でした。
※「負の」と付きますが、意味的に負のものはありません。確率の式が「指数が負の二項展開 $(1-q)^{-r}$」から出てくる、という数式上の由来です(二項分布は $(p+q)^n$ の展開から出てきます)。
※ 教科書によっては「$r$ 回目の成功までの失敗回数」で定義することもあります。そのときは $k$ が $0$ から始まり、期待値は $r(1-p)/p$ です。試験ではどちらの定義かが問題文に書かれます。
④ 超幾何分布:非復元抽出の成功回数
$N$ 個の中に「成功」とみなすものが $K$ 個あります。戻さずに $n$ 個取り出したときの成功個数 $X$ の分布:
$$P(X = k) = \frac{\binom{K}{k} \binom{N-K}{n-k}}{\binom{N}{n}}$$$E[X] = n \cdot \dfrac{K}{N}$(二項分布と同じ形)
$$V[X] = \underbrace{n \cdot \dfrac{K}{N} \cdot \dfrac{N-K}{N}}_{\text{二項分布の分散}} \;\times\; \underbrace{\dfrac{N-n}{N-1}}_{\text{有限修正項}}$$分散の本体は二項分布の分散です。そこに「戻さない分だけ結果が偏る」ことを表す有限修正項(必ず1以下)を掛けているだけです。ここは丸暗記より構造の理解を優先でOKです。
・復元(戻す)→ 各回が独立 → 二項分布を使う
・非復元(戻さない)→ 各回の確率が変わる → 超幾何分布を使う
→ 有限修正項 $\dfrac{N-n}{N-1}$ は $n=N$(全部抜き取り)に近づくほど$0$ に近づく(毎回同じ結果になるので分散はなし)。逆に $N$ が $n$ よりずっと大きければ $\approx 1$ で、二項分布とほぼ一致します。
$N=30$, $K=5$, $n=10$ です。ちょうど $X=2$ 個が不良である確率:
$P(X=2) = \dfrac{\binom{5}{2}\binom{25}{8}}{\binom{30}{10}} = \dfrac{10 \times 1081575}{30045015} \approx \mathbf{0.360}$
期待値:$E[X] = 10 \times \dfrac{5}{30} \approx 1.67$ 個
分散:$V[X] = \underbrace{10 \times \dfrac{5}{30} \times \dfrac{25}{30}}_{\text{二項なら}\approx 1.389} \times \underbrace{\dfrac{20}{29}}_{\text{有限修正}\approx 0.690} \approx \mathbf{0.958}$ 個²
⑤ ポアソン分布:単位時間あたりの稀な事象数
単位時間あたり平均 $\lambda$ 回起こる出来事の発生回数 $X$ の分布:
$$P(X=k) = \frac{\lambda^k e^{-\lambda}}{k!}\quad (k = 0,1,2,\dots)$$$E[X] = \lambda$、$V[X] = \lambda$(期待値と分散が等しい!)
使う場面:
- 1時間にコールセンターにかかってくる電話の本数
- 1日に交通事故が起こる件数
- 1ページあたりの誤植の数
- 1平方キロあたりの落雷回数
$\lambda = 3$ のポアソン分布
ある1時間に…
・ちょうど5件かかる:$P(X=5) = \dfrac{3^5\, e^{-3}}{5!} = \dfrac{243 \times 0.0498}{120} \approx$ 0.101(約10%)
・1件も来ない:$P(X=0) = \dfrac{3^0 e^{-3}}{0!} = e^{-3} \approx$ 0.050(約5%)
・2件以下:$P(X\le2) = e^{-3}\!\left(\dfrac{3^0}{0!}+\dfrac{3^1}{1!}+\dfrac{3^2}{2!}\right) = e^{-3}\times 8.5 \approx$ 0.423(約42%)
→ 「めったに起こらないことが多くの機会で観測される」状況のモデル化に使えます。
| 分布 | シナリオ | $E[X]$ | $V[X]$ |
|---|---|---|---|
| ベルヌーイ Be($p$) | 1回の成功/失敗 | $p$ | $p(1-p)$ |
| 二項 B($n,p$) | $n$ 回試行の成功回数(復元) | $np$ | $np(1-p)$ |
| 幾何 Geo($p$) | 初成功までの試行回数 | $1/p$ | $(1-p)/p^2$ |
| 超幾何 HG($N,K,n$) | 非復元での成功回数 | $nK/N$ | ※ |
| ポアソン Po($\lambda$) | 単位時間の稀な事象数 | $\lambda$ | $\lambda$ |
※ 超幾何の分散は「二項の分散 $np(1-p)$($p=K/N$)」に補正係数 $\frac{N-n}{N-1}$ を掛けた形です。丸暗記は不要で、「非復元だと二項よりばらつきが少し小さくなる」と押さえれば十分です。
連続型の代表分布
一様・指数・正規:主役は正規分布
連続型では3つの代表分布を押さえます。検定2級では正規分布が圧倒的に主役ですが、一様分布と指数分布も簡単に触れておきます。
一様分布 U(a,b)
指数分布 Exp(λ)
正規分布 N(μ,σ²)
① 一様分布
$a$:分布が始まる値、$b$:分布が終わる値です(例えば「10分間隔のバスの待ち時間(0〜10分)」なら $a=0,\,b=10$)。幅 $(b-a)$ と高さ $\frac{1}{b-a}$ をかけると、どんな $a,b$ でも面積はちょうど $1$ です。
$E[X] = \dfrac{a + b}{2}$、$V[X] = \dfrac{(b - a)^2}{12}$
確率は区間の長さに比例:$P(c \leq X \leq d) = \dfrac{d - c}{b - a}$
バスが10分間隔で来るバス停に、時刻表を見ずに着いたとします。このとき待ち時間 $X$ は $U(0, 10)$ に従います。平均で何分待つことになるでしょうか。また、3分以内にバスが来る確率はどれくらいでしょうか。
高さ一定 $\frac{1}{10}$ の「屋根」が $0$〜$10$ に広がります。確率は面積なので、$0$〜$3$ の部分(紫の濃い箇所)の面積 $=3\times\frac{1}{10}=0.3$ がそのまま $P(X\leq3)$ です。
・平均待ち時間:$E[X] = \dfrac{0+10}{2} = 5$ 分
・3分以内に来る確率:$P(X \leq 3) = \dfrac{3-0}{10-0} = \mathbf{0.3}$
② 指数分布
「次のイベント(電話・客の到着・故障など)が起こるまでの待ち時間」を表す連続分布です。まず式と形を見て、すぐに例題で「どう使うか」をつかみます。
$E[X] = \dfrac{1}{\lambda}$(平均待ち時間)、$V[X] = \dfrac{1}{\lambda^2}$
$\lambda$ = 単位時間あたりの平均発生率
例題:5分以内に次が来る確率は?
コールセンターに1時間あたり平均6本の電話が来るとします(発生率 $\lambda=6$ /時)。「次の電話までの待ち時間」を $X$ とすると、$X$ は指数分布に従います($X \sim \text{Exp}(6)$ です。「$\sim$」は「この分布に従う」の意味です)。平均待ち時間は $E[X]=\tfrac{1}{6}$時間 = 10分。さて、「5分以内に次が来る確率」は?
まず分布の「形」をつかむ
密度 $f(x)$ は $x=0$ で最大、右へ指数的に減る右下がりの曲線です。「待ち時間は短いほどありがちで、長くなるほど稀」を表します。山型ではなく、0 が一番高いのが特徴です。
直感:時間を「毎瞬間、一定確率で当たりが出るくじ引き」の連続だと考えると分かりやすくなります。例えば、$x=15$分の瞬間に当たるには、その前の15分間ずっと外れ続けている必要があります。外れ続けて生き残っている人はどんどん減っていくので、$x$ が大きい時刻ほど「そこまで残っている母数」自体が小さくなります。だから山は $0$ が一番高く、右へ行くほど低くなります。
つい $f(5)$ を計算したくなりますが、それで出るのは上のグラフの高さ(確率密度)であって確率ではありません。連続分布では「ちょうど5分」のような1点の確率は 0(本章 2 の鉄則)。確率は必ず曲線の下の「面積」で考えます。
→ だから「5分以内に来る確率」= 0〜5分の区間の面積 = $P(X \le 5)$ です。
では「面積(確率)」をどう出すか
この面積を直接出すより、「5分過ぎても来ない」面積(右側)= $P(X > 5)$ を先に出す方がラクです。これは $e^{-\lambda t}$ という素直な形で書けるからです(理由は下の囲み)。あとは全体(面積1)から引けば「来る」が出ます。
左(紫)+右(灰)= 全面積 1。求めたい「5分以内に来る」は左の面積です。
$\Rightarrow\; P(X \le 5\text{分}) = 1 - 0.607 = $ 0.393(来る・左の面積、約39%)
※ 時間 $t$ は $\lambda$ と単位をそろえ、5分 = $\tfrac{5}{60}$ 時間です。$1-$ で引くのは「来る=来ないの反対(余事象)」だからです。
例えば $\lambda=6$ 件/時間、$t=1$ 時間を1分刻み($n=60$)にすると、1分あたり平均 $0.1$ 件、つまり「来る $0.1$/来ない $0.9$」です。
$t$ の間ずっと来ない=全区間で来ないなので、これを $n$ 回かけて $\left(1-\dfrac{\lambda t}{n}\right)^{n}$ です(例では $0.9^{60}\approx 0.002$)。区間を無限に細かく($n\to\infty$)すると $e^{-\lambda t}$ になります(例では $e^{-6}\approx 0.0025$。刻みを細かくするほどこの値に近づきます)。
直感:各瞬間の「来ない」をかけ合わせるので、待ち時間が伸びるほど確率は指数関数的に減ります($\lambda$ が大きい、つまりよく来るほど速く減る)。
$P(X>t)=e^{-\lambda t}$:待ち時間 $t$ が伸びるほど指数的に 0 へ近づきます($t=5$分で 0.607)。これが「来ない確率」の正体です。
指数分布には無記憶性がある:「すでに $s$ 分待っていても、そこから $t$ 分以内に来る確率は、最初から $t$ 分以内に来る確率と同じ」です。
→ この性質は、機械の寿命のような「使うほど劣化するもの」には当てはまりません(古い機械ほど壊れやすいから)。一方、コールセンターへの電話のようにいつ起きても不思議ではない、完全にランダムな現象(ポアソン過程)では成り立ちます。
③ 正規分布
正規分布(ガウス分布)は統計学で最も重要な連続分布です。身長・体重・テスト点数・測定誤差など、自然界のあらゆる「多数の小さな要因が積み重なって生じるばらつき」がこの形になります。
暗記不要!統計検定2級では式の暗記が必要な問題は出題されません。
・平均 $\mu$、分散 $\sigma^2$ の2つのパラメータで形が決まる
・$\mu$ で中心の位置、$\sigma$ で広がりが決まる
・左右対称、$\mu$ で最大値
・$\sim$ は「この分布に従う」の意味です。左が値のブレる量、右がそのブレ方の名前です。
・$N$ は正規分布です(Normal)。カッコの中は $N(\,$ 平均 $,\ $ 分散 $\,)$ の順に書きます。
⚠️ カンマの後ろは分散 $\sigma^2$ であって、標準偏差 $\sigma$ ではありません。
たとえば「平均 $170$、標準偏差 $6$」の分布は $N(170,\ 36)$ と書きます($6$ ではなく $6^2=36$)。ばらつきを使うときは、まず平方根をとると覚えておくと安全です。
68-95-99.7 ルール
正規分布では、平均からの距離($\sigma$ の倍数)と中に含まれるデータの割合が正規分布の密度関数から数学的に決まるため、$\sigma$ 何個分かを覚えておけば即座に確率が分かります。
- $\mu \pm 1\sigma$ の範囲に 約 68% のデータが入る
- $\mu \pm 2\sigma$ の範囲に 約 95% が入る ← 信頼区間で大活躍
- $\mu \pm 3\sigma$ の範囲に 約 99.7% が入る
※ より正確には95%に対応するのは $1.96\sigma$ です(≒ 2σ)。検定・推定では1.96という数値がよく出てきます。
標準化と標準正規分布
$\mu, \sigma$ が異なる正規分布たちを、共通の物差しで扱えるようにしたいところです。そのための変換が標準化です。
$X \sim N(\mu, \sigma^2)$ から標準化された $Z$ は、必ず $N(0, 1)$(標準正規分布) に従います。
標準化のステップを目で見る
(出発点)
$X \sim N(60, 10^2)$
(中心を 0 に)
$X - 60 \sim N(0, 10^2)$
(広がりを 1 に)
$Z = \frac{X-60}{10} \sim N(0, 1)$
標準正規分布表($z$ 表)
68-95-99.7 ルールが使えるのは、境界がちょうど $\mu \pm 1\sigma,\ \mu \pm 2\sigma,\ \mu \pm 3\sigma$ に当たる場合だけです。でも試験で問われる値はたいてい半端で、標準化すると $z = 1.43$ のような数になります。片側だけの確率を聞かれることもあります。
ここで役に立つのが、標準化すると必ず同じ $N(0,1)$ ただ1つにそろうことです。形が1つに決まっているなら、「$z$ がある値より外側になる確率(=裾の面積)」をあらかじめ計算して一覧にしておけます。これが標準正規分布表(略して確率表/$z$ 表)です。元が $N(170, 5^2)$ でも $N(60, 10^2)$ でも、標準化さえすればこの1枚の表だけで確率が読めるようになります。
※ 分布表には「$u$ 以上の確率(上側確率)」を載せた型と、「$0$ から $u$ までの確率」を載せた型の2種類があります。統計検定2級で配られるのは前者です。
| $u$ | .00 | .01 | .02 | .03 | .04 | .05 | .06 | .07 | .08 | .09 |
|---|---|---|---|---|---|---|---|---|---|---|
| 0.0 | 0.5000 | 0.4960 | 0.4920 | 0.4880 | 0.4840 | 0.4801 | 0.4761 | 0.4721 | 0.4681 | 0.4641 |
| 0.1 | 0.4602 | 0.4562 | 0.4522 | 0.4483 | 0.4443 | 0.4404 | 0.4364 | 0.4325 | 0.4286 | 0.4247 |
| 0.2 | 0.4207 | 0.4168 | 0.4129 | 0.4090 | 0.4052 | 0.4013 | 0.3974 | 0.3936 | 0.3897 | 0.3859 |
| 0.3 | 0.3821 | 0.3783 | 0.3745 | 0.3707 | 0.3669 | 0.3632 | 0.3594 | 0.3557 | 0.3520 | 0.3483 |
| 0.4 | 0.3446 | 0.3409 | 0.3372 | 0.3336 | 0.3300 | 0.3264 | 0.3228 | 0.3192 | 0.3156 | 0.3121 |
| 0.5 | 0.3085 | 0.3050 | 0.3015 | 0.2981 | 0.2946 | 0.2912 | 0.2877 | 0.2843 | 0.2810 | 0.2776 |
| 0.6 | 0.2743 | 0.2709 | 0.2676 | 0.2643 | 0.2611 | 0.2578 | 0.2546 | 0.2514 | 0.2483 | 0.2451 |
| 0.7 | 0.2420 | 0.2389 | 0.2358 | 0.2327 | 0.2296 | 0.2266 | 0.2236 | 0.2206 | 0.2177 | 0.2148 |
| 0.8 | 0.2119 | 0.2090 | 0.2061 | 0.2033 | 0.2005 | 0.1977 | 0.1949 | 0.1922 | 0.1894 | 0.1867 |
| 0.9 | 0.1841 | 0.1814 | 0.1788 | 0.1762 | 0.1736 | 0.1711 | 0.1685 | 0.1660 | 0.1635 | 0.1611 |
| 1.0 | 0.1587 | 0.1562 | 0.1539 | 0.1515 | 0.1492 | 0.1469 | 0.1446 | 0.1423 | 0.1401 | 0.1379 |
| 1.1 | 0.1357 | 0.1335 | 0.1314 | 0.1292 | 0.1271 | 0.1251 | 0.1230 | 0.1210 | 0.1190 | 0.1170 |
| 1.2 | 0.1151 | 0.1131 | 0.1112 | 0.1093 | 0.1075 | 0.1056 | 0.1038 | 0.1020 | 0.1003 | 0.0985 |
| 1.3 | 0.0968 | 0.0951 | 0.0934 | 0.0918 | 0.0901 | 0.0885 | 0.0869 | 0.0853 | 0.0838 | 0.0823 |
| 1.4 | 0.0808 | 0.0793 | 0.0778 | 0.0764 | 0.0749 | 0.0735 | 0.0721 | 0.0708 | 0.0694 | 0.0681 |
| 1.5 | 0.0668 | 0.0655 | 0.0643 | 0.0630 | 0.0618 | 0.0606 | 0.0594 | 0.0582 | 0.0571 | 0.0559 |
| 1.6 | 0.0548 | 0.0537 | 0.0526 | 0.0516 | 0.0505 | 0.0495 | 0.0485 | 0.0475 | 0.0465 | 0.0455 |
| 1.7 | 0.0446 | 0.0436 | 0.0427 | 0.0418 | 0.0409 | 0.0401 | 0.0392 | 0.0384 | 0.0375 | 0.0367 |
| 1.8 | 0.0359 | 0.0351 | 0.0344 | 0.0336 | 0.0329 | 0.0322 | 0.0314 | 0.0307 | 0.0301 | 0.0294 |
| 1.9 | 0.0287 | 0.0281 | 0.0274 | 0.0268 | 0.0262 | 0.0256 | 0.0250 | 0.0244 | 0.0239 | 0.0233 |
| 2.0 | 0.0228 | 0.0222 | 0.0217 | 0.0212 | 0.0207 | 0.0202 | 0.0197 | 0.0192 | 0.0188 | 0.0183 |
| 2.1 | 0.0179 | 0.0174 | 0.0170 | 0.0166 | 0.0162 | 0.0158 | 0.0154 | 0.0150 | 0.0146 | 0.0143 |
| 2.2 | 0.0139 | 0.0136 | 0.0132 | 0.0129 | 0.0125 | 0.0122 | 0.0119 | 0.0116 | 0.0113 | 0.0110 |
| 2.3 | 0.0107 | 0.0104 | 0.0102 | 0.0099 | 0.0096 | 0.0094 | 0.0091 | 0.0089 | 0.0087 | 0.0084 |
| 2.4 | 0.0082 | 0.0080 | 0.0078 | 0.0075 | 0.0073 | 0.0071 | 0.0069 | 0.0068 | 0.0066 | 0.0064 |
| 2.5 | 0.0062 | 0.0060 | 0.0059 | 0.0057 | 0.0055 | 0.0054 | 0.0052 | 0.0051 | 0.0049 | 0.0048 |
| 2.6 | 0.0047 | 0.0045 | 0.0044 | 0.0043 | 0.0041 | 0.0040 | 0.0039 | 0.0038 | 0.0037 | 0.0036 |
| 2.7 | 0.0035 | 0.0034 | 0.0033 | 0.0032 | 0.0031 | 0.0030 | 0.0029 | 0.0028 | 0.0027 | 0.0026 |
| 2.8 | 0.0026 | 0.0025 | 0.0024 | 0.0023 | 0.0023 | 0.0022 | 0.0021 | 0.0021 | 0.0020 | 0.0019 |
| 2.9 | 0.0019 | 0.0018 | 0.0018 | 0.0017 | 0.0016 | 0.0016 | 0.0015 | 0.0015 | 0.0014 | 0.0014 |
| 3.0 | 0.0013 | 0.0013 | 0.0013 | 0.0012 | 0.0012 | 0.0011 | 0.0011 | 0.0011 | 0.0010 | 0.0010 |
読み方を1つ試してみます。たとえば $z$ が 1.43 以上になる確率を知りたいとします。$1.43$ を「$1.4$」と「$0.03$」に分解して、 縦の見出しから 1.4 の行、横の見出しから .03 の列をたどり、交わったマス(表の黄色い箇所)を読みます。
$P(Z \geq 1.43) = \mathbf{0.0764}$(約 7.6%)
表が載せているのは右側の裾だけなので、「$1.43$ 以下の確率」を聞かれたら全体の1から引いて $1-0.0764=0.9236$ とします。 左側($z$ が負)の確率も、左右対称なので $P(Z \leq -1.43) = P(Z \geq 1.43) = 0.0764$ と読み替えられます。
ある集団の身長 $X$ が $N(170,\ 6^2)$ に従うとします(単位は cm)。身長が 180cm 以上の人は、この集団の何%いるでしょうか。
まず標準化します。$z = \dfrac{180-170}{6} = 1.67$ です。あとは上の表で「$1.6$ の行」と「$.07$ の列」が交わるマスを読むだけです。
$P(X \geq 180) = P(Z \geq 1.67) = \mathbf{0.0475}$(約 4.8%)
正規分布どうしを足すと、また正規分布になる(再生性)
独立な正規分布を足したり引いたりしても、結果はまた正規分布になります。平均は足し算、分散も足し算(引き算のときも分散は足す)です。これを再生性といいます。
電車の所要時間 $X \sim N(30,\ 4^2)$、バスの所要時間 $Y \sim N(20,\ 3^2)$ で、互いに独立とします(単位は分)。通勤時間の合計 $X+Y$ が 60 分を超える確率はどれくらいでしょうか。
合計 $X+Y$ も正規分布で、平均は $30+20=50$、分散は $4^2+3^2=25$(標準偏差 5)です。つまり $X+Y \sim N(50,\ 5^2)$ です。
あとは標準化して $z$ 表を引くだけです:
$P(X+Y > 60) = P\left(Z > \dfrac{60-50}{5}\right) = P(Z > 2) \approx \mathbf{0.023}$
標準偏差は $4+3=7$ ではなく $\sqrt{4^2+3^2}=5$ です。足せるのは分散のほうで、標準偏差は足せません。
多変量確率分布
複数の確率変数が「同時に」とる値の確率パターン
ここまでは1つの確率変数 $X$ を扱ってきましたが、現実には複数の変数を同時に考えたい場面が多くあります。例:身長と体重、株Aと株Bのリターン、応募者の学力と内定率などです。
同時確率分布 (Joint Distribution)
$X$ と $Y$ が同時にそれぞれの値をとる確率です。離散なら表、連続なら2変数密度関数で表します。
$X$ = 血液型(A/B/O/AB)、$Y$ = 性別(男/女)の同時分布(確率で表記):
| A型 | B型 | O型 | AB型 | $P(Y)$ | |
|---|---|---|---|---|---|
| 男 | 0.19 | 0.10 | 0.14 | 0.05 | 0.48 |
| 女 | 0.21 | 0.10 | 0.16 | 0.05 | 0.52 |
| $P(X)$ | 0.40 | 0.20 | 0.30 | 0.10 | 1.00 |
・黄色のセル:周辺分布(後述)
・紫のセル:全体合計(必ず 1)
周辺分布 (Marginal Distribution)
同時分布の表から、片方の変数だけの分布を取り出したものが周辺分布です。やることは足し算だけで、$X$ の分布が知りたければ $Y$ の全パターンを足し合わせます。表でいえば列を足すと $X$ の周辺分布、行を足すと $Y$ の周辺分布になります。合計を表の端(margin)に書くことから「周辺」と呼ばれます。
条件付き分布 (Conditional Distribution)
「$X = x$ が分かっているとき」の $Y$ の分布です。第4章の条件付き確率と同じ式です。
上の表で「血液型がA型」と分かっているとき、男性である確率:
$P(\text{男} \mid \text{A型}) = \dfrac{P(\text{男, A型})}{P(\text{A型})} = \dfrac{0.19}{0.40} \approx $ 0.475
$P(\text{女} \mid \text{A型}) = \dfrac{0.21}{0.40} \approx $ 0.525
※ 全体での男:女 = 0.48:0.52 とほぼ同じ比率 → A型と性別はほぼ独立です。
確率変数の独立性
$X$ と $Y$ が独立とは、すべての $x,\ y$ で次が成り立つことです:
$$\begin{aligned} P(X = x,\ Y = y) \\ = P(X = x) \cdot P(Y = y) \end{aligned}$$同値:$P(Y \mid X) = P(Y)$($X$ を知っても $Y$ の確率が変わらない)
例:$P(\text{男, A型}) = 0.19$、$P(\text{男}) \cdot P(\text{A型}) = 0.48 \times 0.40 = 0.192$
→ ほぼ一致 → ほぼ独立と判定できます。
共分散と相関係数(確率変数版)
| 概念 | 第2章(標本データ) | 第5章(確率変数) |
|---|---|---|
| 平均 | $\bar{x}$ | $\mu = E[X]$ |
| 分散 | $s^2$ | $\sigma^2 = V[X]$ |
| 共分散 | $s_{xy}$ | $\text{Cov}(X, Y)$ |
| 相関係数 | $r$ | $\rho_{XY}$ |
標本側はデータから計算する「実測値」、確率変数側は分布から決まる「真の値」です。第7章で「標本から確率変数の母数を推定する」関係になります。
・独立 ⇒ 無相関($\text{Cov} = 0$):常に成立
・無相関 ⇒ 独立:成立しない(非線形な依存関係がある場合)
→ 相関係数は線形関係しか捉えられません(第2章 罠③ と同じ)。
2変量正規分布
身長と体重のように、2つとも正規分布に従い、しかも互いに相関がある組を1つの分布として扱ったものが2変量正規分布です。パラメータは5つで、それぞれの平均 $\mu_X, \mu_Y$、標準偏差 $\sigma_X, \sigma_Y$、そして相関係数 $\rho$ です。
試験で押さえておくことは3つです。$X$ だけ、$Y$ だけを見た分布(周辺分布)はそれぞれ正規分布です。$X$ の値を固定したときの $Y$ の分布(条件付き分布)も正規分布で、その平均は $X$ に対して直線的に変わります(これが第2章の回帰直線の背景です)。そして2変量正規分布に限っては、無相関($\rho = 0$)なら独立です。上で見た「無相関だからといって独立とは限らない」の、数少ない例外です。