第5章 / STEP 3

確率分布

「不確実性」に名前と形を与える
確率変数 期待値・分散 二項分布 ポアソン分布 正規分布 多変量分布

最終更新:

なぜ確率分布?
「1事象の確率」から「変数全体の確率パターン」へ

第4章では「ある特定の事象が起こる確率」を扱いました。第5章では枠を広げ、取り得る値が複数ある「変数」全体の確率パターンを考えます。

第4章(前章)

1つの事象について
「起こる / 起こらない」の確率
例:サイコロで「6が出る」確率は 1/6

第5章(本章)

取り得る全ての値について
「その値が出る確率」のマップ
例:サイコロの目 X について
「1〜6それぞれが出る確率を一覧にする」

このマップを覚えると:
世の中に頻出する定番のパターンに名前を付けて使えるようになります(正規分布、二項分布など)。
次章以降の推測統計(推定・検定)はこの定番分布を前提に組み立てられているため、ここを通らないと先に進めません。
1

確率変数と確率分布

「偶然で決まる数」をきちんと扱う

確率変数 (Random Variable)

定義:確率変数と実現値

確率変数 $X$:試行の結果に応じて値が決まる変数です。大文字で書きます。
実現値 $x$:実際に試行で出た値です。小文字で書きます。
例:$P(X = x)$ は「確率変数 $X$ が値 $x$ をとる確率」です。

具体例ⅰ:サイコロ1個を振る

$X$ = 「出た目」とすると:
・$X$ がとり得る値:$1, 2, 3, 4, 5, 6$
・確率:$P(X=1) = P(X=2) = \dots = P(X=6) = 1/6$

具体例ⅱ:全国の成人男性から1人ランダムに選ぶ

$X$ = 「その人の身長(cm)」とすると:
・$X$ がとり得る値:150cm〜200cmあたりの実数(170.3cmのような値も含む)
・サイコロと違って、とり得る値を $1, 2, 3, \dots$ と1個ずつ数え上げることができない

同じ「確率変数」でも、①と②はとり得る値のタイプが根本的に違います。この違いは 2 で詳しく扱います。

確率分布 (Probability Distribution)

確率変数 $X$ が「どの値をどの確率でとるか」を表すマップが確率分布です。

サイコロの確率分布:すべての目が等しく 1/6 = 離散一様分布

確率分布は「Xの取り得る値」を横軸、「その確率」を縦軸にしたグラフです。
確率分布のすべての値の合計は必ず 1(全事象の確率=1)。
2

離散 vs 連続

確率変数の2タイプ

1 の具体例ⅰ(サイコロ)と具体例ⅱ(身長)は、とり得る値のタイプが根本的に違いました。この違いで確率変数は2種類に分けられ、扱い方も変わります。

離散型 (Discrete)

飛び飛びの値だけをとる変数です(具体例ⅰのサイコロがこのタイプ)。
他の例:合格者数、コインの表回数

棒グラフ。各値ごとに「確率」を直接持つ

  • 確率関数 $f(x) = P(X=x)$
  • $\sum_x f(x) = 1$
  • $P(X=3)$ のように「ちょうどその値」の確率を直接求められる
連続型 (Continuous)

実数全体(区間)の値をとる変数です(具体例ⅱの身長がこのタイプ)。
他の例:体重、待ち時間、温度

曲線(密度)。区間の面積で確率を表す

  • 確率密度関数 $f(x)$(値そのものは確率ではない)
  • $\int f(x)\,dx = 1$(全体面積=1)
  • $P(X = a) = 0$。確率は一点ではなく区間で考える:$P(a \leq X \leq b)$
⚠️ 連続分布の重要な性質

①1点の値をとる確率は 0。
連続分布では「ある1点の値をとる確率は 0」です。例えば「身長がぴったり 170.000000... cm」になる確率は 0 です。意味があるのは「身長が 169 〜 171 cm の確率」のような区間の確率です(曲線の下の面積)。

②この曲線、実データのヒストグラムと何が違う?
実は同じものです。全国の男性の身長ヒストグラム(人数)を総人数で割って面積が1になるよう正規化すれば、この曲線とほぼ同じ形になります。曲線がなめらかなのは、実際のギザギザしたヒストグラムを正規分布という理論モデルで近似しているからです。つまりこの曲線は「全国の男性から1人ランダムに選んだときの身長の確率」を表しています。

累積分布関数(CDF)

本題に入る前に、似た略語が3つ出てくるので先に整理します。どれも英語の頭文字です。

略語英語(頭文字の元)日本語対象記号と意味
PMFProbability Mass Function確率関数離散型$f(x)=P(X=x)$ … 各値が持つ確率(棒の高さ)
PDFProbability Density Function確率密度関数連続型$f(x)$ … 曲線の高さ(密度。面積で確率)
CDFCumulative Distribution Function累積分布関数離散・連続 両方$F(x)=P(X\leq x)$ … $x$ 以下になる確率
記号:小文字 f と 大文字 F

・小文字 $f$(PMF・PDF)=その1点ぶんの確率や密度。
・大文字 $F$(CDF)=それを左端から足し上げた累積。
つまり「大文字 $F$ になったら積み上げ済みの合図」です。$F(x)=P(X \leq x)$ の $F$ が大文字なのはこのためです。
そしてPMF(離散)と PDF(連続)は別物ですが、それを積み上げた CDF はどちらの型でも同じように作れます。だから CDF は離散・連続のどちらにも使えます。

累積分布関数(CDF)
$$F(x) = P(X \leq x)$$

「$X$ が $x$ 以下になる確率」を全部足し合わせた合計です。$x$ を右へ動かすほど増え、最後は $1$ に達します。

「累積」とは確率が積み上がることです。離散型なら棒(確率)を左から足す、連続型なら曲線の下の面積を左から足します。足す対象は違っても、できあがる CDF はどちらも「$0$ から $1$ へ上る」同じ形になります。

CDF は離散でも連続でも作れる「共通の道具」
離散型(サイコロ1個) 連続型(身長) もとの確率:確率関数 PMF(棒) 各目とも 1/6 もとの確率:確率密度 PDF(曲線) ↓ 左から足し上げる ↓ 左から足し上げる 累積 CDF(階段状) 1 0 累積 CDF(なめらか) 1 0
上段(もとの確率)は離散なら棒、連続なら曲線で別物です。だが下段の累積 CDF は、どちらも 0 から 1 へ上る同じ道具になります(離散は階段、連続はなめらか)。
両方で計算してみる:$P(X \leq 3)$ などの出し方
  • 離散(サイコロ1個):$P(X \leq 3) = P(1)+P(2)+P(3) = \tfrac{1}{6}+\tfrac{1}{6}+\tfrac{1}{6} = \tfrac{1}{2}$ ← 棒を3本ぶん足す
  • 連続(成人男性の身長・平均170cm):$P(X \leq 170) = $ 左から170までの面積。この分布は左右対称なので、中心の170で面積はちょうど半分 $= 0.5$ ← 面積を足す

どちらも「左から足し上げる」だけです。足し方が和か面積(積分)かの違いで、考え方は同じです。これが CDF が共通の道具である理由です。

※ 上の $0.5$ は「左右対称だから」成り立つ値です。連続分布は対称とは限らず、待ち時間のように右に裾を引く(歪度>0)分布では、平均の位置での面積は $0.5$ になりません。

区間の確率は「引き算」で出る

$F(b)$ は「$b$ 以下の確率(左から $b$ までの面積)」、$F(a)$ は「$a$ 以下の確率」です。後者を引けば、$a$ と $b$ に挟まれた部分だけが残る:

$$P(a < X \leq b) = F(b) - F(a)$$ b F(b) b 以下の面積 = ∫ f(x)dx (-∞〜b) − a F(a) a 以下の面積 = ∫ f(x)dx (-∞〜a) = a b P(a<X≤b) a〜b の面積(残る部分)

↑ これは PDF(面積)での引き算。同じ引き算を CDF(縦の高さ)で見ると ↓

1 0 累積確率 F(x) CDF a F(a) b F(b) P(a<X≤b) = F(b) − F(a)(高さの差)

CDF 上なら、$F(b)$ と $F(a)$ の高さを読んで引くだけです。面積の差(上の図)=高さの差(この図)=区間の確率で、見方が違うだけの同じ値です。

3

期待値・分散・標準偏差

確率分布の「中心」と「ばらつき」を数値化

確率分布も第1章のデータ分布と同様に、「中心」と「ばらつき」で要約できます。実はこの3つ(期待値・分散・標準偏差)は、第1章でやった平均・分散・標準偏差の「確率分布版」です。まず対応を押さえましょう。

対応表:データ版 ↔ 確率分布版
測るもの記述統計(手元のデータ)確率分布(確率変数 $X$)
中心平均 $\bar{x}$期待値 $E[X] = \mu$
ばらつき分散 $s^2$分散 $V[X] = \sigma^2$
ばらつき標準偏差 $s$標準偏差 $\sigma = \sqrt{V[X]}$
重み各データ $\tfrac{1}{n}$(平等)各値の確率 $P(X=x)$

いちばん大事なのは、確率分布版では「平均」を「期待値」と呼び $E[\cdot]$ と書くことです。$E[\cdot]$ は「平均をとる」という操作で、$E[X]$ は「$X$ の平均」と読めます(以降「期待値」と「平均」はほぼ同義で使う)。
データ版との違いは重みだけです。データは全部 $\tfrac{1}{n}$ で平等に平均し、確率分布は各値を確率 $P(X=x)$ で重みづけて平均します。

期待値 $E[X]$:平均的にとる値

期待値(離散の場合)
$$E[X] = \mu = \sum_x x \cdot P(X=x)$$

「とり得る各値 × その確率」をすべて足します。
連続の場合は $E[X] = \int x \cdot f(x)\, dx$ です(積分になるだけ)。

直感:期待値は確率分布グラフの「重心」です。確率を「重さ」、値を「位置」と思えば、棒グラフがちょうどバランスを取るポイントです。
1 1/6 2 1/6 3 1/6 4 1/6 5 1/6 6 1/6 E[X] = 3.5(重心)

サイコロの期待値:$E[X] = (1+2+\dots+6) \times \frac{1}{6} = 3.5$ → グラフの重心です。

連続型でも考え方は同じです。棒グラフの重心が「曲線(面積)の重心」に変わるだけです。

160 180 E[X] = 170(重心)

身長 $X \sim N(170, 6^2)$ の期待値:$E[X] = \int x \cdot f(x)\, dx = 170$ → 曲線(面積)の重心です。左右対称な分布では、山の頂点がそのまま重心になります。

分散 $V[X]$ と標準偏差 $\sigma$

期待値が分布の「中心」なら、分散・標準偏差はその「散らばり(中心からのブレ)」を測る量です。冒頭の対応表のとおり、これも第1章の分散・標準偏差の確率版です。まず「分散が何を測るのか」を図で見てから、公式に進みます。

分散は「散らばり具合」を1つの数にする

期待値が同じでも、散らばり方が違えば分散は変わります。次の2つはどちらも期待値3ですが、分散はまるで違います。

分散 小(中心にかたまる) V[X] = 0.5 0.250.50.25 12345 期待値 3 分散 大(端に広がる) V[X] = 2.0 0.250.50.25 12345 期待値 3

どちらも平均は3で同じです。だが左は中心に集まり(分散0.5)、右は端へ広がります(分散2.0)。分散はこの「平均からの散らばり具合」を1つの数にしたものです。

この「散らばり具合」を数式にすると

分散と標準偏差
$$V[X] = \sigma^2 = E[(X - \mu)^2] = \sum_x (x - \mu)^2 \cdot P(X=x)$$ $$\;= E[X^2] - (E[X])^2 \quad \text{(計算しやすい別形)}$$ $$\sigma = \sqrt{V[X]}$$

分散は「期待値からのブレ($X-\mu$)の2乗」を確率で平均したものです。別形は「2乗の平均 − 平均の2乗」で、手計算がぐっと楽になります。

具体例:サイコロ1個の分散(2通りで確認)

$X$ = 出た目とすると、$E[X] = 3.5$ です。
① 定義どおり(各ズレの2乗 × 1/6 を合計):
$V[X] = \dfrac{(1-3.5)^2 + (2-3.5)^2 + \cdots + (6-3.5)^2}{6}$
$\qquad = \dfrac{6.25+2.25+0.25+0.25+2.25+6.25}{6} = \dfrac{17.5}{6} = \dfrac{35}{12} \approx 2.92$
② 別形(2乗の平均 − 平均の2乗):
$E[X^2] = \dfrac{1+4+9+16+25+36}{6} = \dfrac{91}{6}$
$\qquad V[X] = \dfrac{91}{6} - 3.5^2 = \dfrac{91}{6} - 12.25 = \dfrac{35}{12} \approx 2.92$
→ どちらも同じ $\tfrac{35}{12}$ です。標準偏差は $\sigma = \sqrt{35/12} \approx 1.71$ です。

期待値・分散の重要な性質

期待値・分散を変換したり組み合わせたりすると、どう変わるかには決まったルールがあります。ここで見るのは次の2つです:
・① 1次変換 $aX+b$:$X$ を定数倍して定数を足すと、期待値・分散はどう変わるか
・② 和 $X+Y$:2つの確率変数を足すと、期待値・分散はどう変わるか
どちらも推定・検定で繰り返し使う性質なので、ここでしっかり押さえます。

① 1次変換 $aX+b$(定数倍して足す)

性質:$X$ を $a$ 倍して $b$ を足すと、期待値も $a$ 倍されて $b$ だけ増えます。散らばり(分散)は $b$ の影響を全く受けず、$a$ 倍にした分だけ大きくなります(ただし $a$ の2乗倍)。

1次変換の期待値・分散
$$E[aX+b] = a\,E[X] + b$$ $$V[aX+b] = a^2\,V[X] \qquad \sigma_{aX+b} = |a|\,\sigma$$

期待値は素直に $a$ 倍して $b$ を足します。分散は$b$ に無関係で、$a$ の2乗倍になります。

なぜ分散は $b$ に無関係で $a$ の2乗倍になるのでしょうか。

+b(足し算)= 平行移動 元(期待値μ) +b → 中心が +b 移動 幅(散らばり)は同じ → 分散は変わらない ×a(定数倍)= 引き伸ばし 元(幅σ) ×2 → 幅が2倍に 横に a倍 引き伸ばし → σ は a倍、分散は a²倍

+b は分布を横にスライドさせるだけです(散らばり不変)。×a は横に引き伸ばします(σ が $a$ 倍 → 分散は $a^2$ 倍)。だから $V[aX+b]=a^2V[X]$ です。

具体例:サイコロくじの賞金(確率変数の期待値)

サイコロを1回振り、「出た目 $X$ × 100円」+「参加賞 50円」がもらえるくじを考えます。もらえる金額は $Y = 100X + 50$ です(円)。出た目は偶然で決まる確率変数なので、賞金 $Y$ も確率変数です。
出た目の期待値は $E[X]=3.5$、分散は $V[X]=\tfrac{35}{12}\approx2.92$ です($\sigma\approx1.71$)。よって:
・期待賞金 $E[Y] = 100\times 3.5 + 50 = $ 400円(=何回も引いたとき1回あたり平均してもらえる額)
・$V[Y] = 100^2 \times \tfrac{35}{12} \approx $ 29167($\sigma_Y = 100\times1.71 = 171$円)
参加賞50円は何が出ても必ずもらえる固定額なので、賞金のばらつきは変えません($+b$ は分散に無関係)。×100は「出目1つ分の差」を「100円の差」に拡大するので、ばらつき σ も100倍です(分散はその2乗で $100^2$ 倍)。

② 和 $X+Y$(2つを足す)

性質:2つの確率変数を足すと、期待値はいつでも足し算になります。分散も足し算になりますが、これは $X$ と $Y$ が独立のときだけ成り立ちます。

和の期待値・分散
$$E[X+Y] = E[X] + E[Y] \quad (\text{常に成立})$$ $$V[X+Y] = V[X] + V[Y] \quad (X,Y\ \text{が独立のとき})$$

期待値はいつでも足し算です。分散が足し算になるのは独立のときだけです。

サイコロ1個 X(一様・せまい) 期待値3.5 σ≈1.71 2個の和 X+Y(三角・ひろい) 期待値7 σ≈2.42

サイコロ1個(上)より2個の和(下)のほうが、中心が右へ動き(3.5→7=期待値が足し算)、かつ横に広がります(σ 1.71→2.42=独立なので分散が足し算)。

具体例:独立な2つのサイコロの和

各サイコロ $E=3.5$、$V=\tfrac{35}{12}\approx2.92$ です。和 $X+Y$ は:
・$E[X+Y] = 3.5 + 3.5 = $ 7
・$V[X+Y] = \tfrac{35}{12} + \tfrac{35}{12} = \tfrac{35}{6} \approx $ 5.83($\sigma \approx 2.42$)
独立なので分散をそのまま足せます。期待値は独立でなくても足せます。

⚠️ よくある誤り

① 分散の足し算は独立のときだけ。 一般には共分散が入る:
$V[X+Y] = V[X] + V[Y] + 2\,\text{Cov}(X, Y)$
例:2銘柄の株が連動($\text{Cov}>0$)すると、合計のばらつきは単純な和より大きくなります。逆に逆相関($\text{Cov}<0$)なら打ち消し合って小さくなります。これが分散投資でリスクを下げる原理です。
② 標準偏差は足せない。 $\sigma_{X+Y} \neq \sigma_X + \sigma_Y$(独立でも足せるのは分散の方。$\sigma_{X+Y}=\sqrt{\sigma_X^2+\sigma_Y^2}$)。

4

離散型の代表分布

飛び飛びの値をとる「定番パターン」5つ

世の中の確率現象には頻出のパターンがいくつかあり、それぞれ名前が付いています。離散型では検定2級で押さえるべき分布が5つあります。

① ベルヌーイ分布:1回試行の成功/失敗

ベルヌーイ分布 $\text{Be}(p)$

1回の試行で成功($X=1$)か失敗($X=0$)かを表す確率変数:

$$P(X=1) = p,\quad P(X=0) = 1-p$$

$E[X] = p$、$V[X] = p(1-p)$

「コインで表が出るか」「広告がクリックされるか」「サイコロで6が出るか」など、結果が2択(成功/失敗)になる試行はすべてベルヌーイ分布です。とり得る値は0と1だけなので、グラフは棒2本です。

ベルヌーイ分布(p=0.3 の例) 1.0 0.5 0 P(X=x) 0.7(=1−p) 失敗 X=0 0.3(=p) 成功 X=1

成功確率 $p$ の棒(X=1)と、残り $1-p$ の棒(X=0)だけです。2本の高さを足すと1 です。

具体例:広告を1回表示してクリックされるか

クリック確率 $p=0.2$、$X=1$(クリック)/$X=0$(クリックしない)とします。
・$E[X] = 0.2$(1回表示あたり平均0.2回クリック=クリック率)
・$V[X] = 0.2 \times 0.8 = 0.16$($\sigma = 0.4$)

公式は覚えなくて大丈夫です。その場で出せます。(とはいえ試験では覚えた方が速くて楽)
期待値:$E[X] = 1\cdot p + 0\cdot(1-p) = p$ です。0か1しかとらないので、期待値は「1になる確率 $p$」と一致します。
分散:ここがポイントです。$X$ は0か1だけなので $X^2 = X$ です($0^2=0,\ 1^2=1$)。よって $E[X^2] = E[X] = p$ です。これを別形に入れると:
$V[X] = E[X^2] - (E[X])^2 = p - p^2 = p(1-p)$

なぜ分散が $p(1-p)$ ?「五分五分」で最大、「確実」でゼロ

分散は「どちらに転ぶか分からない度合い」です。必ず成功($p=1$)や必ず失敗($p=0$)なら結果は確定していてバラつかない→分散0 です。最も読めないのは五分五分($p=0.5$)で分散は最大です。$p(1-p)$ はちょうどこの山なりの形になります。

0.25 0 分散 V[X] 最大 V=0.25 00.51 必ず失敗五分五分必ず成功 p(成功確率)

横軸=成功確率 $p$、縦軸=分散。$p=0$・$p=1$(結果が確実)なら分散0、$p=0.5$(最も読めない)で最大 0.25 です。この山なりがちょうど $V=p(1-p)$ です。

② 二項分布:$n$ 回試行の成功回数

二項分布 $\text{B}(n, p)$

成功確率 $p$ の試行を独立に $n$ 回繰り返したときの、成功回数 $X$ の分布:

$$P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}\quad (k = 0,1,\dots,n)$$

$E[X] = np$、$V[X] = np(1-p)$

※ $\binom{n}{k}$ は組み合わせの数 $_nC_k$

具体例:合格者数の確率

ある試験の合格率は 30% です。5人受験したとき、ちょうど 2人が合格する確率は?
$X \sim \text{B}(5, 0.3)$ で $P(X=2) = \binom{5}{2} (0.3)^2 (0.7)^3 = 10 \times 0.09 \times 0.343 \approx $ 0.309

期待値・分散も暗記不要です。ベルヌーイ ×$n$ です。 二項分布は独立なベルヌーイ試行($E=p$, $V=p(1-p)$)を $n$ 回足したものなので、期待値・分散もそれぞれ $n$ 倍です。だから $E[X]=np$、$V[X]=np(1-p)$ です。

$p$ で形がどう変わる?($n=10$ 固定)

p = 0.2(左寄り)
p = 0.5(左右対称)
p = 0.8(右寄り)

$p$ が小さいと左に偏り、$p = 0.5$ で左右対称、$p$ が大きいと右に偏ります。$n$ が大きくなると形がだんだん正規分布に似てきます(中心極限定理、第6章で)。

③ 幾何分布:初めて成功するまでの試行回数

幾何分布 $\text{Geo}(p)$

成功確率 $p$ の試行を繰り返し、初めて成功するまでの試行回数 $X$ の分布:

$$P(X = k) = (1-p)^{k-1} \cdot p \quad (k = 1, 2, 3, \dots)$$

$E[X] = \dfrac{1}{p}$、$V[X] = \dfrac{1-p}{p^2}$

直感:「$k-1$ 回失敗してから、$k$ 回目に成功」というシナリオの確率です。
$p$ が小さいほど成功までの平均試行回数 $1/p$ が大きくなります(直感通り)。

$p = 0.3$ の幾何分布です。指数的に減衰するのが特徴です。

具体例ⅰ:サイコロで初めて6が出るまでの回数

$p = 1/6$ の幾何分布です。
・$P(X=1)$(一発で6):$1/6 \approx 0.167$
・$P(X=3)$(3回目で初6):$(5/6)^2 \cdot (1/6) \approx 0.116$
・期待値 $E[X] = 1/(1/6) = $ 6 回(平均的に6回投げれば1回6が出る)

具体例ⅱ:大当たり確率 1/319 のパチンコで初当たりまでの回転数

$p = 1/319$ の幾何分布です。$E[X] = 319$ 回ですが、分布の形はサイコロのときと同じ「単調減少」のままです。$p$ が小さくなった分、裾が数百回先まで長く伸びて、全体になだらかに引き伸ばされます。

1回目 1000回目 E[X] = 319回

山なりの正規分布にはならず、初回が最も確率が高く、そこから緩やかに減っていく形が最後まで続きます。$p\to0$ の極限では、この形は連続版の指数分布に近づきます。

幾何分布の拡張:負の二項分布

幾何分布は「初めて成功するまで」でした。これを「$r$ 回目の成功が出るまで」に広げたものが負の二項分布です。営業で「契約が3件取れるまで訪問を続ける」、ガチャで「当たりが3枚そろうまで引く」といった場面です。

負の二項分布($r$ 回目の成功までの試行回数)
$$P(X = k) = \binom{k-1}{r-1}\, p^{r} (1-p)^{k-r} \quad (k = r, r+1, \dots)$$

$E[X] = \dfrac{r}{p}$、$V[X] = \dfrac{r(1-p)}{p^2}$(幾何分布の $r$ 倍)

式の読み方:最後の $k$ 回目は必ず成功なので、残る $k-1$ 回のうちどこに $r-1$ 回の成功を置くかが $\binom{k-1}{r-1}$ 通り、あとは成功 $r$ 回と失敗 $k-r$ 回の確率を掛けるだけです。$r=1$ とすると幾何分布の式に戻ります。

具体例ⅲ:サイコロで6が2回出るまで振る。ちょうど5回目に2回目の6が出る確率は?

成功=6が出る($p=\tfrac16$)、$r=2$、$k=5$ です。 「5回目に2回目の6が出る」とは、5回目は必ず6で、1〜4回目のどこか1回だけ6が出て、残り3回は6以外ということです。 1〜4回目のどこに6を置くかは4通りしかありません:

6✗✗✗6
✗6✗✗6
✗✗6✗6
✗✗✗66
5回目:必ず6(固定)
1〜4回目のどこかに6が1回 → $\binom{4}{1}=4$ 通り
6以外(3回)

$P(X=5) = \underbrace{\binom{4}{1}}_{\text{6の置き場所}} \times \underbrace{\left(\tfrac16\right)^2}_{\text{6が2回}} \times \underbrace{\left(\tfrac56\right)^3}_{\text{6以外が3回}} = 4 \times \tfrac{1}{36} \times \tfrac{125}{216} \approx $ 0.064(約6.4%)

公式の $\binom{k-1}{r-1}$ は「最後の1回を除いた $k-1$ 回のうち、残り $r-1$ 回の成功をどこに置くか」の数です。ここでは $\binom{4}{1}$ でした。

r = 1(初めて6が出るまで=幾何分布)151015202530試行回数 k期待値 1/(1/6) = 6 r = 2(2回目の6が出るまで)151015202530試行回数 k期待値 2/(1/6) = 12
どちらもサイコロの6($p=1/6$)で、左が $r=1$、右が $r=2$ です。$r$ が増えると山は右へ動き、幅も広がります。「幾何分布を $r$ 個足したもの」なので、期待値も分散も幾何分布の $r$ 倍になります。

※「負の」と付きますが、意味的に負のものはありません。確率の式が「指数が負の二項展開 $(1-q)^{-r}$」から出てくる、という数式上の由来です(二項分布は $(p+q)^n$ の展開から出てきます)。

※ 教科書によっては「$r$ 回目の成功までの失敗回数」で定義することもあります。そのときは $k$ が $0$ から始まり、期待値は $r(1-p)/p$ です。試験ではどちらの定義かが問題文に書かれます。

④ 超幾何分布:非復元抽出の成功回数

超幾何分布 $\text{HG}(N, K, n)$

$N$ 個の中に「成功」とみなすものが $K$ 個あります。戻さずに $n$ 個取り出したときの成功個数 $X$ の分布:

$$P(X = k) = \frac{\binom{K}{k} \binom{N-K}{n-k}}{\binom{N}{n}}$$

$E[X] = n \cdot \dfrac{K}{N}$(二項分布と同じ形)

$$V[X] = \underbrace{n \cdot \dfrac{K}{N} \cdot \dfrac{N-K}{N}}_{\text{二項分布の分散}} \;\times\; \underbrace{\dfrac{N-n}{N-1}}_{\text{有限修正項}}$$

分散の本体は二項分布の分散です。そこに「戻さない分だけ結果が偏る」ことを表す有限修正項(必ず1以下)を掛けているだけです。ここは丸暗記より構造の理解を優先でOKです。

二項分布との違い:第3章で学んだ「復元 vs 非復元」の話です。
・復元(戻す)→ 各回が独立 → 二項分布を使う
・非復元(戻さない)→ 各回の確率が変わる → 超幾何分布を使う
→ 有限修正項 $\dfrac{N-n}{N-1}$ は $n=N$(全部抜き取り)に近づくほど$0$ に近づく(毎回同じ結果になるので分散はなし)。逆に $N$ が $n$ よりずっと大きければ $\approx 1$ で、二項分布とほぼ一致します。
具体例:30個のうち5個が不良品、10個抜き取りでの不良数

$N=30$, $K=5$, $n=10$ です。ちょうど $X=2$ 個が不良である確率:
$P(X=2) = \dfrac{\binom{5}{2}\binom{25}{8}}{\binom{30}{10}} = \dfrac{10 \times 1081575}{30045015} \approx \mathbf{0.360}$
期待値:$E[X] = 10 \times \dfrac{5}{30} \approx 1.67$ 個
分散:$V[X] = \underbrace{10 \times \dfrac{5}{30} \times \dfrac{25}{30}}_{\text{二項なら}\approx 1.389} \times \underbrace{\dfrac{20}{29}}_{\text{有限修正}\approx 0.690} \approx \mathbf{0.958}$ 個²

⑤ ポアソン分布:単位時間あたりの稀な事象数

ポアソン分布 $\text{Po}(\lambda)$

単位時間あたり平均 $\lambda$ 回起こる出来事の発生回数 $X$ の分布:

$$P(X=k) = \frac{\lambda^k e^{-\lambda}}{k!}\quad (k = 0,1,2,\dots)$$

$E[X] = \lambda$、$V[X] = \lambda$(期待値と分散が等しい!)

使う場面:

  • 1時間にコールセンターにかかってくる電話の本数
  • 1日に交通事故が起こる件数
  • 1ページあたりの誤植の数
  • 1平方キロあたりの落雷回数

$\lambda = 3$ のポアソン分布

具体例:コールセンターの電話(1時間に平均 $\lambda=3$ 件)

ある1時間に…
・ちょうど5件かかる:$P(X=5) = \dfrac{3^5\, e^{-3}}{5!} = \dfrac{243 \times 0.0498}{120} \approx$ 0.101(約10%)
・1件も来ない:$P(X=0) = \dfrac{3^0 e^{-3}}{0!} = e^{-3} \approx$ 0.050(約5%)
・2件以下:$P(X\le2) = e^{-3}\!\left(\dfrac{3^0}{0!}+\dfrac{3^1}{1!}+\dfrac{3^2}{2!}\right) = e^{-3}\times 8.5 \approx$ 0.423(約42%)

二項分布との関係:$n$ が大きく、$p$ が小さく、$np = \lambda$ が一定のとき、二項分布 $\text{B}(n, p)$ はポアソン分布 $\text{Po}(\lambda)$ に近づきます。
→ 「めったに起こらないことが多くの機会で観測される」状況のモデル化に使えます。
まとめ:5つの離散分布
分布シナリオ$E[X]$$V[X]$
ベルヌーイ Be($p$)1回の成功/失敗$p$$p(1-p)$
二項 B($n,p$)$n$ 回試行の成功回数(復元)$np$$np(1-p)$
幾何 Geo($p$)初成功までの試行回数$1/p$$(1-p)/p^2$
超幾何 HG($N,K,n$)非復元での成功回数$nK/N$※
ポアソン Po($\lambda$)単位時間の稀な事象数$\lambda$$\lambda$

※ 超幾何の分散は「二項の分散 $np(1-p)$($p=K/N$)」に補正係数 $\frac{N-n}{N-1}$ を掛けた形です。丸暗記は不要で、「非復元だと二項よりばらつきが少し小さくなる」と押さえれば十分です。

5

連続型の代表分布

一様・指数・正規:主役は正規分布

連続型では3つの代表分布を押さえます。検定2級では正規分布が圧倒的に主役ですが、一様分布と指数分布も簡単に触れておきます。

一様分布 U(a,b)

区間の中で等確率

指数分布 Exp(λ)

待ち時間のモデル

正規分布 N(μ,σ²)

釣鐘型、統計の主役

① 一様分布

一様分布 $U(a, b)$
$$f(x) = \begin{cases} \dfrac{1}{b - a} & (a \leq x \leq b) \\ 0 & \text{otherwise} \end{cases}$$
面積=1 a b f(x)=0 f(x)=0 高さ 1/(b-a) 幅 b-a

$a$:分布が始まる値、$b$:分布が終わる値です(例えば「10分間隔のバスの待ち時間(0〜10分)」なら $a=0,\,b=10$)。幅 $(b-a)$ と高さ $\frac{1}{b-a}$ をかけると、どんな $a,b$ でも面積はちょうど $1$ です。

$E[X] = \dfrac{a + b}{2}$、$V[X] = \dfrac{(b - a)^2}{12}$

直感:区間 $[a, b]$ のどの場所も等しく現れます。連続版の「サイコロの目」のような分布です。
確率は区間の長さに比例:$P(c \leq X \leq d) = \dfrac{d - c}{b - a}$
具体例:バスの待ち時間

バスが10分間隔で来るバス停に、時刻表を見ずに着いたとします。このとき待ち時間 $X$ は $U(0, 10)$ に従います。平均で何分待つことになるでしょうか。また、3分以内にバスが来る確率はどれくらいでしょうか。

E[X]=5 f(x)=1/10 0 3 5 10(分) 面積 =0.3

高さ一定 $\frac{1}{10}$ の「屋根」が $0$〜$10$ に広がります。確率は面積なので、$0$〜$3$ の部分(紫の濃い箇所)の面積 $=3\times\frac{1}{10}=0.3$ がそのまま $P(X\leq3)$ です。

・平均待ち時間:$E[X] = \dfrac{0+10}{2} = 5$ 分
・3分以内に来る確率:$P(X \leq 3) = \dfrac{3-0}{10-0} = \mathbf{0.3}$

② 指数分布

「次のイベント(電話・客の到着・故障など)が起こるまでの待ち時間」を表す連続分布です。まず式と形を見て、すぐに例題で「どう使うか」をつかみます。

指数分布 $\text{Exp}(\lambda)$
$$f(x) = \lambda e^{-\lambda x} \quad (x \geq 0)$$

$E[X] = \dfrac{1}{\lambda}$(平均待ち時間)、$V[X] = \dfrac{1}{\lambda^2}$
$\lambda$ = 単位時間あたりの平均発生率

例題:5分以内に次が来る確率は?

コールセンターに1時間あたり平均6本の電話が来るとします(発生率 $\lambda=6$ /時)。「次の電話までの待ち時間」を $X$ とすると、$X$ は指数分布に従います($X \sim \text{Exp}(6)$ です。「$\sim$」は「この分布に従う」の意味です)。平均待ち時間は $E[X]=\tfrac{1}{6}$時間 = 10分。さて、「5分以内に次が来る確率」は?

まず分布の「形」をつかむ

密度 $f(x)$ は $x=0$ で最大、右へ指数的に減る右下がりの曲線です。「待ち時間は短いほどありがちで、長くなるほど稀」を表します。山型ではなく、0 が一番高いのが特徴です。

直感:時間を「毎瞬間、一定確率で当たりが出るくじ引き」の連続だと考えると分かりやすくなります。例えば、$x=15$分の瞬間に当たるには、その前の15分間ずっと外れ続けている必要があります。外れ続けて生き残っている人はどんどん減っていくので、$x$ が大きい時刻ほど「そこまで残っている母数」自体が小さくなります。だから山は $0$ が一番高く、右へ行くほど低くなります。

指数分布の形(縦軸 = 確率密度) f(5) = この「高さ」 = 確率密度(確率ではない!) 確率密度 010203040 5 時間(分)
⚠️ 落とし穴:式に 5 を代入しても「確率」は出ない

つい $f(5)$ を計算したくなりますが、それで出るのは上のグラフの高さ(確率密度)であって確率ではありません。連続分布では「ちょうど5分」のような1点の確率は 0(本章 2 の鉄則)。確率は必ず曲線の下の「面積」で考えます。
→ だから「5分以内に来る確率」= 0〜5分の区間の面積 = $P(X \le 5)$ です。

では「面積(確率)」をどう出すか

この面積を直接出すより、「5分過ぎても来ない」面積(右側)= $P(X > 5)$ を先に出す方がラクです。これは $e^{-\lambda t}$ という素直な形で書けるからです(理由は下の囲み)。あとは全体(面積1)から引けば「来る」が出ます。

確率 = 面積(高さではない) 010203040 5 時間(分) 5分以内に来る =左の面積 = 0.393 5分過ぎても来ない =右の面積 = 0.607

左(紫)+右(灰)= 全面積 1。求めたい「5分以内に来る」は左の面積です。

$P(X > 5\text{分}) = e^{-\lambda t} = e^{-6 \times \frac{5}{60}} \approx 0.607$(来ない・右の面積)
$\Rightarrow\; P(X \le 5\text{分}) = 1 - 0.607 = $ 0.393(来る・左の面積、約39%)

※ 時間 $t$ は $\lambda$ と単位をそろえ、5分 = $\tfrac{5}{60}$ 時間です。$1-$ で引くのは「来る=来ないの反対(余事象)」だからです。

なぜ「来ない確率」が $e^{-\lambda t}$ なのでしょうか。 ポアソンのときと同じ発想で、時間 $t$ を $n$ 個の小区間に刻みます。$\lambda$ は単位時間あたりの平均回数なので、時間 $t$ の間には平均 $\lambda t$ 回、1区間あたりでは平均 $\dfrac{\lambda t}{n}$ 回来ます。
時間 t を n 個の小区間に分割(図は n=24) 1区間:平均 λt/n 回 → 来る λt/n / 来ない 1−λt/n 0 t 全体で平均 λt 回
区間が十分細かければ「平均 $\dfrac{\lambda t}{n}$ 回」は「確率 $\dfrac{\lambda t}{n}$ で1回来る」と同じことなので、1区間で「来ない」確率は $1-\dfrac{\lambda t}{n}$ です。
例えば $\lambda=6$ 件/時間、$t=1$ 時間を1分刻み($n=60$)にすると、1分あたり平均 $0.1$ 件、つまり「来る $0.1$/来ない $0.9$」です。
$t$ の間ずっと来ない=全区間で来ないなので、これを $n$ 回かけて $\left(1-\dfrac{\lambda t}{n}\right)^{n}$ です(例では $0.9^{60}\approx 0.002$)。区間を無限に細かく($n\to\infty$)すると $e^{-\lambda t}$ になります(例では $e^{-6}\approx 0.0025$。刻みを細かくするほどこの値に近づきます)。
直感:各瞬間の「来ない」をかけ合わせるので、待ち時間が伸びるほど確率は指数関数的に減ります($\lambda$ が大きい、つまりよく来るほど速く減る)。
来ない確率 P(X > t) の減り方 1 0 0.607 P(X > 5)=0.607 010203040 5 待ち時間 t(分)

$P(X>t)=e^{-\lambda t}$:待ち時間 $t$ が伸びるほど指数的に 0 へ近づきます($t=5$分で 0.607)。これが「来ない確率」の正体です。

ポアソン分布との関係(双子):ポアソン分布が「単位時間に何回起こるか(回数)」なら、指数分布は「次に起こるまでの時間(待ち時間)」です。同じ現象を「回数」と「間隔」の2つの角度から見たものです。だから上の導出でも、来ない確率 $e^{-\lambda t}$ がポアソンと同じ形で現れます。
⚠️ 無記憶性(指数分布の特徴)

指数分布には無記憶性がある:「すでに $s$ 分待っていても、そこから $t$ 分以内に来る確率は、最初から $t$ 分以内に来る確率と同じ」です。
→ この性質は、機械の寿命のような「使うほど劣化するもの」には当てはまりません(古い機械ほど壊れやすいから)。一方、コールセンターへの電話のようにいつ起きても不思議ではない、完全にランダムな現象(ポアソン過程)では成り立ちます。

③ 正規分布

正規分布(ガウス分布)は統計学で最も重要な連続分布です。身長・体重・テスト点数・測定誤差など、自然界のあらゆる「多数の小さな要因が積み重なって生じるばらつき」がこの形になります。

正規分布 $N(\mu, \sigma^2)$
$$f(x) = \frac{1}{\sqrt{2\pi}\,\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)$$

暗記不要!統計検定2級では式の暗記が必要な問題は出題されません。

・平均 $\mu$、分散 $\sigma^2$ の2つのパラメータで形が決まる
・$\mu$ で中心の位置、$\sigma$ で広がりが決まる
・左右対称、$\mu$ で最大値

記号の読み方:$X \sim N(\mu,\ \sigma^2)$

・$\sim$ は「この分布に従う」の意味です。左が値のブレる量、右がそのブレ方の名前です。
・$N$ は正規分布です(Normal)。カッコの中は $N(\,$ 平均 $,\ $ 分散 $\,)$ の順に書きます。

⚠️ カンマの後ろは分散 $\sigma^2$ であって、標準偏差 $\sigma$ ではありません。
たとえば「平均 $170$、標準偏差 $6$」の分布は $N(170,\ 36)$ と書きます($6$ ではなく $6^2=36$)。ばらつきを使うときは、まず平方根をとると覚えておくと安全です。

68-95-99.7 ルール

正規分布では、平均からの距離($\sigma$ の倍数)と中に含まれるデータの割合が正規分布の密度関数から数学的に決まるため、$\sigma$ 何個分かを覚えておけば即座に確率が分かります。

$\mu \pm 1\sigma$:約 68%
$\mu \pm 2\sigma$:約 95%
$\mu \pm 3\sigma$:約 99.7%
覚える数値:68・95・99.7
  • $\mu \pm 1\sigma$ の範囲に 約 68% のデータが入る
  • $\mu \pm 2\sigma$ の範囲に 約 95% が入る ← 信頼区間で大活躍
  • $\mu \pm 3\sigma$ の範囲に 約 99.7% が入る

※ より正確には95%に対応するのは $1.96\sigma$ です(≒ 2σ)。検定・推定では1.96という数値がよく出てきます。

標準化と標準正規分布

$\mu, \sigma$ が異なる正規分布たちを、共通の物差しで扱えるようにしたいところです。そのための変換が標準化です。

$$Z = \frac{X - \mu}{\sigma}$$

$X \sim N(\mu, \sigma^2)$ から標準化された $Z$ は、必ず $N(0, 1)$(標準正規分布) に従います。

標準化のステップを目で見る
1
元の分布
(出発点)

$X \sim N(60, 10^2)$

2
平均を引く
(中心を 0 に)

$X - 60 \sim N(0, 10^2)$

3
標準偏差で割る
(広がりを 1 に)

$Z = \frac{X-60}{10} \sim N(0, 1)$

標準正規分布表($z$ 表)

68-95-99.7 ルールが使えるのは、境界がちょうど $\mu \pm 1\sigma,\ \mu \pm 2\sigma,\ \mu \pm 3\sigma$ に当たる場合だけです。でも試験で問われる値はたいてい半端で、標準化すると $z = 1.43$ のような数になります。片側だけの確率を聞かれることもあります。

ここで役に立つのが、標準化すると必ず同じ $N(0,1)$ ただ1つにそろうことです。形が1つに決まっているなら、「$z$ がある値より外側になる確率(=裾の面積)」をあらかじめ計算して一覧にしておけます。これが標準正規分布表(略して確率表/$z$ 表)です。元が $N(170, 5^2)$ でも $N(60, 10^2)$ でも、標準化さえすればこの1枚の表だけで確率が読めるようになります。

0 u Q(u)
表の数値は、$u$ より右側の裾の面積 $Q(u)$ です。縦の見出しが $u$ の小数第1位まで、横の見出しが小数第2位を表します。

※ 分布表には「$u$ 以上の確率(上側確率)」を載せた型と、「$0$ から $u$ までの確率」を載せた型の2種類があります。統計検定2級で配られるのは前者です。

$u$.00.01.02.03.04.05.06.07.08.09
0.00.50000.49600.49200.48800.48400.48010.47610.47210.46810.4641
0.10.46020.45620.45220.44830.44430.44040.43640.43250.42860.4247
0.20.42070.41680.41290.40900.40520.40130.39740.39360.38970.3859
0.30.38210.37830.37450.37070.36690.36320.35940.35570.35200.3483
0.40.34460.34090.33720.33360.33000.32640.32280.31920.31560.3121
0.50.30850.30500.30150.29810.29460.29120.28770.28430.28100.2776
0.60.27430.27090.26760.26430.26110.25780.25460.25140.24830.2451
0.70.24200.23890.23580.23270.22960.22660.22360.22060.21770.2148
0.80.21190.20900.20610.20330.20050.19770.19490.19220.18940.1867
0.90.18410.18140.17880.17620.17360.17110.16850.16600.16350.1611
1.00.15870.15620.15390.15150.14920.14690.14460.14230.14010.1379
1.10.13570.13350.13140.12920.12710.12510.12300.12100.11900.1170
1.20.11510.11310.11120.10930.10750.10560.10380.10200.10030.0985
1.30.09680.09510.09340.09180.09010.08850.08690.08530.08380.0823
1.40.08080.07930.07780.07640.07490.07350.07210.07080.06940.0681
1.50.06680.06550.06430.06300.06180.06060.05940.05820.05710.0559
1.60.05480.05370.05260.05160.05050.04950.04850.04750.04650.0455
1.70.04460.04360.04270.04180.04090.04010.03920.03840.03750.0367
1.80.03590.03510.03440.03360.03290.03220.03140.03070.03010.0294
1.90.02870.02810.02740.02680.02620.02560.02500.02440.02390.0233
2.00.02280.02220.02170.02120.02070.02020.01970.01920.01880.0183
2.10.01790.01740.01700.01660.01620.01580.01540.01500.01460.0143
2.20.01390.01360.01320.01290.01250.01220.01190.01160.01130.0110
2.30.01070.01040.01020.00990.00960.00940.00910.00890.00870.0084
2.40.00820.00800.00780.00750.00730.00710.00690.00680.00660.0064
2.50.00620.00600.00590.00570.00550.00540.00520.00510.00490.0048
2.60.00470.00450.00440.00430.00410.00400.00390.00380.00370.0036
2.70.00350.00340.00330.00320.00310.00300.00290.00280.00270.0026
2.80.00260.00250.00240.00230.00230.00220.00210.00210.00200.0019
2.90.00190.00180.00180.00170.00160.00160.00150.00150.00140.0014
3.00.00130.00130.00130.00120.00120.00110.00110.00110.00100.0010

読み方を1つ試してみます。たとえば $z$ が 1.43 以上になる確率を知りたいとします。$1.43$ を「$1.4$」と「$0.03$」に分解して、 縦の見出しから 1.4 の行、横の見出しから .03 の列をたどり、交わったマス(表の黄色い箇所)を読みます。

$P(Z \geq 1.43) = \mathbf{0.0764}$(約 7.6%)

表が載せているのは右側の裾だけなので、「$1.43$ 以下の確率」を聞かれたら全体の1から引いて $1-0.0764=0.9236$ とします。 左側($z$ が負)の確率も、左右対称なので $P(Z \leq -1.43) = P(Z \geq 1.43) = 0.0764$ と読み替えられます。

具体例:確率表を引いて確率を出す

ある集団の身長 $X$ が $N(170,\ 6^2)$ に従うとします(単位は cm)。身長が 180cm 以上の人は、この集団の何%いるでしょうか。

まず標準化します。$z = \dfrac{180-170}{6} = 1.67$ です。あとは上の表で「$1.6$ の行」と「$.07$ の列」が交わるマスを読むだけです。

$P(X \geq 180) = P(Z \geq 1.67) = \mathbf{0.0475}$(約 4.8%)

正規分布どうしを足すと、また正規分布になる(再生性)

独立な正規分布を足したり引いたりしても、結果はまた正規分布になります。平均は足し算、分散も足し算(引き算のときも分散は足す)です。これを再生性といいます。

具体例:電車とバスの通勤時間の合計

電車の所要時間 $X \sim N(30,\ 4^2)$、バスの所要時間 $Y \sim N(20,\ 3^2)$ で、互いに独立とします(単位は分)。通勤時間の合計 $X+Y$ が 60 分を超える確率はどれくらいでしょうか。

合計 $X+Y$ も正規分布で、平均は $30+20=50$、分散は $4^2+3^2=25$(標準偏差 5)です。つまり $X+Y \sim N(50,\ 5^2)$ です。
あとは標準化して $z$ 表を引くだけです:

$P(X+Y > 60) = P\left(Z > \dfrac{60-50}{5}\right) = P(Z > 2) \approx \mathbf{0.023}$

標準偏差は $4+3=7$ ではなく $\sqrt{4^2+3^2}=5$ です。足せるのは分散のほうで、標準偏差は足せません。

6

多変量確率分布

複数の確率変数が「同時に」とる値の確率パターン

ここまでは1つの確率変数 $X$ を扱ってきましたが、現実には複数の変数を同時に考えたい場面が多くあります。例:身長と体重、株Aと株Bのリターン、応募者の学力と内定率などです。

第2章との繋がり:第2章では「標本データ」の2変数(散布図・共分散・相関係数)を扱いました。本節は確率変数版の同じ概念です。

同時確率分布 (Joint Distribution)

同時分布
$$P(X = x, Y = y) = f(x, y)$$

$X$ と $Y$ が同時にそれぞれの値をとる確率です。離散なら表、連続なら2変数密度関数で表します。

具体例:100人の血液型と性別

$X$ = 血液型(A/B/O/AB)、$Y$ = 性別(男/女)の同時分布(確率で表記):

A型B型O型AB型$P(Y)$
男0.190.100.140.050.48
女0.210.100.160.050.52
$P(X)$0.400.200.300.101.00

・黄色のセル:周辺分布(後述)
・紫のセル:全体合計(必ず 1)

周辺分布 (Marginal Distribution)

同時分布の表から、片方の変数だけの分布を取り出したものが周辺分布です。やることは足し算だけで、$X$ の分布が知りたければ $Y$ の全パターンを足し合わせます。表でいえば列を足すと $X$ の周辺分布、行を足すと $Y$ の周辺分布になります。合計を表の端(margin)に書くことから「周辺」と呼ばれます。

条件付き分布 (Conditional Distribution)

条件付き分布
$$P(Y = y \mid X = x) = \frac{P(X = x, Y = y)}{P(X = x)}$$

「$X = x$ が分かっているとき」の $Y$ の分布です。第4章の条件付き確率と同じ式です。

具体例:A型と分かっているときの性別分布

上の表で「血液型がA型」と分かっているとき、男性である確率:
$P(\text{男} \mid \text{A型}) = \dfrac{P(\text{男, A型})}{P(\text{A型})} = \dfrac{0.19}{0.40} \approx $ 0.475
$P(\text{女} \mid \text{A型}) = \dfrac{0.21}{0.40} \approx $ 0.525

※ 全体での男:女 = 0.48:0.52 とほぼ同じ比率 → A型と性別はほぼ独立です。

確率変数の独立性

独立性の定義

$X$ と $Y$ が独立とは、すべての $x,\ y$ で次が成り立つことです:

$$\begin{aligned} P(X = x,\ Y = y) \\ = P(X = x) \cdot P(Y = y) \end{aligned}$$

同値:$P(Y \mid X) = P(Y)$($X$ を知っても $Y$ の確率が変わらない)

表での見分け方:すべてのセルで「同時確率 = 周辺確率の積」になっていれば独立です。
例:$P(\text{男, A型}) = 0.19$、$P(\text{男}) \cdot P(\text{A型}) = 0.48 \times 0.40 = 0.192$
→ ほぼ一致 → ほぼ独立と判定できます。

共分散と相関係数(確率変数版)

共分散
$$\begin{aligned} \text{Cov}(X, Y) &= E[(X - \mu_X)(Y - \mu_Y)] \\ &= E[XY] - E[X] \cdot E[Y] \end{aligned}$$
相関係数
$$\rho_{XY} = \frac{\text{Cov}(X, Y)}{\sigma_X \cdot \sigma_Y}, \quad -1 \leq \rho_{XY} \leq 1$$
対応表:第2章 vs 第5章
概念第2章(標本データ)第5章(確率変数)
平均$\bar{x}$$\mu = E[X]$
分散$s^2$$\sigma^2 = V[X]$
共分散$s_{xy}$$\text{Cov}(X, Y)$
相関係数$r$$\rho_{XY}$

標本側はデータから計算する「実測値」、確率変数側は分布から決まる「真の値」です。第7章で「標本から確率変数の母数を推定する」関係になります。

独立 vs 無相関:
・独立 ⇒ 無相関($\text{Cov} = 0$):常に成立
・無相関 ⇒ 独立:成立しない(非線形な依存関係がある場合)
→ 相関係数は線形関係しか捉えられません(第2章 罠③ と同じ)。

2変量正規分布

身長と体重のように、2つとも正規分布に従い、しかも互いに相関がある組を1つの分布として扱ったものが2変量正規分布です。パラメータは5つで、それぞれの平均 $\mu_X, \mu_Y$、標準偏差 $\sigma_X, \sigma_Y$、そして相関係数 $\rho$ です。

ρ = 0(独立)xy ρ = 0.7xy ρ = −0.7xy
確率の高さを等高線で描くと、$\rho=0$ では同心円、相関があると斜めにつぶれた楕円になります。$|\rho|$ が 1 に近いほど楕円は細くなり、直線に近づきます。

試験で押さえておくことは3つです。$X$ だけ、$Y$ だけを見た分布(周辺分布)はそれぞれ正規分布です。$X$ の値を固定したときの $Y$ の分布(条件付き分布)も正規分布で、その平均は $X$ に対して直線的に変わります(これが第2章の回帰直線の背景です)。そして2変量正規分布に限っては、無相関($\rho = 0$)なら独立です。上で見た「無相関だからといって独立とは限らない」の、数少ない例外です。

次のステップ
第6章「標本分布」へ →
中心極限定理・t分布・カイ二乗分布・F分布