確率
最終更新:
統計を勉強していて、ここで急に「確率」が出てきて「データ分析と何の関係が?」と感じる人は多いはずです。実はここがいちばんモチベーションが切れやすい分かれ道です。先に進む前に、なぜここで確率を挟むのかを整理します。
確率は「不確実性」を扱うための共通言語です。
この先の推測統計(推定・検定)・回帰モデル・機械学習はすべて、確率の語彙で書かれています。
なぜ「不確実性」が中心テーマになるのか?
第1〜2章で扱った「データの要約」は、手元のデータをまとめる話でした。でも本当に知りたいのは普通、その先です。手元にないデータ(母集団・未来・他のサンプル)について何が言えるかです。
ここに必ず「ばらつき」「揺らぎ」「断言できなさ」がついて回ります。これを数値で扱うのが確率です。
逆に言うと、確率を知らないと「どれくらい確かなのか」を語れず、データ分析は「眺めるだけ」で終わってしまいます。
具体例:「確率を知らないと困る」3つの場面
全国民は約1.2億人いるのに、なぜ「±3%」と具体的に誤差を言えるのでしょうか?「95%信頼度」って何でしょうか?
これは本当に薬が効いた証拠でしょうか?それともたまたまの差でしょうか?
「たまたまこの差以上が出る確率は3%」と計算できれば「効果あり」と結論できます。
天気予報の「降水確率60%」もこの仲間です。
ここから先、確率はどこで使われる?
(今ここ)
確率の基本
「確からしさ」を数で表すルール
第3章までは「データを記述・収集」する話でした。第4章からは、推測統計の土台となる確率の世界に入ります。
用語の整理
- 試行:結果が偶然に決まる操作(例:サイコロを振る)
- 事象:試行の結果(の集まり)。記号は $A, B, \dots$
- 標本空間 $\Omega$:起こりうる結果すべての集合(例:$\Omega=\{1,2,3,4,5,6\}$)
- 確率 $P(A)$:事象 $A$ が起こる「確からしさ」を $0 \leq P(A) \leq 1$ で表した数
確率の3つの公理
① 任意の事象 $A$ について $0 \leq P(A) \leq 1$
② 全事象(必ず起こる事象) $\Omega$ について $P(\Omega) = 1$
③ 互いに排反な事象 $A, B$ について $P(A \cup B) = P(A) + P(B)$
サイコロで「偶数が出る」確率は、$\Omega = \{1,2,...,6\}$ の中で偶数は $\{2,4,6\}$ の3つなので $3/6 = 0.5$ です。
事象の関係をベン図で見る
確率の計算ルール
「かつ」「または」を数式に落とす
加法定理(または の確率)
※ $A \cap B$ を2回数えてしまうので、1回分引きます。
$A=$「ハートが出る」 $\to P(A) = 13/52$
$B=$「絵札(J, Q, K)が出る」 $\to P(B) = 12/52$
$A \cap B=$「ハートの絵札(3枚)」$\to P(A \cap B) = 3/52$
$\Rightarrow P(A \cup B) = \dfrac{13}{52} + \dfrac{12}{52} - \dfrac{3}{52} = \dfrac{22}{52} \approx 0.423$
排反の場合は単純な足し算
$A$ と $B$ が排反($A \cap B = \varnothing$)なら:
$P(A \cup B) = P(A) + P(B)$
例:サイコロで「1の目」と「2の目」が同時に出ることはないので $P(\{1\}\cup\{2\}) = 1/6 + 1/6 = 2/6$ です。
補集合の確率
「$A$ が起こらない」確率は「1 − $A$ が起こる確率」です。『少なくとも〜』タイプの問題はこれを使うのが定石です。
直接「1回or2回or3回出る」を計算するのは面倒です。逆事象「3回とも6が出ない」を使う:
$P(\text{1回も出ない}) = (5/6)^3 = 125/216$
$P(\text{少なくとも1回}) = 1 - 125/216 = $ 91/216 ≈ 0.421
条件付き確率と独立性
「Aが起こった」と分かった上での Bの確率
条件付き確率の定義
「$A$ が起こったと分かっているとき、$B$ も起こる確率」です。読みは「$A$ 条件のもとでの $B$ の確率」です。
「$A$ が起こった世界」に絞り込むと、$B$ のうち $A$ からはみ出た部分(点線)はもう見ません。残った $A$ の円の中で、$A \cap B$ が占める割合です。それが $P(B \mid A)$ です。
具体例:2×2の表で見る
ある会社の社員 100人を「男女」×「コーヒー好き/嫌い」で集計:
合計:100人
$A=$「男性」、$B=$「コーヒー好き」とすると:
- $P(A) = 50/100 = 0.5$(男性は50人)
- $P(A \cap B) = 30/100 = 0.3$(男性かつコーヒー好き)
- $P(B \mid A) = \dfrac{P(A \cap B)}{P(A)} = \dfrac{0.3}{0.5} = $ 0.6
→ 男性に限れば、コーヒー好きの割合は 30/50 = 60% です。これが条件付き確率の意味です。
乗法定理
条件付き確率の定義式を変形しただけです。樹形図と相性が良いです。
樹形図で乗法を可視化
樹形図:枝の確率をかけ算で末端の確率にします。すべての末端の合計 = 0.42 + 0.18 + 0.08 + 0.32 = 1.0
独立性
同値な言い方:$P(B \mid A) = P(B)$ です($A$ の情報が $B$ の確率を変えない)。
例:サイコロを2回振る。1回目の結果は2回目の確率に影響しない → 独立です。
⚠️ 「独立」と「排反」は別物
混乱しやすい2つの概念です。図と式で対比します:
$A \cap B = \varnothing$、$P(A \cap B) = 0$
同時には起こらない
例:サイコロで「1の目」と「6の目」
$P(A \cap B) = P(A) \cdot P(B)$
互いに影響しない
例:サイコロを2回振った結果、コインと天気
「$A$ と $B$ は無関係だから排反だ」は誤りです。
・排反 → 同時に起こらない(重ならない)。むしろ「強く関係」している(片方が起きると他方は絶対起きない)。
・独立 → 確率に影響を及ぼし合わない。重なっていてもよい。
$P(A) > 0$、$P(B) > 0$ なら、排反かつ独立 はあり得ません(排反なら $P(A∩B)=0$、独立なら $P(A∩B) = P(A)P(B) > 0$ で矛盾)。
ベイズの定理
「結果から原因」を確率で推論する
全確率の法則(ベイズへの準備)
標本空間が排反な事象 $A_1, A_2, \dots, A_n$ で分割されているとき:
$$P(B) = \sum_{i=1}^{n} P(A_i) \cdot P(B \mid A_i)$$$B$ がどのルートで起こったかを場合分けして足し合わせます。
ある製品は2つの工場で作られている:
・工場A:全生産の 60% を担当、不良率 2%
・工場B:全生産の 40% を担当、不良率 5%
→ 製品全体での不良率 $P(\text{不良})$ は?
不良品が出るルートは「工場A経由」「工場B経由」の2つしかありません。それぞれの確率を足し合わせれば全体になる(公式の記号では $A_1=$ 工場A、$A_2=$ 工場B、$B=$ 不良):
$P(\text{不良}) = \underbrace{0.6 \times 0.02}_{\text{A経由}} + \underbrace{0.4 \times 0.05}_{\text{B経由}} = 0.012 + 0.020 = $ 0.032(3.2%)
ポイント:「全体の不良率」は 各ルートからの寄与の合計です。これが全確率の法則の本質です。
→ 次のベイズの定理では、この $P(B)$ が分母として登場します。
ベイズの定理
こんな問いを考えます。日本人の 2割 が関西人で、関西人の 8割 はたこ焼き器を持っています。関西以外の人は 2割 しか持っていません。
では、日本人の中からたこ焼き器を持っている人をランダムに1人選んだとき、その人が関西人である確率は何%でしょうか。
パッと答えられるでしょうか。少し難しいですよね。分かっているのは「関西人 → たこ焼き器を持つ」の向きの確率なのに、聞かれているのは「たこ焼き器を持つ → 関西人」という逆向きの確率だからです。この逆向きを求める道具がベイズの定理です。
まずは公式から確認します。
分母 $P(B)$ は全確率の法則で計算します。
式だけ見てもピンと来ないので、たこ焼きの例で解いてみます。
・日本人のうち関西人:20%
・関西人でたこ焼き器を持っている:80%
・関西以外でたこ焼き器を持っている:20%
→ たこ焼き器を持っている人が関西人である確率 $P(\text{関西} \mid \text{持})$ は?
公式に当てはめると($A=$ 関西人、$B=$ たこ焼き器を持つ)、分母は「持っている人」を関西・関西以外の2ルートで場合分けした全確率の法則です:
$P(\text{関西} \mid \text{持}) = \dfrac{\underbrace{0.2 \times 0.8}_{\text{関西で持つ}}}{\underbrace{0.2 \times 0.8}_{\text{関西で持つ}} + \underbrace{0.8 \times 0.2}_{\text{関西以外で持つ}}} = \dfrac{0.16}{0.32} = $ 0.5(50%)
「関西人の8割が持っている」と聞くと、答えも8割くらいに感じます。でも人数で数えると、こうなっています:
たこ焼きの例で、$A$(関西人)と $B$(たこ焼き器を持つ)の役割を見直してみます。関西人だからたこ焼き器を持つ(人が多い)のであって、その逆ではありません。つまり $A$ が原因、$B$ が結果です。
世の中で分かりやすいのは「原因 → 結果」の向きの確率 $P(B \mid A)$ です。でも知りたいのはたいてい「結果を見て、原因は何だったか」という逆向きの $P(A \mid B)$ です。「たこ焼き器を持ってるんですね!(結果を見る)もしかして関西出身ですか?(原因を知りたい)」という向きです。ベイズの定理とは、この原因と結果の向きをひっくり返す式です。
ここでの結果 $B$ とは、観測されたデータ(証拠)のことです。原因 $A$ は見えず、結果 $B$ だけが見えている状況です。
- 事前確率 $P(A)$:結果 $B$ を見る前の「$A$ である」確率(何も聞いていない段階では、関西人の確率は 20%)
- 尤度 $P(B \mid A)$:原因が $A$ だったとき、結果 $B$ が現れる確率(関西人なら、たこ焼き器を持つ確率は 80%)
- 事後確率 $P(A \mid B)$:結果 $B$ を見た後の「$A$ である」確率(たこ焼き器を持つと分かった後は、関西人の確率は 50%)
ベイズの定理は、この事前確率 → (結果 $B$ を見る) → 事後確率 という書き換えをする式です。この書き換えを更新といいます(下の検査の例では、$1\%$ が $16.7\%$ に更新されます)。
更新されるのはこちらの見積もりだけで、$A$ が本当かどうかという事実は最初から変わっていません。
たこ焼きの例はあまり扱われませんが、ベイズの定理の定番として必ず出てくるのが「検査で陽性だった人」の問題です。 解き方はたこ焼きと同じで、こちらは直感が大きく裏切られる結果になります。
ある病気の罹患率は 1% です (0.01)。検査の性能は:
・感度(病気の人が陽性になる確率):99%
・特異度(健康な人が陰性になる確率):95%
ある人が検査で陽性でした。この人が本当に病気である確率は?
直感的には「ほぼ確実に病気」と思える。でも実際は…
数式で計算
$A$ = 病気、$B$ = 陽性です。
$P(A) = 0.01$、$P(B \mid A) = 0.99$(感度)
$P(A^c) = 0.99$、$P(B \mid A^c) = 1 - 0.95 = 0.05$(偽陽性率)
$P(B) = P(A)P(B|A) + P(A^c)P(B|A^c) = 0.01 \times 0.99 + 0.99 \times 0.05 = 0.0594$
$P(A \mid B) = \dfrac{P(A)P(B|A)}{P(B)} = \dfrac{0.01 \times 0.99}{0.0594} \approx $ 0.167
図で実感:1万人で考える
同じ計算を「1万人」のスケールで具体化すると、驚きの理由が見えます。
・元々病気の人は100人だけ → 真陽性も最大100人
・対して健康な人は9,900人もいて、その5%でも495人が偽陽性に
→ 偽陽性が真陽性を大きく上回り、陽性的中率が低くなる
これが「ベース率(事前確率)を忘れた直感」が外れる典型例です。
もう1つの定番がモンティ・ホール問題です。クイズ番組から生まれた問題で、答えを見る前に自分ならどうするか考えてみてください。
3つの扉があり、1つの背後に車、残り2つに山羊です。あなたが扉1を選んだあと、司会者(正解を知っている)が、まだ開いていない扉のうち山羊が出る方を1つ開けて見せました(例:扉3)。
司会者が「扉2に変えますか?」と聞いたとき、変えるべきでしょうか?
直感:「残り2枚なので 1/2 ずつ。変えても変えなくても同じ」 ← 間違い!
なぜ変えると 2/3 で勝てるのか?
最初に車があるのは 3つの扉のどれか、それぞれ1/3 です。これを場合分けして数えれば一目瞭然:
事前:扉1=1/3、扉2=1/3、扉3=1/3
事後:扉1=1/3(変わらず)、扉2 = 2/3、扉3=0
司会者の情報が「あなたの最初の選択」より「残りの扉」を強く更新するのがミソです。
順列と組合せ
「場合の数」を数える基本ツール
確率を「場合の数 ÷ 全場合の数」で計算する問題では、順列・組合せの知識が必要になります。
$n$ 個から $r$ 個を選んで並べる方法の数
$\displaystyle {}_nP_r = \frac{n!}{(n-r)!}$
順番が大事な場合に使います。
例:「5人の中から3人を選んで 会長・副会長・書記 を決める」
${}_5P_3 = 5 \times 4 \times 3 = 60$ 通り
$n$ 個から $r$ 個を選ぶ方法の数(順番は無視)
$\displaystyle {}_nC_r = \binom{n}{r} = \frac{n!}{r!(n-r)!}$
順番が関係ない場合に使います。
例:「5人の中から3人を選んで 委員にする」
${}_5C_3 = \dfrac{5 \times 4 \times 3}{3 \times 2 \times 1} = 10$ 通り
「ABC」と「BAC」を別物として数えるか同じとして数えるかで決めます。
・別物として数える → 順列
・同じとして数える → 組合せ
関係式:${}_nP_r = {}_nC_r \times r!$(組合せに「並べ方 $r!$ 通り」を掛けると順列)
Q:無作為に2枚引いたとき、その2枚が「A と B」である確率は?
A:全場合の数 ${}_5C_2 = 10$、A と B の組合せは1通りなので $1/10 = 0.1$ です。
同じものを含む順列
並べ替える $n$ 個のものの中に区別できない同じものがある場合、ふつうの $n!$ から「同じもの同士の入れ替え」を割り引きます。
$n$ 個のものを並べます。そのうち $n_1$ 個は同種A、$n_2$ 個は同種B、…、$n_k$ 個は同種K($n_1 + n_2 + \cdots + n_k = n$)のとき:
$$\frac{n!}{n_1! \cdot n_2! \cdots n_k!}$$
全6文字、A が3個、B が2個、C が1個です。
$\dfrac{6!}{3! \cdot 2! \cdot 1!} = \dfrac{720}{6 \cdot 2 \cdot 1} = $ 60 通り
文字を全部区別すれば 6!=720 通りです。A同士の3!=6通りの並び替えは見分けがつかないので 6で割り、B同士の2!=2通りも割って 720/12 = 60 です。
縦3マス・横4マスの格子で、左下から右上に進む最短経路(右Rか上Uにのみ移動)の数は?
→ 右4回 + 上3回 = 計7回の動きの順列です。Rが4個、Uが3個です。
$\dfrac{7!}{4! \cdot 3!} = \dfrac{5040}{24 \cdot 6} = $ 35 通り
※ これは ${}_7C_4 = 35$ と同じ式です。「同じものを含む順列」と「組合せ」は本質的に同じ計算です。
円順列・じゅず順列
丸テーブルに人を座らせるなど、回転して同じになる並び方を1つと数える場合の順列です。
・円順列(回転を同一視):$\,(n-1)!$
・じゅず順列(回転 + 裏返しも同一視):$\dfrac{(n-1)!}{2}$
直線では $4!=24$ 通りですが、円形では「回転で4通りずつ重複」 → $24/4 = 6 = 3!$ 通りです。
円順列 $\,(5-1)! = 4! = $ 24 通り
※ ネックレスのように裏返しても同じと考えるなら(じゅず順列)、$4!/2 = $ 12 通り
重複組合せ ${}_nH_r$
$n$ 種類の中から $r$ 個を選ぶ(同じ種類を何度選んでもよい、順番は無視)場合の組合せです。
例:3種類のドリンク(A, B, C)から5本買う組合せです。「A 2本、B 1本、C 2本」を以下のように玉と仕切りで表す:
・玉 ◯ が 5個(買う本数 $r$)
・仕切り | が 2本(種類数 $n - 1 = 2$)
・合計 7個の位置に玉と仕切りを並べる方法 = ${}_7C_2 = $ 21 通り
${}_3H_5 = {}_{3+5-1}C_5 = {}_7C_5 = {}_7C_2 = 21$
二項定理とパスカルの三角形
組合せ ${}_nC_k$ は二項式 $(a+b)^n$ の展開係数として現れます。これが二項定理です。第5章「二項分布」への直接の橋渡しになります。
$(a+b)^4 = {}_4C_0 a^4 + {}_4C_1 a^3 b + {}_4C_2 a^2 b^2 + {}_4C_3 a b^3 + {}_4C_4 b^4$
$= a^4 + 4 a^3 b + 6 a^2 b^2 + 4 a b^3 + b^4$
係数 1, 4, 6, 4, 1 がパスカルの三角形の第4行と一致します。
第 $n$ 行が $(a+b)^n$ の展開係数です。$k$ 番目の数が ${}_nC_k$ です。
- 対称性:${}_nC_k = {}_nC_{n-k}$(パスカルの三角形が左右対称な理由)
- パスカルの公式:${}_nC_k = {}_{n-1}C_{k-1} + {}_{n-1}C_k$
- 全体の和:$\sum_{k=0}^{n} {}_nC_k = 2^n$($(1+1)^n$ から)
$(p + (1-p))^n = 1^n = 1$ の各項が、$X$ の取る値ごとの確率を与えています。