第7章 / STEP 4

推定

標本から、見えない母集団の数値を当てる
点推定 不偏性・一致性 信頼区間 母平均・母比率・母分散 標本サイズ設計

最終更新:

なぜ推定?
「母数が分かっている前提で、標本がどうばらつくかを求める」から「手元の標本から、分からない母数を絞り込む」へ:使う向きが逆になる

知りたいのは母集団の真の数値(母平均 $\mu$、母比率 $p$、母分散 $\sigma^2$ など=母数)。けれど全員を調べる全数調査は、ふつう不可能です。視聴率・世論調査・製品検査など、どれも一部(標本)しか見られません。そこで標本から母数を推測します。これが推定です。

第6章はこう言っていました。「母数 $\mu$ を知っていれば、標本平均 $\bar{X}$ は $N(\mu,\ \sigma^2/n)$ にばらつく」。第7章はこれをひっくり返します。「手元の $\bar{x}$ から、見えない $\mu$ がどのあたりかを逆に絞り込む」。だから第6章の標本分布が、そのまま推定の道具になります。

第6章(標本分布)

母数 → 標本
$\mu$ を知って「$\bar{X}$ はどこに散る?」
未来の標本を予測する

第7章(推定)

標本 → 母数
$\bar{x}$ を見て「$\mu$ はどのへん?」
見えない母数を逆算する

推定には2つのスタイル:
点推定=1つの数値でズバリ当てます(例:支持率は 41%)。
区間推定=幅をつけて「この範囲」と当てます(例:支持率は 38〜44%)。
1点だけだと「どれくらい外れ得るか」が分かりません。だから本命は区間推定です。
1

点推定と「良い推定量」

1つの数値で母数を当てる:ただし「良い当て方」には条件がある

標本から計算した1つの値で母数をズバリ当てるのが点推定です。まずは「何を当てるのか」からです。当てる相手は母数です。母集団を特徴づける真の数値で、下のように何種類かあり、どれも未知です。それぞれに「いちばん素直な候補」があります。

当てたい母数(真の値・未知)いちばん素直な点推定量
母平均 $\mu$標本平均 $\bar{x}$
母比率 $p$標本比率 $\hat{p}$
母分散 $\sigma^2$不偏分散 $s_u^2=\dfrac{1}{n-1}\sum(x_i-\bar{x})^2$

同じ母数でも「当て方」は1つじゃない

上の表は「いちばん素直な候補」にすぎません。じつは同じ母数を当てる方法(推定量)は何通りもあります。具体例で見ましょう。

具体例:母平均を「平均」で当てる?「中央値」で当てる?

当てたいのは母平均 $\mu$ です(=母集団の中心)。手元の標本から「中心っぽい1つの値」を作るなら…
・標本平均(全部足して個数で割る)
・標本中央値(小さい順に並べたド真ん中)
左右対称な母集団(正規分布など)では 母平均 = 母中央値 なので、どちらも「$\mu$ を狙う推定値」として使えます。では $\mu$ を当てるのに、どちらを採用すべきでしょうか? これが「当て方(推定量)が複数ある」という問題です。$\mu$ という同じ相手に、候補となる推定量が2つ(以上)あるわけです。

候補が複数あるなら、その中から選ぶ「良い推定量」の物差しが要ります。良い推定量とは、ひとことで言えば「何度も標本を取り直したとき、母数を正確に・安定して射抜く」ものです。その良さを、次の3つの観点で測ります。

  • 不偏性:狙いがズレていないか(平均すると母数に当たる)
  • 一致性:データを増やすほど母数に近づくか
  • 有効性:当たりのばらつきが小さいか

不偏性:平均すると的のド真ん中

推定量も標本ごとに変わる確率変数です。何度も標本を取り直して推定値を集めたとき、その平均がちょうど母数に一致するなら、その推定量は不偏(バイアスなし)です。式では $E[\text{推定量}]=\text{母数}$ です。的当てでいうと「狙いがズレていない」状態です。

不偏(偏りなし) ●=真の母数 推定値の平均 = 母数 ✓ バイアスあり(偏り) ズレ =偏り 平均しても母数からズレる ✗
何度も標本を取って得た推定値です(緑・橙の点)。不偏なら散らばっても平均は的の中心(母数)に一致します(左)。狙いがズレた推定量は、何度平均しても中心から外れます。これがバイアスです(右)。
$\bar{x}$ は $E[\bar{X}]=\mu$ なので不偏です(第6章)。分散を $n$ で割った素朴な標本分散は $\sigma^2$ を過小評価するので、$n-1$ で割って不偏にしたのが不偏分散 $s_u^2$ です(第6章で見た「割る数を1減らす」補正)。これが点推定で $s_u^2$ を使う理由です。

一致性:データを増やせば真の値に吸い寄せられる

標本サイズ $n$ を大きくするほど、推定値が母数に限りなく近づく性質が一致性です。標本平均なら、標準誤差 $\sigma/\sqrt{n}$ が $n\to\infty$ で $0$ に近づく(=大数の法則)ので、$\bar{x}$ は $\mu$ に集中していきます。

真の母数 μ n 小(広い) n 中 n 大(鋭い) n を増やすほど推定値の分布は μ に細く集中する
推定値($\bar{x}$)の分布です。$n$ が小さいと $\mu$ の周りに広く散ります(外れやすい)が、$n$ を増やすと幅が縮んで $\mu$ にぴたりと集まります。これが一致性です。

有効性:同じ不偏なら、ばらつきが小さいほど良い

不偏な推定量が複数あるとき、分散がいちばん小さいものが優秀で、これを有効と呼びます。的の中心は同じでも、散らばりが小さいほど1回の推定が当たりやすいからです。

有効(ばらつき小) 有効でない(ばらつき大)
どちらも不偏(点の平均は的の中心=母数)。違うのは1回あたりの散らばりだけで、同じ $n$ なら散らばりの小さい左のほうが「1回の推定で母数に近い値が出る」=有効。

ここで、最初の「平均 vs 中央値」に決着がつきます。正規母集団では、標本平均も標本中央値もどちらも不偏です(平均すれば $\mu$)。
※ 歪んだ母集団では 母平均 ≠ 母中央値 なので、この勝負自体が成り立ちません。標本中央値は $\mu$ とは別の場所を狙うことになり、$\mu$ の推定量としては不偏ですらなくなります。

そのうえで差がつくのがばらつきです。同じ $n$ でも、標本中央値は標本平均より約1.5倍ばらつきやすくなります(分散が大きい)。つまり上の図の右側が標本中央値、左側が標本平均です。だから母平均の標準的な推定量は標本平均なのです。

最尤法(さいゆうほう):「いちばんありそうな母数」を選ぶ

母数を点推定する代表的な方法が最尤法です。「手元のデータがいちばん出やすくなるような母数」を、その母数の推定値に採用します。

具体例:コインの表確率を当てる

表確率 $p$ が未知のコインを $10$ 回投げたら、表が $7$ 回出ました。$p$ をいくつと推定すればよいでしょうか?
・$p=0.5$ なら「7回表」が出る確率は中くらいです。$p=0.9$ なら高すぎて7回はやや出にくくなります。$p=0.7$ のとき、まさに「7回表」が最も出やすくなります。
・実際、「$n$ 回中 $x$ 回表」を最も尤もらしくする $p$ を計算すると $\hat{p}=\dfrac{x}{n}=\dfrac{7}{10}=$ 0.7。
→ では、たった $10$ 回投げただけで「$p=0.7$」と1点で決めてしまってよいのでしょうか。$10$ 回なら、たまたま上ブレ・下ブレすることは十分あり得ます。$0.7$ はあくまで「他の値よりありそう」というだけで、ズバリ当たっている保証はありません。
→ だから実務では、幅をつけて「このあたり」と示す区間推定のほうが主流になります(次の 2)。

2

区間推定の基本 🌟

点推定の弱点を埋める「幅つきの推定」と、信頼度の本当の意味

「支持率は $41\%$」と1点で言われても、それが $\pm 1\%$ の話か $\pm 10\%$ の話かで意味がまるで違います。点推定は必ず多少は外れるのに、その外れ幅を語らないのが弱点です。そこで「このあたりに母数がある」と幅で示すのが区間推定、その区間が信頼区間です。

信頼区間 = 点推定 $\;\pm\;$ (信頼係数)$\times$(標準誤差)
= ど真ん中($\bar{x}$ など)から、左右に「ありえる誤差」を足し引きした幅

支持率(%)のような比率でも、成人男性の平均身長(cm)のような平均でも、信頼区間の求め方は同じです。ただし、平均と比率では標準誤差の計算方法が異なります。詳しくは 3(母平均)・4(母比率)で扱います。

では、幅はどれくらいに取ればいいのでしょうか。これはこちらで決めます。「この手順で区間を作ったとき、どれくらいの割合で母数を含んでほしいか」を先に指定するのです。この割合を信頼度(信頼水準)といい、慣習的に $95\%$ がよく使われます。そうして作った区間が95%信頼区間です。
信頼度を上げるほど、上の式の信頼係数が大きくなり、区間の幅は広がります(確実に当てたいなら、その分だけ大ざっぱな答えになる)。

信頼度95%の「正しい意味」

バスケのフリースローで考えると分かりやすくなります。
あるプロ選手は、フリースローを95%の確率で決める超人的な精度を持っているとします。この選手が1本打つことが、標本を1つ取って区間を作ることに対応します。

フリースロー区間推定
1本打つ標本を1つ取り、区間を作る
シュートが入るその区間が母数 $\mu$ を含む
決定率 95%信頼度 95%

つまり 95% は「選手の決定率」= 区間の作り方(手順)の性能です。同じ手順を何度も繰り返せば、作った区間の約95%が $\mu$ を含みます。これが信頼度95%の意味です。

ここで、打つ前にガヤが「これから打つシュートが入る確率は95%だ」と言うのは、誰がどう見ても正しいです。
同じように、標本を取る前に「これから作る区間が $\mu$ を含む確率は95%だ」と言うのも正しいです。ここは争いになりません。

問題はその先です。選手がすでにシュートを放ち、ボールが手を離れて空中にあるときです。「このシュートが入る確率は95%だ」と言えるでしょうか。
これが、すでに標本を取って $[48,\ 52]$ と計算し終えた区間を見て「ここに95%の確率で $\mu$ が入る」と言う行為にあたります。ここで解釈が2つに分かれます。

考え方A(頻度論):空中のボールの運命は、もう決まっている。
無風の体育館なら、手を離れた瞬間に入るか外れるかは確定しています。時を巻き戻して同じ状態から1万回やり直しても、1万回とも入るか、1万回とも外れるかのどちらかです。だから「確率95%」ではなく、0か1 です(どちらかは分からないだけ)。そもそも結果が確定しているのだから、確率で語るのが間違いです。

考え方B(ベイズ流):95%決める選手が放ったのだから、この1本も95%だ。
結果を知らない自分にとっては、まだ「入りそう」としか言えません。その確信の度合いを確率と呼ぶなら、この1本も95%でよいです(この立場では「95%信用区間」と呼ぶ)。

解釈が割れるのは、抽選 → 結果の確定 → 結果の観測という3段階のうち、どこまで「確率」で語ってよいかの線引きが違うからです。Aは「結果が確定した時点で確率の出番は終わり」、Bは「自分が観測するまでは確率で語ってよい」です。
(「観測するまで結果は確定しない」というシュレディンガーの猫の話とも雰囲気は似ています。ただしあちらは「観測するまで本当に結果が確定していない」という量子力学の話なので、A とも B とも違います。)

どちらの言い分も理解できますが、統計検定は A の立場(頻度論)に立ちます。確率を「何度も繰り返したときの割合」と定義するので、繰り返しようのない「もう放たれた1本」には確率を使わない、というルールです。どちらが正しいかではなく、確率という言葉の定義が違うだけです。
⚠️ ありがちな誤解:「真の μ がこの区間に95%の確率で入る」

考え方A(頻度論)に立つ統計では、この言い方は誤りになります。
95%のような「確率」は、何度も繰り返したときに、変動するものがどんな結果を生むかを測る言葉です。つまり確率を語れるのは変動するものについてだけです。
ここで変動するのは標本とその信頼区間の方です(シュートは1本ごとに違う軌道を描く)。真の母数 $\mu$ は動かない定数(ゴールリングは動かない)なので、$\mu$ に確率を貼り付けることはできません。だから 95% がかかっているのは「区間の作り方」の方です。
言い換えると、「$\mu$ が95%の確率で動いてこの区間に入る」のではなく、「区間の作り方が95%の確率で $\mu$ を捕まえる」です。

なお、バスケならシュートが入ったかどうかは目で見えますが、区間が $\mu$ を含んだかどうかは確認できません。真の $\mu$ を知らないからです(知っていれば推定はいりません)。また、この95%はデータを見る前の約束なので、都合のいい結果だけを選んで報告したり、データを見てから区間の作り方を変えたりすると、95%という保証は崩れます。

言葉だけだと分かりにくいので、実際に「同じ手順」で100本の95%信頼区間を作ってみます。何本が母平均 $\mu$ を含むでしょうか。

同じ母集団から 100 回サンプリング → 各回 95% 区間:
100本中 ―本 が μ を含む
縦の橙線が真の $\mu$ です。横棒1本が「1標本から作った95%区間」です。赤い棒(μ をまたげなかった外れ)はおよそ5本で、残り約95本は $\mu$ を含みます。「もう一度シミュレーション」を押すたびに当たり外れが入れ替わるのが、「95%=区間の的中率」のイメージです。
3

母平均 μ の区間推定

σ を知っているか否かで、使う分布が変わる

第6章より、$\bar{X}\sim N\!\left(\mu,\ \sigma^2/n\right)$ です。標準化すると $\dfrac{\bar{X}-\mu}{\sigma/\sqrt{n}}\sim N(0,1)$ で、その値が $\pm 1.96$ に収まる確率が $95\%$ です(第5章の確率表)。これを $\mu$ について解くだけで、母平均の95%信頼区間が出ます。

① 母分散 σ が既知のとき(正規分布)

母平均の信頼区間(σ既知・信頼度95%)
$$\bar{x} - 1.96\,\frac{\sigma}{\sqrt{n}} \;\le\; \mu \;\le\; \bar{x} + 1.96\,\frac{\sigma}{\sqrt{n}}$$

信頼度を上げる(90%→95%→99%)と係数は $1.645\to1.96\to2.576$ と大きくなり、区間は広くなります。

具体例:部品の長さ

ある部品の長さの母標準偏差は $\sigma=12$mm とわかっています。$n=36$ 個を測ったら標本平均 $\bar{x}=72$mm です。母平均 $\mu$ の95%信頼区間は?
・標準誤差 $\dfrac{\sigma}{\sqrt{n}}=\dfrac{12}{\sqrt{36}}=\dfrac{12}{6}=2$
・$72 \pm 1.96\times 2 = 72 \pm 3.92$ → $[68.08,\ 75.92]$

② 母分散 σ が未知のとき(t分布)

現実には $\sigma$ も不明なことがほとんどです。$\sigma$ の代わりに不偏標準偏差 $s_u$ を使うと、第6章で見たとおり分布は正規分布より裾が太い自由度 $n-1$ の t分布になります。だから係数 $1.96$ を $t$ 値に置き換えます。

母平均の信頼区間(σ未知・信頼度95%)
$$\bar{x} - t_{0.025,\,n-1}\,\frac{s_u}{\sqrt{n}} \;\le\; \mu \;\le\; \bar{x} + t_{0.025,\,n-1}\,\frac{s_u}{\sqrt{n}}$$

$t_{0.025,\,n-1}$ は「自由度 $n-1$ の t分布で、上側 $2.5\%$ の点」です。$\sigma$ が不確実なぶん $1.96$ より大きく、区間は少し広くなります。$n$ が大きいほど $t$ は $1.96$ に近づきます。

自由度 $n-1$51030∞(正規)
$t_{0.025}$2.5712.2282.0421.960
具体例:テストの平均点

母集団:ある学校の全生徒(数百人)のテスト得点です。標本:そのうち無作為に選んだ $n=16$ 人です。標本平均 $\bar{x}=50$ 点、不偏標準偏差 $s_u=8$ 点です(母分散 $\sigma^2$ は未知)。全生徒の平均点 $\mu$ の95%信頼区間は?
・自由度 $n-1=15$ → $t_{0.025,\,15}=2.131$
・標準誤差 $\dfrac{s_u}{\sqrt{n}}=\dfrac{8}{\sqrt{16}}=\dfrac{8}{4}=2$
・$50 \pm 2.131\times 2 = 50 \pm 4.26$ → $[45.74,\ 54.26]$
(もし $1.96$ で計算すると $\pm3.92$ と狭すぎます。$\sigma$ 未知の不確実性を $t$ がきちんと広げてくれます。)

使い分けフローチャート

母平均 μ の区間を作りたい 母分散 σ は 既知? 既知 正規分布 x ± 1.96·σ/√n 未知 t分布(自由度 n−1) x ± t·s/√n ※ n が大きいと t ≈ 1.96 なので、実用上どちらでもほぼ同じ幅になる
母平均の区間は「$\sigma$ を知っているか」で分岐します。知っていれば正規分布($1.96$)、知らなければ $s_u$ で代用して t分布です($t$ 値)。
4

母比率 p の区間推定

世論調査・視聴率でおなじみの「±誤差」の正体

賛成/反対、当たり/外れのような割合を推定したいとします。標本比率 $\hat{p}$ は、$n$ が大きければ第6章より $\hat{p}\approx N\!\left(p,\ \dfrac{p(1-p)}{n}\right)$ に従います。標準誤差の $p$ は未知なので $\hat{p}$ で代用すると、母比率の信頼区間が作れます。

母比率の信頼区間(大標本・信頼度95%)
$$\hat{p} \;\pm\; 1.96\,\sqrt{\frac{\hat{p}(1-\hat{p})}{n}} \qquad (\text{目安:} n\hat{p}\ge5 \text{ かつ } n(1-\hat{p})\ge5)$$
具体例:内閣支持率の「±3%」

$n=1000$ 人に聞いたら支持が $400$ 人、つまり $\hat{p}=0.40$ です。母支持率 $p$ の95%信頼区間は?
・標準誤差 $\sqrt{\dfrac{0.4\times0.6}{1000}}=\sqrt{\dfrac{0.24}{1000}}=\sqrt{0.00024}\approx 0.0155$
・$0.40 \pm 1.96\times0.0155 = 0.40 \pm 0.0304$ → 約 $[37.0\%,\ 43.0\%]$
→ ニュースの「支持率 40%(誤差 ±約3%)」は、まさにこの $1.96\times\text{SE}$ です。標本 $n$ を増やせば誤差は $\sqrt{n}$ ぶんだけ縮みます。

誤差幅 $1.96\sqrt{\hat{p}(1-\hat{p})/n}$ は、$\hat{p}=0.5$ のとき最大になります($p(1-p)$ が $p=0.5$ で最大だから)。だから「最悪でもこれだけの誤差」を見積もるときは $\hat{p}=0.5$ を代入します。次の標本サイズ設計で使います。
5

母分散 σ² の区間推定

「ばらつき」を推定する:ここでカイ二乗分布が登場

中心(平均)ではなくばらつき(分散)そのものを区間で推定したい場面です。品質管理で「製品の分散が規定内か」などです。第6章の関係 $\dfrac{(n-1)s_u^2}{\sigma^2}\sim\chi^2_{n-1}$ を使って、$\sigma^2$ を挟み込みます。

母分散の信頼区間(信頼度95%)
$$\frac{(n-1)s_u^2}{\chi^2_{0.025,\,n-1}} \;\le\; \sigma^2 \;\le\; \frac{(n-1)s_u^2}{\chi^2_{0.975,\,n-1}}$$

カイ二乗分布は左右非対称なので、上側・下側で割る点が違う ⇒ 区間も中心に対して非対称になります。

具体例:充填量のばらつき

$n=10$ 本を測ったら不偏分散 $s_u^2=4$ です。母分散 $\sigma^2$ の95%信頼区間は?(自由度 $9$:$\chi^2_{0.025,9}=19.02$, $\chi^2_{0.975,9}=2.70$)
・分子 $(n-1)s_u^2 = 9\times 4 = 36$
・下限 $\dfrac{36}{19.02}\approx 1.89$、上限 $\dfrac{36}{2.70}\approx 13.33$
→ $1.89 \le \sigma^2 \le 13.33$(点推定の $s_u^2=4$ を中心に、右へ大きく広がる非対称な区間)。

⚠️ この方法は「正規母集団」が前提

$\dfrac{(n-1)s_u^2}{\sigma^2}\sim\chi^2_{n-1}$ は、母集団が正規分布であることから導かれた関係です(第6章)。しかもこの前提は、母平均のときと違って $n$ を増やしても緩められません。
・母平均の区間:中心極限定理が使えるので、母集団が多少ゆがんでいても $n$ が大きければそこそこ使える
・母分散の区間:$n$ を増やしても改善せず、母集団がゆがんでいると信頼度が $95\%$ から大きくズレる

そのため、母比率(0/1 データ)のばらつきにこの式は使えません。0/1 は正規分布から最も遠い形ですし、そもそも二値データの母分散は $\sigma^2 = p(1-p)$ と母比率 $p$ だけで決まってしまうので、$p$ とは別に分散を推定する場面自体がありません(4 の母比率の区間推定を使います)。

相関係数の区間推定:フィッシャーの $z$ 変換

第2章で計算した相関係数 $r$ も、標本から求めた「推定値」です。30人分のデータで $r=0.6$ と出ても、別の30人なら $0.5$ かもしれないし $0.7$ かもしれません。母集団での相関係数 $\rho$(ロー)はどの範囲にあるのか、これも区間で答えたいところです。

ところが $r$ には、平均のときにはなかった厄介な性質があります。$-1$ と $1$ に壁があることです。$\rho=0.8$ のとき、$r$ は上には $1$ までしか動けないのに下には大きく動けるので、$r$ の分布は左に歪みます。正規分布の形をした「$\pm 1.96 \times$ 標準誤差」は使えません。

r の分布(ρ = 0.8, n = 30) 壁(r = 1) 0.3 0.8 1.0 左に長い裾(壁で右に伸びられない) → z 変換 z の分布(同じデータ) 0.3 1.1 2.1 左右対称の釣鐘型に(正規分布で扱える)
$\rho=0.8$ の母集団から $n=30$ を取り直すシミュレーションです。左の $r$ は壁に押されて歪んでいますが、$z$ に変換すると壁が消えて釣鐘型になります。しかも $z$ の標準偏差は $1/\sqrt{n-3}$ とシンプルです。
相関係数の信頼区間(フィッシャーの $z$ 変換、信頼度95%)
$$z = \frac{1}{2}\ln\frac{1+r}{1-r}, \qquad z \pm 1.96\,\frac{1}{\sqrt{n-3}}$$

手順は3ステップです。$r$ を $z$ に変換する → $z$ の世界で区間を作る → 区間の両端を $r$ に戻す。戻すときは $r = \dfrac{e^{2z}-1}{e^{2z}+1}$ を使います。

具体例:$n=30$ で $r=0.6$ のとき、母相関係数 $\rho$ の95%信頼区間は?

・$z$ に変換:$z=\dfrac{1}{2}\ln\dfrac{1.6}{0.4}=\dfrac{1}{2}\ln 4 \approx 0.693$
・標準誤差:$\dfrac{1}{\sqrt{30-3}}=\dfrac{1}{\sqrt{27}}\approx 0.192$
・$z$ の区間:$0.693 \pm 1.96 \times 0.192 = 0.693 \pm 0.377$ → $[0.316,\ 1.070]$
・$r$ に戻す:下限 $\dfrac{e^{0.632}-1}{e^{0.632}+1}\approx 0.31$、上限 $\dfrac{e^{2.140}-1}{e^{2.140}+1}\approx 0.79$
→ $0.31 \le \rho \le 0.79$。$r=0.6$ を中心に、下へ $0.29$、上へ $0.19$ と非対称な区間になります。壁に近い上側ほど幅が詰まるからです。

※ 区間に $0$ が入らなければ「母集団でも無相関ではない」と言えます(第8章の検定と表裏一体の関係です)。試験では $\ln$ や $e^{2z}$ の値は問題文か数表で与えられます。

6

2標本:差の区間推定

「A と B でどれだけ違うか」を区間で見積もる

実務では「1つの母数」より「2群の差」を知りたいことが多いです。新薬と旧薬の効果差、A店とB店の平均売上差などです。点推定は素直に $\bar{x}_1-\bar{x}_2$ です。あとはその差の標準誤差に係数を掛けて幅をつけます。

たとえば、こんな場面です。
・A店の日商:$25$ 日分を集計 → 平均 $52.0$ 万円、不偏標準偏差 $8.0$ 万円
・B店の日商:$25$ 日分を集計 → 平均 $46.0$ 万円、不偏標準偏差 $6.0$ 万円
見えている差は $6.0$ 万円です。でもこれはたまたま集計した25日ぶんの差にすぎません。知りたいのは「この2店の実力の差は、結局どのくらいなのか」です。それを幅で答えるのがこの節です(計算はこの後で)。

母平均の差の信頼区間(独立2標本)
$$(\bar{x}_1-\bar{x}_2)\;\pm\; t\,\sqrt{\frac{s_{u1}^2}{n_1}+\frac{s_{u2}^2}{n_2}}$$

2群が独立なので、ばらつき(分散)は足し算です。各群のばらつきを別々に見積もった形で、ウェルチ (Welch) の方法と呼ばれます(第8章の2標本の検定で、検定の形としてもう一度紹介します)。母比率の差も同様に $(\hat{p}_1-\hat{p}_2)\pm 1.96\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1}+\frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}$ です。

ルートの中身が $\dfrac{s_{u1}^2}{n_1}+\dfrac{s_{u2}^2}{n_2}$ になる理由を、2段階に分けます($s_{u1}^2,\ s_{u2}^2$ は各群の不偏分散)。

① $\dfrac{s_{u1}^2}{n_1}$ は「A群の標本平均のばらつき」
第6章で、標本平均のばらつきは $V[\bar{X}]=\dfrac{\sigma^2}{n}$、その平方根が標準誤差 $\dfrac{\sigma}{\sqrt{n}}$ でした。つまり $\dfrac{\sigma^2}{n}$ は標準誤差の2乗=標本平均の分散です。$\sigma$ は未知なので不偏分散 $s_u^2$ で代用すると $\dfrac{s_{u1}^2}{n_1}$ です。これが式の中身の正体で、データそのもののばらつきではなく「$\bar{x}_1$ という1個の値がどれだけ揺れるか」を表しています。

② 引き算なのに、ばらつきは足し合わさる
2群が独立なら $V[\bar{X}_1-\bar{X}_2]=V[\bar{X}_1]+V[\bar{X}_2]$ です。引き算なのに足すのは直感に反しますが、こう考えると腑に落ちます。
A店の平均が偶然高めに出て、同時に B店の平均が偶然低めに出ると、その差 $\bar{x}_1-\bar{x}_2$ は本当の差より大きく出ます。逆に A店が低め・B店が高めなら、本当の差より小さく出ます。どちらにしても2つの誤差は打ち消し合わず、積み上がります。
独立とは「互いに無関係」ということなので、都合よく相殺してくれる保証がないのです。だから引き算でも、揺れの量(分散)は足します。最後に $\sqrt{\ }$ を取って標準誤差に戻します。

A店の平均 真の平均 52 x̄₁ = 54 +2 B店の平均 真の平均 46 x̄₂ = 44 −2 真の差 = 6 観測した差 = 10(4 も大きい)
A店・B店を同じ目盛りに並べたものです。A店が $+2$ 上振れ、B店が $-2$ 下振れした回では、2本の「}」の長さが示すとおり観測した差(10)が真の差(6)より 4 も広がります。逆に A店が $-2$・B店が $+2$ の回なら差は $2$ に縮みます。誤差は打ち消し合わず、差の幅として積み上がります。だから分散を足します。
具体例:A店とB店で、平均日商にどれだけ差があるか

A店:$n_1=25$ 日、$\bar{x}_1=52.0$ 万円、不偏標準偏差 $s_{u1}=8.0$ 万円
B店:$n_2=25$ 日、$\bar{x}_2=46.0$ 万円、不偏標準偏差 $s_{u2}=6.0$ 万円
・点推定(差):$52.0-46.0=6.0$ 万円
・A店の標本平均の分散 $\dfrac{s_{u1}^2}{n_1}=\dfrac{64}{25}=2.56$、B店は $\dfrac{s_{u2}^2}{n_2}=\dfrac{36}{25}=1.44$
・差の分散 $=2.56+1.44=4.00$ → 差の標準誤差 $=\sqrt{4.00}=2.0$ 万円
・自由度は近似で $44$($44.5$ を切り捨て)→ $t_{0.025,\,44}\approx 2.015$
・$6.0 \pm 2.015\times 2.0 = 6.0 \pm 4.03$ → $[1.97,\ 10.03]$
→ 区間に $0$ が入っていないので、「差はない」とは考えにくいです。A店のほうが約2万〜10万円ほど高いと見積もれます。
※ 各群のばらつきを別々に見積もる(ウェルチの方法)と、自由度はきれいな整数にならず近似で求めます。試験では自由度が与えられることがほとんどです。なお2群のばらつきが等しいとみなせるときは、両群をまとめて見積もる「プール」版(自由度 $n_1+n_2-2$)も使えます。どちらを使うかの判断は第8章で扱います。

母比率の差の信頼区間(大標本・信頼度95%)
$$(\hat{p}_1-\hat{p}_2)\;\pm\;1.96\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1}+\frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}$$

形は母平均の差とまったく同じです。各群の $\hat{p}$ の分散 $\hat{p}(1-\hat{p})/n$ を足してルートを取ると、差の標準誤差になります。比率は正規近似で扱うので、$t$ ではなく $1.96$ を使います。

具体例:Webページのデザイン、A案とB案でクリック率にどれだけ差があるか

あるWebページのデザインを2案つくり、訪問者にどちらかを表示してクリック率を比べました。
A案(既存):$n_1=500$ 人に表示 → クリック $60$ 人、$\hat{p}_1=\dfrac{60}{500}=0.12$
B案(新規):$n_2=500$ 人に表示 → クリック $90$ 人、$\hat{p}_2=\dfrac{90}{500}=0.18$
・点推定(差 B−A):$0.18-0.12=0.06$(6ポイント)
・各群の $\hat{p}$ の分散:$\dfrac{0.12\times0.88}{500}\approx0.000211$、$\dfrac{0.18\times0.82}{500}\approx0.000295$
・差の分散 $\approx 0.000506$ → 差の標準誤差 $=\sqrt{0.000506}\approx 0.0225$
・$0.06 \pm 1.96\times0.0225 = 0.06 \pm 0.044$ → $[0.016,\ 0.104]$(約 $1.6\%$〜$10.4\%$)
→ 区間に $0$ が入っていないので、B案のほうが 1.6〜10.4 ポイント高いと見積もれます。
※ 平均のときと違って $t$ ではなく $1.96$ を使うのは、比率は正規近似で扱うからです(第6章の目安 $np\ge5$ かつ $n(1-p)\ge5$ を満たしている)。

最後に、2群の「ばらつきの違い」を区間で見積もる方法です。差ではなく比で見るところがポイントです。$\sigma_1^2/\sigma_2^2$ が $1$ なら等分散、$1$ から離れるほどばらつきが違います。第6章で見たとおり、2つの不偏分散の比は $F$ 分布に従うので、それを使って区間を作ります。

母分散の比の信頼区間(正規母集団・信頼度95%)
$$\frac{s_{u1}^2/s_{u2}^2}{F_{0.025}(n_1-1,\ n_2-1)} \;\le\; \frac{\sigma_1^2}{\sigma_2^2} \;\le\; \frac{s_{u1}^2}{s_{u2}^2}\times F_{0.025}(n_2-1,\ n_1-1)$$

$F_{0.025}(a,b)$ は自由度 $(a,b)$ の $F$ 分布の上側 $2.5\%$ 点です。母分散の区間と同じく、$F$ 分布は左右非対称なので区間も非対称になります。下限で割る $F$ と上限で掛ける $F$ で、自由度の順番が入れ替わることに注意してください。

具体例:A店とB店で、日商のばらつきはどれだけ違うか

さきほどのA店・B店(各 $n=25$ 日、不偏標準偏差 $8.0$ 万円と $6.0$ 万円)です。自由度は $(24,\,24)$ で、$F_{0.025}(24,24)=2.27$ とします。
・分散の比(点推定):$\dfrac{8^2}{6^2}=\dfrac{64}{36}\approx 1.78$
・下限:$1.78 \div 2.27 \approx 0.78$、上限:$1.78 \times 2.27 \approx 4.04$
→ $0.78 \le \dfrac{\sigma_1^2}{\sigma_2^2} \le 4.04$。区間に $1$ が入っているので、「A店のほうがばらつきが大きい」とは言い切れません。点推定では $1.78$ 倍でも、25日ずつではこの程度の差は偶然で出ます。

差の信頼区間が 0 をまたぐかどうか は、第8章「検定」の「差があると言えるか」と表裏一体です。区間に $0$ が入っていれば「差なし」も否定できない、という読み方ができます。
7

標本サイズの設計

「誤差 ±X に抑えるには、何人調べればいい?」を逆算する

ここまでは「$n$ 人調べたら誤差はいくつ」でした。実務では逆です。「誤差を ±$E$ 以内に抑えたい。$n$ は最低いくつ必要?」という問いです。誤差幅 $E=z\cdot\sigma/\sqrt{n}$ を $n$ について解くだけです。

必要な標本サイズ
$$\text{母平均:}\; n \ge \left(\frac{z\,\sigma}{E}\right)^2 \qquad\qquad \text{母比率:}\; n \ge \frac{z^2\,p(1-p)}{E^2}$$

母比率で $p$ が見当もつかないときは、誤差が最大になる最悪ケース $p=0.5$ を入れます(安全側)。

具体例:世論調査は何人必要?

支持率を「誤差 ±$3\%$、信頼度95%」で調べたいとします。何人に聞けばよいでしょうか?($p$ 不明なので $p=0.5$)
・$n \ge \dfrac{1.96^2\times 0.5\times0.5}{0.03^2} = \dfrac{3.8416\times0.25}{0.0009} = \dfrac{0.9604}{0.0009}\approx 1067.1$
→ 約 1068 人。世論調査がよく「約1000〜2000人」なのは、これが理由です。
・誤差を半分(±1.5%)にしたいなら $n$ は4倍です(約4270人)。精度は $\sqrt{n}$ でしか上がりません。

具体例:部品の長さの平均を測るには、何個必要?

ある部品の平均の長さを「誤差 $\pm 0.5$mm、信頼度95%」で推定したいとします。過去の製造データから、ばらつきは $\sigma \approx 3$mm と分かっています。何個測ればよいでしょうか?
・$n \ge \left(\dfrac{z\,\sigma}{E}\right)^{\!2} = \left(\dfrac{1.96\times 3}{0.5}\right)^{\!2} = \left(\dfrac{5.88}{0.5}\right)^{\!2} = 11.76^2 \approx 138.3$
→ 139 個(必要数なので切り上げます。138個では誤差 $\pm0.5$mm に届きません)。
・誤差を $\pm 0.25$mm と半分にしたいなら $n$ は4倍の約 $553$ 個。ここも $\sqrt{n}$ の壁は同じ。
※ 母平均のほうは $\sigma$ が必要です。過去のデータや予備調査から見積もり、分からなければ大きめに見積もると安全側です(比率の $p=0.5$ と同じ発想)。

次のステップ
第8章「仮説検定」→
差は偶然か必然か:推定の裏返しで「言えるか」を判定する