推定
最終更新:
知りたいのは母集団の真の数値(母平均 $\mu$、母比率 $p$、母分散 $\sigma^2$ など=母数)。けれど全員を調べる全数調査は、ふつう不可能です。視聴率・世論調査・製品検査など、どれも一部(標本)しか見られません。そこで標本から母数を推測します。これが推定です。
第6章はこう言っていました。「母数 $\mu$ を知っていれば、標本平均 $\bar{X}$ は $N(\mu,\ \sigma^2/n)$ にばらつく」。第7章はこれをひっくり返します。「手元の $\bar{x}$ から、見えない $\mu$ がどのあたりかを逆に絞り込む」。だから第6章の標本分布が、そのまま推定の道具になります。
第6章(標本分布)
母数 → 標本
$\mu$ を知って「$\bar{X}$ はどこに散る?」
未来の標本を予測する
第7章(推定)
標本 → 母数
$\bar{x}$ を見て「$\mu$ はどのへん?」
見えない母数を逆算する
点推定=1つの数値でズバリ当てます(例:支持率は 41%)。
区間推定=幅をつけて「この範囲」と当てます(例:支持率は 38〜44%)。
1点だけだと「どれくらい外れ得るか」が分かりません。だから本命は区間推定です。
点推定と「良い推定量」
1つの数値で母数を当てる:ただし「良い当て方」には条件がある
標本から計算した1つの値で母数をズバリ当てるのが点推定です。まずは「何を当てるのか」からです。当てる相手は母数です。母集団を特徴づける真の数値で、下のように何種類かあり、どれも未知です。それぞれに「いちばん素直な候補」があります。
| 当てたい母数(真の値・未知) | いちばん素直な点推定量 |
|---|---|
| 母平均 $\mu$ | 標本平均 $\bar{x}$ |
| 母比率 $p$ | 標本比率 $\hat{p}$ |
| 母分散 $\sigma^2$ | 不偏分散 $s_u^2=\dfrac{1}{n-1}\sum(x_i-\bar{x})^2$ |
同じ母数でも「当て方」は1つじゃない
上の表は「いちばん素直な候補」にすぎません。じつは同じ母数を当てる方法(推定量)は何通りもあります。具体例で見ましょう。
当てたいのは母平均 $\mu$ です(=母集団の中心)。手元の標本から「中心っぽい1つの値」を作るなら…
・標本平均(全部足して個数で割る)
・標本中央値(小さい順に並べたド真ん中)
左右対称な母集団(正規分布など)では 母平均 = 母中央値 なので、どちらも「$\mu$ を狙う推定値」として使えます。では $\mu$ を当てるのに、どちらを採用すべきでしょうか? これが「当て方(推定量)が複数ある」という問題です。$\mu$ という同じ相手に、候補となる推定量が2つ(以上)あるわけです。
候補が複数あるなら、その中から選ぶ「良い推定量」の物差しが要ります。良い推定量とは、ひとことで言えば「何度も標本を取り直したとき、母数を正確に・安定して射抜く」ものです。その良さを、次の3つの観点で測ります。
- 不偏性:狙いがズレていないか(平均すると母数に当たる)
- 一致性:データを増やすほど母数に近づくか
- 有効性:当たりのばらつきが小さいか
不偏性:平均すると的のド真ん中
推定量も標本ごとに変わる確率変数です。何度も標本を取り直して推定値を集めたとき、その平均がちょうど母数に一致するなら、その推定量は不偏(バイアスなし)です。式では $E[\text{推定量}]=\text{母数}$ です。的当てでいうと「狙いがズレていない」状態です。
一致性:データを増やせば真の値に吸い寄せられる
標本サイズ $n$ を大きくするほど、推定値が母数に限りなく近づく性質が一致性です。標本平均なら、標準誤差 $\sigma/\sqrt{n}$ が $n\to\infty$ で $0$ に近づく(=大数の法則)ので、$\bar{x}$ は $\mu$ に集中していきます。
有効性:同じ不偏なら、ばらつきが小さいほど良い
不偏な推定量が複数あるとき、分散がいちばん小さいものが優秀で、これを有効と呼びます。的の中心は同じでも、散らばりが小さいほど1回の推定が当たりやすいからです。
ここで、最初の「平均 vs 中央値」に決着がつきます。正規母集団では、標本平均も標本中央値もどちらも不偏です(平均すれば $\mu$)。
※ 歪んだ母集団では 母平均 ≠ 母中央値 なので、この勝負自体が成り立ちません。標本中央値は $\mu$ とは別の場所を狙うことになり、$\mu$ の推定量としては不偏ですらなくなります。
そのうえで差がつくのがばらつきです。同じ $n$ でも、標本中央値は標本平均より約1.5倍ばらつきやすくなります(分散が大きい)。つまり上の図の右側が標本中央値、左側が標本平均です。だから母平均の標準的な推定量は標本平均なのです。
最尤法(さいゆうほう):「いちばんありそうな母数」を選ぶ
母数を点推定する代表的な方法が最尤法です。「手元のデータがいちばん出やすくなるような母数」を、その母数の推定値に採用します。
表確率 $p$ が未知のコインを $10$ 回投げたら、表が $7$ 回出ました。$p$ をいくつと推定すればよいでしょうか?
・$p=0.5$ なら「7回表」が出る確率は中くらいです。$p=0.9$ なら高すぎて7回はやや出にくくなります。$p=0.7$ のとき、まさに「7回表」が最も出やすくなります。
・実際、「$n$ 回中 $x$ 回表」を最も尤もらしくする $p$ を計算すると $\hat{p}=\dfrac{x}{n}=\dfrac{7}{10}=$ 0.7。
→ では、たった $10$ 回投げただけで「$p=0.7$」と1点で決めてしまってよいのでしょうか。$10$ 回なら、たまたま上ブレ・下ブレすることは十分あり得ます。$0.7$ はあくまで「他の値よりありそう」というだけで、ズバリ当たっている保証はありません。
→ だから実務では、幅をつけて「このあたり」と示す区間推定のほうが主流になります(次の 2)。
区間推定の基本 🌟
点推定の弱点を埋める「幅つきの推定」と、信頼度の本当の意味
「支持率は $41\%$」と1点で言われても、それが $\pm 1\%$ の話か $\pm 10\%$ の話かで意味がまるで違います。点推定は必ず多少は外れるのに、その外れ幅を語らないのが弱点です。そこで「このあたりに母数がある」と幅で示すのが区間推定、その区間が信頼区間です。
= ど真ん中($\bar{x}$ など)から、左右に「ありえる誤差」を足し引きした幅
支持率(%)のような比率でも、成人男性の平均身長(cm)のような平均でも、信頼区間の求め方は同じです。ただし、平均と比率では標準誤差の計算方法が異なります。詳しくは 3(母平均)・4(母比率)で扱います。
では、幅はどれくらいに取ればいいのでしょうか。これはこちらで決めます。「この手順で区間を作ったとき、どれくらいの割合で母数を含んでほしいか」を先に指定するのです。この割合を信頼度(信頼水準)といい、慣習的に $95\%$ がよく使われます。そうして作った区間が95%信頼区間です。
信頼度を上げるほど、上の式の信頼係数が大きくなり、区間の幅は広がります(確実に当てたいなら、その分だけ大ざっぱな答えになる)。
信頼度95%の「正しい意味」
バスケのフリースローで考えると分かりやすくなります。
あるプロ選手は、フリースローを95%の確率で決める超人的な精度を持っているとします。この選手が1本打つことが、標本を1つ取って区間を作ることに対応します。
| フリースロー | 区間推定 |
|---|---|
| 1本打つ | 標本を1つ取り、区間を作る |
| シュートが入る | その区間が母数 $\mu$ を含む |
| 決定率 95% | 信頼度 95% |
つまり 95% は「選手の決定率」= 区間の作り方(手順)の性能です。同じ手順を何度も繰り返せば、作った区間の約95%が $\mu$ を含みます。これが信頼度95%の意味です。
ここで、打つ前にガヤが「これから打つシュートが入る確率は95%だ」と言うのは、誰がどう見ても正しいです。
同じように、標本を取る前に「これから作る区間が $\mu$ を含む確率は95%だ」と言うのも正しいです。ここは争いになりません。
問題はその先です。選手がすでにシュートを放ち、ボールが手を離れて空中にあるときです。「このシュートが入る確率は95%だ」と言えるでしょうか。
これが、すでに標本を取って $[48,\ 52]$ と計算し終えた区間を見て「ここに95%の確率で $\mu$ が入る」と言う行為にあたります。ここで解釈が2つに分かれます。
無風の体育館なら、手を離れた瞬間に入るか外れるかは確定しています。時を巻き戻して同じ状態から1万回やり直しても、1万回とも入るか、1万回とも外れるかのどちらかです。だから「確率95%」ではなく、0か1 です(どちらかは分からないだけ)。そもそも結果が確定しているのだから、確率で語るのが間違いです。
考え方B(ベイズ流):95%決める選手が放ったのだから、この1本も95%だ。
結果を知らない自分にとっては、まだ「入りそう」としか言えません。その確信の度合いを確率と呼ぶなら、この1本も95%でよいです(この立場では「95%信用区間」と呼ぶ)。
解釈が割れるのは、抽選 → 結果の確定 → 結果の観測という3段階のうち、どこまで「確率」で語ってよいかの線引きが違うからです。Aは「結果が確定した時点で確率の出番は終わり」、Bは「自分が観測するまでは確率で語ってよい」です。
(「観測するまで結果は確定しない」というシュレディンガーの猫の話とも雰囲気は似ています。ただしあちらは「観測するまで本当に結果が確定していない」という量子力学の話なので、A とも B とも違います。)
どちらの言い分も理解できますが、統計検定は A の立場(頻度論)に立ちます。確率を「何度も繰り返したときの割合」と定義するので、繰り返しようのない「もう放たれた1本」には確率を使わない、というルールです。どちらが正しいかではなく、確率という言葉の定義が違うだけです。
考え方A(頻度論)に立つ統計では、この言い方は誤りになります。
95%のような「確率」は、何度も繰り返したときに、変動するものがどんな結果を生むかを測る言葉です。つまり確率を語れるのは変動するものについてだけです。
ここで変動するのは標本とその信頼区間の方です(シュートは1本ごとに違う軌道を描く)。真の母数 $\mu$ は動かない定数(ゴールリングは動かない)なので、$\mu$ に確率を貼り付けることはできません。だから 95% がかかっているのは「区間の作り方」の方です。
言い換えると、「$\mu$ が95%の確率で動いてこの区間に入る」のではなく、「区間の作り方が95%の確率で $\mu$ を捕まえる」です。
なお、バスケならシュートが入ったかどうかは目で見えますが、区間が $\mu$ を含んだかどうかは確認できません。真の $\mu$ を知らないからです(知っていれば推定はいりません)。また、この95%はデータを見る前の約束なので、都合のいい結果だけを選んで報告したり、データを見てから区間の作り方を変えたりすると、95%という保証は崩れます。
言葉だけだと分かりにくいので、実際に「同じ手順」で100本の95%信頼区間を作ってみます。何本が母平均 $\mu$ を含むでしょうか。
母平均 μ の区間推定
σ を知っているか否かで、使う分布が変わる
第6章より、$\bar{X}\sim N\!\left(\mu,\ \sigma^2/n\right)$ です。標準化すると $\dfrac{\bar{X}-\mu}{\sigma/\sqrt{n}}\sim N(0,1)$ で、その値が $\pm 1.96$ に収まる確率が $95\%$ です(第5章の確率表)。これを $\mu$ について解くだけで、母平均の95%信頼区間が出ます。
① 母分散 σ が既知のとき(正規分布)
信頼度を上げる(90%→95%→99%)と係数は $1.645\to1.96\to2.576$ と大きくなり、区間は広くなります。
ある部品の長さの母標準偏差は $\sigma=12$mm とわかっています。$n=36$ 個を測ったら標本平均 $\bar{x}=72$mm です。母平均 $\mu$ の95%信頼区間は?
・標準誤差 $\dfrac{\sigma}{\sqrt{n}}=\dfrac{12}{\sqrt{36}}=\dfrac{12}{6}=2$
・$72 \pm 1.96\times 2 = 72 \pm 3.92$ → $[68.08,\ 75.92]$
② 母分散 σ が未知のとき(t分布)
現実には $\sigma$ も不明なことがほとんどです。$\sigma$ の代わりに不偏標準偏差 $s_u$ を使うと、第6章で見たとおり分布は正規分布より裾が太い自由度 $n-1$ の t分布になります。だから係数 $1.96$ を $t$ 値に置き換えます。
$t_{0.025,\,n-1}$ は「自由度 $n-1$ の t分布で、上側 $2.5\%$ の点」です。$\sigma$ が不確実なぶん $1.96$ より大きく、区間は少し広くなります。$n$ が大きいほど $t$ は $1.96$ に近づきます。
| 自由度 $n-1$ | 5 | 10 | 30 | ∞(正規) |
|---|---|---|---|---|
| $t_{0.025}$ | 2.571 | 2.228 | 2.042 | 1.960 |
母集団:ある学校の全生徒(数百人)のテスト得点です。標本:そのうち無作為に選んだ $n=16$ 人です。標本平均 $\bar{x}=50$ 点、不偏標準偏差 $s_u=8$ 点です(母分散 $\sigma^2$ は未知)。全生徒の平均点 $\mu$ の95%信頼区間は?
・自由度 $n-1=15$ → $t_{0.025,\,15}=2.131$
・標準誤差 $\dfrac{s_u}{\sqrt{n}}=\dfrac{8}{\sqrt{16}}=\dfrac{8}{4}=2$
・$50 \pm 2.131\times 2 = 50 \pm 4.26$ → $[45.74,\ 54.26]$
(もし $1.96$ で計算すると $\pm3.92$ と狭すぎます。$\sigma$ 未知の不確実性を $t$ がきちんと広げてくれます。)
使い分けフローチャート
母比率 p の区間推定
世論調査・視聴率でおなじみの「±誤差」の正体
賛成/反対、当たり/外れのような割合を推定したいとします。標本比率 $\hat{p}$ は、$n$ が大きければ第6章より $\hat{p}\approx N\!\left(p,\ \dfrac{p(1-p)}{n}\right)$ に従います。標準誤差の $p$ は未知なので $\hat{p}$ で代用すると、母比率の信頼区間が作れます。
$n=1000$ 人に聞いたら支持が $400$ 人、つまり $\hat{p}=0.40$ です。母支持率 $p$ の95%信頼区間は?
・標準誤差 $\sqrt{\dfrac{0.4\times0.6}{1000}}=\sqrt{\dfrac{0.24}{1000}}=\sqrt{0.00024}\approx 0.0155$
・$0.40 \pm 1.96\times0.0155 = 0.40 \pm 0.0304$ → 約 $[37.0\%,\ 43.0\%]$
→ ニュースの「支持率 40%(誤差 ±約3%)」は、まさにこの $1.96\times\text{SE}$ です。標本 $n$ を増やせば誤差は $\sqrt{n}$ ぶんだけ縮みます。
母分散 σ² の区間推定
「ばらつき」を推定する:ここでカイ二乗分布が登場
中心(平均)ではなくばらつき(分散)そのものを区間で推定したい場面です。品質管理で「製品の分散が規定内か」などです。第6章の関係 $\dfrac{(n-1)s_u^2}{\sigma^2}\sim\chi^2_{n-1}$ を使って、$\sigma^2$ を挟み込みます。
カイ二乗分布は左右非対称なので、上側・下側で割る点が違う ⇒ 区間も中心に対して非対称になります。
$n=10$ 本を測ったら不偏分散 $s_u^2=4$ です。母分散 $\sigma^2$ の95%信頼区間は?(自由度 $9$:$\chi^2_{0.025,9}=19.02$, $\chi^2_{0.975,9}=2.70$)
・分子 $(n-1)s_u^2 = 9\times 4 = 36$
・下限 $\dfrac{36}{19.02}\approx 1.89$、上限 $\dfrac{36}{2.70}\approx 13.33$
→ $1.89 \le \sigma^2 \le 13.33$(点推定の $s_u^2=4$ を中心に、右へ大きく広がる非対称な区間)。
$\dfrac{(n-1)s_u^2}{\sigma^2}\sim\chi^2_{n-1}$ は、母集団が正規分布であることから導かれた関係です(第6章)。しかもこの前提は、母平均のときと違って $n$ を増やしても緩められません。
・母平均の区間:中心極限定理が使えるので、母集団が多少ゆがんでいても $n$ が大きければそこそこ使える
・母分散の区間:$n$ を増やしても改善せず、母集団がゆがんでいると信頼度が $95\%$ から大きくズレる
そのため、母比率(0/1 データ)のばらつきにこの式は使えません。0/1 は正規分布から最も遠い形ですし、そもそも二値データの母分散は $\sigma^2 = p(1-p)$ と母比率 $p$ だけで決まってしまうので、$p$ とは別に分散を推定する場面自体がありません(4 の母比率の区間推定を使います)。
相関係数の区間推定:フィッシャーの $z$ 変換
第2章で計算した相関係数 $r$ も、標本から求めた「推定値」です。30人分のデータで $r=0.6$ と出ても、別の30人なら $0.5$ かもしれないし $0.7$ かもしれません。母集団での相関係数 $\rho$(ロー)はどの範囲にあるのか、これも区間で答えたいところです。
ところが $r$ には、平均のときにはなかった厄介な性質があります。$-1$ と $1$ に壁があることです。$\rho=0.8$ のとき、$r$ は上には $1$ までしか動けないのに下には大きく動けるので、$r$ の分布は左に歪みます。正規分布の形をした「$\pm 1.96 \times$ 標準誤差」は使えません。
手順は3ステップです。$r$ を $z$ に変換する → $z$ の世界で区間を作る → 区間の両端を $r$ に戻す。戻すときは $r = \dfrac{e^{2z}-1}{e^{2z}+1}$ を使います。
・$z$ に変換:$z=\dfrac{1}{2}\ln\dfrac{1.6}{0.4}=\dfrac{1}{2}\ln 4 \approx 0.693$
・標準誤差:$\dfrac{1}{\sqrt{30-3}}=\dfrac{1}{\sqrt{27}}\approx 0.192$
・$z$ の区間:$0.693 \pm 1.96 \times 0.192 = 0.693 \pm 0.377$ → $[0.316,\ 1.070]$
・$r$ に戻す:下限 $\dfrac{e^{0.632}-1}{e^{0.632}+1}\approx 0.31$、上限 $\dfrac{e^{2.140}-1}{e^{2.140}+1}\approx 0.79$
→ $0.31 \le \rho \le 0.79$。$r=0.6$ を中心に、下へ $0.29$、上へ $0.19$ と非対称な区間になります。壁に近い上側ほど幅が詰まるからです。
※ 区間に $0$ が入らなければ「母集団でも無相関ではない」と言えます(第8章の検定と表裏一体の関係です)。試験では $\ln$ や $e^{2z}$ の値は問題文か数表で与えられます。
2標本:差の区間推定
「A と B でどれだけ違うか」を区間で見積もる
実務では「1つの母数」より「2群の差」を知りたいことが多いです。新薬と旧薬の効果差、A店とB店の平均売上差などです。点推定は素直に $\bar{x}_1-\bar{x}_2$ です。あとはその差の標準誤差に係数を掛けて幅をつけます。
たとえば、こんな場面です。
・A店の日商:$25$ 日分を集計 → 平均 $52.0$ 万円、不偏標準偏差 $8.0$ 万円
・B店の日商:$25$ 日分を集計 → 平均 $46.0$ 万円、不偏標準偏差 $6.0$ 万円
見えている差は $6.0$ 万円です。でもこれはたまたま集計した25日ぶんの差にすぎません。知りたいのは「この2店の実力の差は、結局どのくらいなのか」です。それを幅で答えるのがこの節です(計算はこの後で)。
2群が独立なので、ばらつき(分散)は足し算です。各群のばらつきを別々に見積もった形で、ウェルチ (Welch) の方法と呼ばれます(第8章の2標本の検定で、検定の形としてもう一度紹介します)。母比率の差も同様に $(\hat{p}_1-\hat{p}_2)\pm 1.96\sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1}+\frac{\hat{p}_2(1-\hat{p}_2)}{n_2}}$ です。
ルートの中身が $\dfrac{s_{u1}^2}{n_1}+\dfrac{s_{u2}^2}{n_2}$ になる理由を、2段階に分けます($s_{u1}^2,\ s_{u2}^2$ は各群の不偏分散)。
① $\dfrac{s_{u1}^2}{n_1}$ は「A群の標本平均のばらつき」
第6章で、標本平均のばらつきは $V[\bar{X}]=\dfrac{\sigma^2}{n}$、その平方根が標準誤差 $\dfrac{\sigma}{\sqrt{n}}$ でした。つまり $\dfrac{\sigma^2}{n}$ は標準誤差の2乗=標本平均の分散です。$\sigma$ は未知なので不偏分散 $s_u^2$ で代用すると $\dfrac{s_{u1}^2}{n_1}$ です。これが式の中身の正体で、データそのもののばらつきではなく「$\bar{x}_1$ という1個の値がどれだけ揺れるか」を表しています。
② 引き算なのに、ばらつきは足し合わさる
2群が独立なら $V[\bar{X}_1-\bar{X}_2]=V[\bar{X}_1]+V[\bar{X}_2]$ です。引き算なのに足すのは直感に反しますが、こう考えると腑に落ちます。
A店の平均が偶然高めに出て、同時に B店の平均が偶然低めに出ると、その差 $\bar{x}_1-\bar{x}_2$ は本当の差より大きく出ます。逆に A店が低め・B店が高めなら、本当の差より小さく出ます。どちらにしても2つの誤差は打ち消し合わず、積み上がります。
独立とは「互いに無関係」ということなので、都合よく相殺してくれる保証がないのです。だから引き算でも、揺れの量(分散)は足します。最後に $\sqrt{\ }$ を取って標準誤差に戻します。
A店:$n_1=25$ 日、$\bar{x}_1=52.0$ 万円、不偏標準偏差 $s_{u1}=8.0$ 万円
B店:$n_2=25$ 日、$\bar{x}_2=46.0$ 万円、不偏標準偏差 $s_{u2}=6.0$ 万円
・点推定(差):$52.0-46.0=6.0$ 万円
・A店の標本平均の分散 $\dfrac{s_{u1}^2}{n_1}=\dfrac{64}{25}=2.56$、B店は $\dfrac{s_{u2}^2}{n_2}=\dfrac{36}{25}=1.44$
・差の分散 $=2.56+1.44=4.00$ → 差の標準誤差 $=\sqrt{4.00}=2.0$ 万円
・自由度は近似で $44$($44.5$ を切り捨て)→ $t_{0.025,\,44}\approx 2.015$
・$6.0 \pm 2.015\times 2.0 = 6.0 \pm 4.03$ → $[1.97,\ 10.03]$
→ 区間に $0$ が入っていないので、「差はない」とは考えにくいです。A店のほうが約2万〜10万円ほど高いと見積もれます。
※ 各群のばらつきを別々に見積もる(ウェルチの方法)と、自由度はきれいな整数にならず近似で求めます。試験では自由度が与えられることがほとんどです。なお2群のばらつきが等しいとみなせるときは、両群をまとめて見積もる「プール」版(自由度 $n_1+n_2-2$)も使えます。どちらを使うかの判断は第8章で扱います。
形は母平均の差とまったく同じです。各群の $\hat{p}$ の分散 $\hat{p}(1-\hat{p})/n$ を足してルートを取ると、差の標準誤差になります。比率は正規近似で扱うので、$t$ ではなく $1.96$ を使います。
あるWebページのデザインを2案つくり、訪問者にどちらかを表示してクリック率を比べました。
A案(既存):$n_1=500$ 人に表示 → クリック $60$ 人、$\hat{p}_1=\dfrac{60}{500}=0.12$
B案(新規):$n_2=500$ 人に表示 → クリック $90$ 人、$\hat{p}_2=\dfrac{90}{500}=0.18$
・点推定(差 B−A):$0.18-0.12=0.06$(6ポイント)
・各群の $\hat{p}$ の分散:$\dfrac{0.12\times0.88}{500}\approx0.000211$、$\dfrac{0.18\times0.82}{500}\approx0.000295$
・差の分散 $\approx 0.000506$ → 差の標準誤差 $=\sqrt{0.000506}\approx 0.0225$
・$0.06 \pm 1.96\times0.0225 = 0.06 \pm 0.044$ → $[0.016,\ 0.104]$(約 $1.6\%$〜$10.4\%$)
→ 区間に $0$ が入っていないので、B案のほうが 1.6〜10.4 ポイント高いと見積もれます。
※ 平均のときと違って $t$ ではなく $1.96$ を使うのは、比率は正規近似で扱うからです(第6章の目安 $np\ge5$ かつ $n(1-p)\ge5$ を満たしている)。
最後に、2群の「ばらつきの違い」を区間で見積もる方法です。差ではなく比で見るところがポイントです。$\sigma_1^2/\sigma_2^2$ が $1$ なら等分散、$1$ から離れるほどばらつきが違います。第6章で見たとおり、2つの不偏分散の比は $F$ 分布に従うので、それを使って区間を作ります。
$F_{0.025}(a,b)$ は自由度 $(a,b)$ の $F$ 分布の上側 $2.5\%$ 点です。母分散の区間と同じく、$F$ 分布は左右非対称なので区間も非対称になります。下限で割る $F$ と上限で掛ける $F$ で、自由度の順番が入れ替わることに注意してください。
さきほどのA店・B店(各 $n=25$ 日、不偏標準偏差 $8.0$ 万円と $6.0$ 万円)です。自由度は $(24,\,24)$ で、$F_{0.025}(24,24)=2.27$ とします。
・分散の比(点推定):$\dfrac{8^2}{6^2}=\dfrac{64}{36}\approx 1.78$
・下限:$1.78 \div 2.27 \approx 0.78$、上限:$1.78 \times 2.27 \approx 4.04$
→ $0.78 \le \dfrac{\sigma_1^2}{\sigma_2^2} \le 4.04$。区間に $1$ が入っているので、「A店のほうがばらつきが大きい」とは言い切れません。点推定では $1.78$ 倍でも、25日ずつではこの程度の差は偶然で出ます。
標本サイズの設計
「誤差 ±X に抑えるには、何人調べればいい?」を逆算する
ここまでは「$n$ 人調べたら誤差はいくつ」でした。実務では逆です。「誤差を ±$E$ 以内に抑えたい。$n$ は最低いくつ必要?」という問いです。誤差幅 $E=z\cdot\sigma/\sqrt{n}$ を $n$ について解くだけです。
母比率で $p$ が見当もつかないときは、誤差が最大になる最悪ケース $p=0.5$ を入れます(安全側)。
支持率を「誤差 ±$3\%$、信頼度95%」で調べたいとします。何人に聞けばよいでしょうか?($p$ 不明なので $p=0.5$)
・$n \ge \dfrac{1.96^2\times 0.5\times0.5}{0.03^2} = \dfrac{3.8416\times0.25}{0.0009} = \dfrac{0.9604}{0.0009}\approx 1067.1$
→ 約 1068 人。世論調査がよく「約1000〜2000人」なのは、これが理由です。
・誤差を半分(±1.5%)にしたいなら $n$ は4倍です(約4270人)。精度は $\sqrt{n}$ でしか上がりません。
ある部品の平均の長さを「誤差 $\pm 0.5$mm、信頼度95%」で推定したいとします。過去の製造データから、ばらつきは $\sigma \approx 3$mm と分かっています。何個測ればよいでしょうか?
・$n \ge \left(\dfrac{z\,\sigma}{E}\right)^{\!2} = \left(\dfrac{1.96\times 3}{0.5}\right)^{\!2} = \left(\dfrac{5.88}{0.5}\right)^{\!2} = 11.76^2 \approx 138.3$
→ 139 個(必要数なので切り上げます。138個では誤差 $\pm0.5$mm に届きません)。
・誤差を $\pm 0.25$mm と半分にしたいなら $n$ は4倍の約 $553$ 個。ここも $\sqrt{n}$ の壁は同じ。
※ 母平均のほうは $\sigma$ が必要です。過去のデータや予備調査から見積もり、分からなければ大きめに見積もると安全側です(比率の $p=0.5$ と同じ発想)。