第8章 / STEP 4

仮説検定

その差は、偶然か。それとも本物か。確率で白黒をつける
帰無仮説・対立仮説 p値・有意水準 第1種・第2種の過誤 検出力 z検定・t検定 比率・分散の検定

最終更新:

なぜ仮説検定?
「母数はいくつ?」(推定)から「○○と言い切れるか?」(検定)へ

新薬を飲んだ群は、飲まない群より回復が 0.6日 早くなりました。改修後のサイトはクリック率が 10% → 13% に上がりました。ここで必ず湧く疑問が「その差は本物か、それともたまたまか」です。標本は取り直すたびに揺れるので、真の差がゼロでも、見かけ上の差は普通に出ます。その揺れの範囲を超えた「本物の差」かを、確率で判定するのが仮説検定 (hypothesis testing)です。

第7章(推定)は「母数はどのへんか」を幅で答えました。第8章は問いの形が違います。「母数は特定の値(例:差ゼロ)と言えるか/違うと言えるか」に Yes / No で答えます。推定が位置を測るなら、検定は判定を下すわけです。道具(標本分布・標準誤差)は推定と完全に共通です。

第7章(推定)

「いくつ?」に答える
母数の値を点 or 区間で見積もる
例:支持率は 38〜44%

第8章(検定)

「言えるか?」に答える
ある主張が成り立つかを Yes/No 判定
例:支持率は前回と「変わった」と言える

検定の心臓は、たった1つの問い:
「差なんて無い」と仮定したら、いま観測されたこの差はどれくらい起こりにくいか?
起こりにくすぎる(例:5%未満)なら、「差なんて無い」という仮定の方が間違っていた、と結論します。
1

仮説検定の枠組み 🌟

帰無仮説・対立仮説・棄却域・有意水準・p値:全検定に共通する骨格

どの検定も、登場人物と手順はまったく同じです。骨格を1つ通してつかめば、あとは「使う分布が z か t か χ² か」が変わるだけです。ここでは実務でいちばん多い形です。2つのグループの比較を例にします。

たとえば、サイト改修の効果を見たいとします。改修前は長期間の運用でクリック率が $10\%$ で安定していました。改修後の1週間に来た訪問者を数えたら、500人中65人がクリック($13\%$)しました。

ここで肝心なのは、改修後の この $13\%$ は全訪問者の“真のクリック率”ではなく、その1週間にたまたま来た 500人(=標本)から測った値だということです。観測する週が違えば来る人も入れ替わり、数字も揺れます(別の週に同じ規模で測れば $11\%$ や $15\%$ …といった具合に)。しかも揺れの大きさは見る人数しだいです。$500$ 人ではなく $3000$ 人を見れば、数字はもっと真の値に近く安定します(人数が多いほどブレは小さくなります。第6章)。だから +$3\%$ を見て即「改修が効いた」とは言えません。
この +3% は本物の差なのでしょうか? それとも 真のクリック率は改修前と同じ $10\%$ のままなのに、たまたま観測した1週間の 500人でだけ高く出ただけなのでしょうか。
差が見えても、原因は2通りです。⒜本当に真のクリック率が上がったから、⒝真の値は $10\%$ のままなのに、標本のブレで見かけ上ズレただけです。仮説検定は、この「本物の差 か 偶然の見かけの差 か」を確率で見分ける道具です。

① 帰無仮説 H₀ と 対立仮説 H₁:なぜ「否定したい方」を立てるのか

検定では、相反する2つの仮説を立てます。

帰無仮説 H₀(null hypothesis)

「差がない・効果がない・いつも通り」という、否定されることを狙って立てる仮説です。
例:改修前後で真のクリック率は同じ(差 = 0)

対立仮説 H₁(alternative)

「差がある・効果がある」という、本当は主張したい仮説です。H₀ を棄却できて初めて採用されます。
例:改修でクリック率が変わった(差 ≠ 0)

わざわざ「主張したいことの逆(差がない)」を $H_0$ に置くのは、回りくどく見えます。

なぜ「H₁ を直接証明」せず「H₀ を否定」するのでしょうか。 「差がある」を直接証明しようにも、差の大きさは無限通り(+1%? +3%? +10%?)あって的が絞れません。一方「差がない(差 = 0 ちょうど)」なら値が1点に定まり、そのとき偶然だけで差がどう散らばるか(標本分布)を計算できます。そこで「差がないと仮定 → なのに現実はこんなに大きな差が出た → 仮定がおかしい」と背理法で攻めます。だから否定したい命題をあえて $H_0$ に据えます。数学の「$\sqrt{2}$ が無理数」を背理法で示すのと同じ発想です。

② 検定統計量・棄却域・有意水準 α

$H_0$ は「差はない」と置きました。では、仮に本当に差がないとしたら、観測される差は実際どうなるのでしょうか。さっきのクリック率の例で確かめます。

改修の前も後も、見られるのは訪問者全員ではなく一部(標本)のクリック率だけです。第6章で見た通り、標本は取るたびにブレます。だから、たとえ本当はまったく差が無くても、前後で観測されるクリック率がピッタリ同じになることはまずなく、観測される差は「0」の周りに散らばります。

観測された 13% という1つの数字の裏には、2つの世界がありえます。本当に効果があった世界と、本当は何も変わっていない世界です。どちらの世界でも「後の群が 13%」は起こりえます。起こりやすさが違うだけです。

本当に差がある世界 真の値が 10% と 12% でズレている 改修前 10% 改修後 12% 観測 10% 観測 13% 12% の山から 少し上振れた だけ:よくある話 本当は差がない世界(H₀) 真の値はどちらも 10%:山がぴったり重なる 改修前・改修後 とも 10% 観測 10% 観測 13% 同じ山から 大きく上振れた:無くはないが珍しい 差がない世界で、観測された標本どうしの差(後 − 前)を取り出す 「差がない世界」で観測される「標本の差」の分布:検定はこれ1枚で判定する 観測されうる標本の差 → 真の値は同じでも、標本はブレるので、標本の差は 0 の周りに散らばる 差 0 いま観測された標本の差 = +3% +3% この山のどこに +3% が乗るか:中央寄りか、端すぎるか。それが判定のすべて。
同じ「13%」でも、差がある世界ならありふれた上振れ、差がない世界なら珍しい上振れです。どちらの世界かはこちらには見えないので、計算できる「差がない世界」だけを描き、観測した差がその山の端すぎないかを見ます。これが検定の全体像です。

あとは、実際に観測した差をこの横軸の上で見るだけです。中央近くなら「差が無くても偶然よく出る差」なので差ありとは言えません。両端の遠くまで外れていたら「差が無いなら、まずこんな差は出ない」ので、「差なし」という仮定の方が苦しい → 棄却します。その「まず出ない」端を棄却域、面積を有意水準 α(ふつう $5\%$)と前もって決めておきます。検定統計量・棄却域・α は、すべてこの1枚の図に乗ります。

もし本当は差が無いなら(H₀):偶然のブレだけで出る「差」の分布 観測される差 → −1.96 0 +1.96 中心=差なし(0)=H₀ の予想 採択域 (約 95%) 偶然でもよく出る差 棄却域 まず出ない差 棄却域 まず出ない差 赤い棄却域(左右 2.5%ずつ)の面積の合計 = 有意水準 α = 5% 破線=臨界値(採択域と棄却域の境界)。観測した差がこの外側なら「差なし」が苦しい → H₀ を棄却。
「差が無いと仮定したとき、偶然だけで出る差」の分布です。観測した差が中央の採択域なら「差ありとは言えない」、両裾の棄却域まで外れていれば「偶然では起きない → 差あり(H₀ を棄却)」です。棄却域の面積を $5\%$ に決めたものが有意水準 α、その境目が臨界値です。図は両側 $5\%$ の例です。
用語:図と対応

検定統計量:観測データ全体を1つの数にまとめたものです(例:観測された差)。この数が横軸のどこに来るかで判定します。
棄却域(赤い両裾):「差が無い($H_0$)なら、まず出ない」差の範囲です。観測した差がここなら $H_0$ を棄てます。
採択域(中央):それ以外です。ここなら「差があるとは言えない」です。
臨界値(破線):採択域と棄却域の境目です。
有意水準 α:棄却域の面積=「本当は差が無いのに、誤って『差あり』と言ってしまう確率」を、あらかじめ $5\%$ などに固定します。

③ p値:観測値の「起こりにくさ」を1つの確率に

棄却域は「入ったか・入らないか」の白黒判定でした。どれくらい際どかったかまで数値にしたのがp値です。定義は「$H_0$ が正しいとき、いま観測された統計量と同じか、それ以上に極端な値が出る確率」です。分布の裾の面積です。

⚠️ なぜ「ちょうどその値の確率」でなく「それ以上に極端(裾の面積)」なのか

第5章で見た通り、連続分布では1点ちょうどの確率は $0$ です($P(Z=2.0)=0$)。だから「観測値ぴったりの確率」では何も測れません。意味を持つのは区間の面積だけです。そこで「観測値以上に極端な側の面積」をとります。これなら「観測が裾の奥にあるほど面積は小さく、起こりにくい」を、ちゃんと $0$ でない数で表せます。

判定はシンプルです。p値 $<$ α なら $H_0$ を棄却します(=統計的に有意)。p値が小さいほど「$H_0$ のもとでは、ありえないほど極端なことが起きた」ので、$H_0$ を疑う根拠が強くなります。下のスライダーで観測値を動かし、裾の面積(p値)と判定がどう連動するかを見てください。

観測された検定統計量 z = 2.30
薄い帯が棄却域(両側 $|z|>1.96$、面積=α=5%)。濃い塗りが観測値より外側の面積=p値。観測 $z$ を裾の奥へ動かすほど濃い面積(p値)は小さくなり、$|z|$ が $1.96$ を超えた瞬間に p $<$ 0.05 となって棄却に変わります。「棄却域に入る」と「p値 $<$ α」は同じことを、面積で見て確かめられます。
用語整理:「有意」まわり

有意=「偶然では説明しにくい」です。日常語の「重要」「差が大きい」ではありません。
有意水準 α:データを見る前に決めておく基準です(ふつう $5\%$)。
有意確率:p値の別名です。データから後で計算する値です。試験ではこの呼び方も出ます。
「有意差がある」:p値 $<$ α で $H_0$ を棄却できた、という意味です。「差がゼロとは考えにくい」であって、差が大きいとは言っていません。
「A は B より有意に高い」:$H_0$ を棄却でき、しかも差の向きが「A のほうが高い」側だった、ということです。片側検定でも両側検定でも使う言い方です。

この5つのうち、いちばん直感に反するのが有意確率(p値)です。名前に「有意」と付いているのに、小さいほど有意という向きになります。

⚠️ 有意確率は「小さいほど有意」

p値(有意確率)は「$H_0$ が正しいとしたら、これほど極端なデータが出る確率」なので、小さいほど $H_0$ が苦しいです。
つまり有意確率が低いほど「有意(偶然では説明しにくい)」と言えます。直感に反するので注意が必要です。

④ 検定の5ステップ(どの検定でも共通)

検定の手順(5ステップ)
  1. 仮説を立てる:$H_0$(差なし)と $H_1$(差あり/片側なら向きも)。
  2. 有意水準 α を決める:ふつう $0.05$。厳しくするなら $0.01$。
  3. 検定統計量を計算:$\dfrac{\text{推定値}-\text{}H_0\text{の値}}{\text{標準誤差}}$ の形。$H_0$ のもとで z/t/χ²/F のどれに従うか確認。
  4. 比較:統計量が棄却域に入ったかを見る。p値と α を比べても同じ。同じ図を「横軸の位置」で見るか「裾の面積」で見るかの違いだけで、結論は必ず一致する。
  5. 結論:棄却 →「有意差あり($H_1$)」/棄却できず →「差があるとは言えない」。
⚠️「棄却できない」=「H₀ が正しい」ではない

検定が言えるのは「$H_0$ を否定できた」か「否定する証拠が足りなかった」か、だけです。後者は「差がないと証明された」のではなく、ただ判断を保留している状態です(「証拠不十分で無罪」に近い状態で、無実が証明されたわけではありません)。「$H_0$ を採択=差はないと確定」と書くと誤りです。

この5ステップを、2つの例でそのまま通してみます。まずは導入のクリック率で流れ全体を、次に手計算で追えるコインで細部を見ます。

具体例ⅰ:サイト改修でクリック率は上がった?(実務でいちばん多い形)

状況:改修前は長期間(過去半年)の運用でクリック率が $10\%$ で安定しています。大量のデータがあるので、ほぼ真の値(基準)$p_0=0.10$ とみなせます。改修後の1週間に来た $n=500$ 人のうち $65$ 人がクリックしました($\hat{p}=13\%$)。改修で本当に上がったと言えるでしょうか。
※ 揺れるのは「後の $500$ 人」の側だけです。前は長期の実績なので、固定した基準として扱います(だから $1$ 標本の検定になる)。

  1. 仮説:$H_0:\ p=0.10$(改修前と同じ)/ $H_1:\ p\neq0.10$(変わった・両側)。
    改修はクリック率を下げてしまう可能性もあるので、片側にはしない。「上がった場合しか見ない」と決めてよいのは、下がる心配が理屈のうえで無いときだけ。
  2. 有意水準:$\alpha=0.05$。
  3. 検定統計量:「差が無い($p=0.10$)」なら、$500$ 人から測る $\hat{p}$ は $0.10$ を中心に、標準誤差 $\sqrt{\dfrac{p_0(1-p_0)}{n}}=\sqrt{\dfrac{0.10\times0.90}{500}}=\sqrt{0.00018}\approx0.0134$ のブレで散らばる(第6章)。この標準誤差で観測差を割って $z$ を計算する:
    $\;z=\dfrac{\hat{p}-p_0}{\sqrt{p_0(1-p_0)/n}}=\dfrac{0.13-0.10}{0.0134}=\dfrac{0.03}{0.0134}\approx 2.24$
    =観測した +$3\%$ は、「差が無いとき出るブレ」の約 2.2 個ぶん外側、ということ。(この $z$ の形は 5「母比率の検定」で正式に扱う。)
  4. 比較:両側 $5\%$ の棄却域は $|z|>1.96$(標準正規分布表より)。$2.24>1.96$ なので棄却域に入る。p値 $=2\times P(Z>2.24)\approx0.025<0.05$。
  5. 結論:$H_0$ を棄却。改修後はクリック率が統計的に有意に上がったと言える。
コラム:有意でも「改修のおかげ」とは限らない(有意 ≠ 因果)

検定で言えたのは「前後で差がある」という関連だけです(第2章「相関は因果ではない」と同じ話です。2つの量が一緒に動くのが「相関」で、群の間で違いがあるのも含めた広い言い方が「関連」です)。その差が改修のおかげなのか、たまたま年末商戦などの季節要因で全体が底上げされたのか、同時期に打った別施策のせいなのかは、この検定からは区別できません。「差が有意 → 改修が効いた」と飛びつくのは誤りです。因果を言うには、同時期に改修なし群(対照群)を置いてランダムに振り分けます。第3章の RCT のような仕組みが要ります。Webでよく聞く A/Bテスト がまさにこれで、訪問者をランダムに旧デザイン(A)と新デザイン(B)へ振り分けます。同時期・ランダムなので季節要因も別施策も両群に等しくかかり、差の原因を改修に絞り込めます。検定は「差の有無」、因果は「実験デザイン」の担当です(詳しくは 7)。

具体例ⅰは途中の数式を 5「母比率 p の検定」にあずけました。もう1つ、最後まで手計算で追える例を挙げます。新しい公式は要らず、第5章の二項分布だけで枠組みがそのまま動きます。

具体例ⅱ:10回投げて9回が表だったコイン

状況:いかさまを疑うコインを $10$ 回投げたら、表が $9$ 回出ました。このコインは「公平でない」と言えるでしょうか。

  1. 仮説:$H_0:\ p=0.5$(公平)/ $H_1:\ p\neq0.5$(公平でない・両側)。
  2. 有意水準:$\alpha=0.05$ に決める。
  3. 検定統計量:表の回数 $X$。$H_0$ が正しければ $X\sim\text{Bin}(10,\,0.5)$(第5章の二項分布)。観測は $X=9$。
  4. どれくらい極端か(p値):「$9$ 回以上表」の確率は
    $\;P(X\ge9)=\dfrac{{}_{10}C_{9}+{}_{10}C_{10}}{2^{10}}=\dfrac{10+1}{1024}=\dfrac{11}{1024}$。
    両側なので反対の端「$1$ 回以下」も同じ $\dfrac{11}{1024}$。合計 p値 $=\dfrac{22}{1024}\approx0.0215$。
  5. 結論:$0.0215<0.05$ なので $H_0$ を棄却。このコインは公平でないと言える。

この $X$ の分布を絵にすると、さきほどの棄却域と採択域の図がそっくりそのまま現れます。中央が採択域、両端の赤が棄却域、その面積が p値です(≒α と比べる相手)。

もしコインが公平なら(H₀: p=0.5):10回中「表」が出る回数 X の分布 棄却域 {0,1} 棄却域 {9,10} 0 1 2 3 4 5 6 7 8 9 10 表の回数 X 観測 X=9 両端(赤)の面積の合計 = p値 = 22/1024 ≒ 0.0215 < α=0.05 → 棄却
公平($H_0$)なら表の回数 $X$ は5回あたりが最も出やすい山型です(二項分布)。$9$ 回は右端の赤い棄却域に落ちます。公平ならめったに起きません。両端の赤い面積の合計がp値 ≈ 0.0215 で、$\alpha=0.05$ より小さいので棄却します。
補足:この2例で使った式について

クリック率の例で使ったのは、大標本の z検定 $z=\dfrac{\hat{p}-p_0}{\sqrt{p_0(1-p_0)/n}}$ です。コインも同じ「割合(母比率)の検定」ですが、$n=10$ と小さく正規近似が使えないので、$z$ ではなく二項分布で厳密に計算した版(5 の $z$ は $n$ が大きいときの近似)。検定の枠組みは1つ、計算の道具が「大標本→z/小標本→二項」と変わるだけです。

2

第1種・第2種の過誤と検出力

判定は2方向に間違えうる:そのトレードオフを2つの分布の重なりで見る

検定は確率に基づく判定なので、必ず間違える可能性があります。間違いには2方向あり、裁判の比喩がぴたりと当てはまります($H_0$=「被告は無実」)。

真実 検定の判定 H₀ が真(差なし) H₀ が偽(差あり) H₀ を棄却 (差ありと判定) H₀ を棄却せず (差ありと言えない) 第1種の過誤 ✗ 確率 = α 無実の人を有罪に 正しい判定 ✓ 検出力 = 1−β 真犯人を有罪に 正しい判定 ✓ 確率 = 1−α 第2種の過誤 ✗ 確率 = β 真犯人を取り逃がす
第1種の過誤(α):差がないのに「ある」と早とちりすることです。第2種の過誤(β):差があるのに見逃すことです。両方とも正しく当てた対角線が理想です。
用語:α・β・p値の違い

α(第1種)= $H_0$ が真なのに棄却する確率です。=有意水準です(自分で $5\%$ に設定する)。
β(第2種)= $H_0$ が偽なのに棄却しそこなう確率です。見逃し率です。
検出力 (power) = 1−β= 本当に差があるとき、それを正しく検出できる確率です。検定の「感度」です。

αとβは「2つの分布の重なり」で決まる

引き続きクリック率の例で考えます。横軸は「観測される差(後 − 前)」、単位は%ポイントです($10\%\to13\%$ なら +$3$pt)。1「仮説検定の枠組み」で描いた、「差がない世界」での標本の差の分布です。
ここに世界を2つ並べます。$H_0$ の世界=真の差が $0$pt です(改修に効果なし)。$H_1$ の世界=真の差が +$2$pt です($10\%$ が本当は $12\%$ になった)。どちらの世界でも標本はブレるので、観測される差はそれぞれの真の値を中心に散らばります。これが2つの山です。
判定は1本の境界線 c で行います。「観測した差が $c$ より大きければ棄却」です。すると、$H_0$ の山が境界の右へはみ出した面積が α(差が無いのに「あった」と言う確率)、$H_1$ の山が境界の左へはみ出した面積が βです(本当は +$2$pt あるのに見逃す確率)。境界を動かすと、片方が減れば必ずもう片方が増えるのが見えます。

棄却の境界 c(差が何ptより大きければ棄却するか) 1.5pt
集めた人数 n(大きいほど山が細く高くなる) 1000
α = 0.057 β = 0.299 検出力 = 0.701
横軸は観測される差です(%ポイント)。左の山=真の差 $0$pt($H_0$)の世界で観測される差、右の山=真の差 +$2$pt($H_1$)の世界で観測される差です。境界 $c$ より右に出たら棄却します。赤 = α($H_0$ の山のはみ出し)、青 = βです($H_1$ の山のはみ出し)。
境界 c を動かす(α と β のトレードオフ):$c$ を右へ寄せると、慎重になって α が下がりますが、見逃しが増えて β は上がります。左へ寄せれば逆です。両方同時には下げられないのがこの図の要点です。
⚠️ なぜ α を 0 にしないのか

「冤罪(第1種)を絶対に出したくない」なら境界を右端まで動かせばよいのです。でもそうすると誰も有罪にできず、本物の差をすべて見逃します(β→100%、検出力→0)。逆に α を大きくすれば些細な揺れでも「差あり」と騒ぎます。だから実務は「第1種を $5\%$ までは許容する」と先に α を固定し、その制約の中で検出力を上げる(n を増やす)戦略をとります。α と β は非対称に扱われます。

3

母平均 μ の検定(1標本)

「平均は μ₀ と違う/より小さい」を判定する:z検定・t検定・片側・両側

いよいよ具体的な検定へ進みます。実務でいちばん多いのは「新しいやり方は、これまでと違うと言えるか?」という問いです。従来のやり方にはこれまでのデータの蓄積があるので、母平均 $\mu$ は分かっています(ときには母標準偏差 $\sigma$ まで)。新しいやり方は、まだ限られた期間・個数しか試せていません。その少ないデータで「変わった」と言い切れるかを判定します。

たとえば、こんな場面です。
・従来薬:これまでの膨大な投与記録から、平均回復日数は $7.0$ 日と分かっている
・新薬:まだ $25$ 人にしか投与できていない。その平均は $6.4$ 日
見えている −$0.6$ 日は、たまたま治りの早い25人だっただけかもしれないし、本当に効いているのかもしれません。「新薬のほうが効く」と言い切れるかを判定するのがこの節です(計算はこの後の具体例ⅰで)。

この「従来の $7.0$ 日」のような比べる相手の値を、以降 $\mu_0$ と書きます。比べる相手は従来の実績とはかぎらず、決められた規格でもかまいません。袋の表示「内容量 $500$g」を $\mu_0$ と置けば、そのまま同じ検定です(具体例ⅱ)。

やることは今までと同じで、新しく標本を取った方の母平均が、従来データの母平均 $\mu_0$ と異なるかを調べます。手元にあるのは $25$ 人ぶんの標本だけなので、そこから母平均を判定することになります。統計量は推定で使った標準化と同じ形です。「(標本平均 − 仮説の値)÷ 標準誤差」です。第7章の区間推定と同様、$\sigma$ を知っているかで使う分布が変わります。ここでの $\sigma$ はいま標本を取った側(新薬)の母標準偏差です。知っているなら z検定、知らなければ標本から見積もって t検定です。

母平均の検定統計量
$$\text{σ既知(z検定):}\; z=\frac{\bar{x}-\mu_0}{\sigma/\sqrt{n}}\sim N(0,1) \qquad \text{σ未知(t検定):}\; t=\frac{\bar{x}-\mu_0}{s_u/\sqrt{n}}\sim t_{n-1}$$

$\sigma$ = 標本を取ってきた母集団の標準偏差です。
$H_0$ の世界では、母集団は「中心 $\mu_0$・ばらつき $\sigma$」です。$\sigma$ が分からなければ標本から $s_u$ で代用し、そのぶんの不確実さを自由度 $n-1$ の t分布が吸収します(第6章)。

⚠️ 「σ が既知」って、現実にあるのか

ほぼありません。$\sigma$ は新しく標本を取った群のばらつきなので、「従来データで分かっている」だけでは足りません。z検定を使うには 「やり方を変えてもばらつきは変わらない(動くのは平均だけ)」という仮定が要ります。測定器の精度や工程のブレのように、介入で変わらないと考えられる量が相手のときです。
この仮定が通る場面は多くないので、実務ではほぼ t検定です。$n$ が大きければ t分布は正規分布とほぼ重なる(第6章)ので、結果として z と同じ答えになります。
ただし例外が1つです。5「母比率 p の検定」では、$H_0$ で $p_0$ を決めた瞬間にばらつき $\sqrt{p_0(1-p_0)/n}$ も自動的に決まります。ここは本当に「既知」です。冒頭のクリック率の例で $z$ が使えたのは、そのためです。

片側検定 vs 両側検定:棄却域の置き方が違う

「$\mu_0$ と違うか(大きくても小さくてもダメ)」を問うなら、棄却域は両裾に分けます(両側検定)。「$\mu_0$ より小さい(一方向)」だけを問うなら、棄却域を片側に集めます(片側検定)。同じ α $=5\%$ でも置き方が変わります。

両側検定(H₁: μ ≠ μ₀) 2.5% 2.5% −1.96 +1.96 採択域 95% α を両裾に 2.5%+2.5% で分ける 片側検定(H₁: μ < μ₀) 5% −1.645 採択域 95% α を片裾に 5% まとめて置く
同じ α=5% でも、両側は両裾に $2.5\%$ ずつ(境界 $\pm1.96$)、片側は片裾に $5\%$ をまとめます(境界 $1.645$)。片側の方が境界が内側にあるので棄却しやすいですが、向きを事前に決めた場合だけ使えます。
⚠️ 片側は「データを見る前に」向きを決めたときだけ

片側にしてよいのは、逆向きの結果に関心がない(または起こりえない)とあらかじめ言い切れるときだけです。「内容量が表示を下回っていないか」(多いぶんは問題にならない)はその典型です。
一方「新薬は効くはず」のような期待は理由になりません。悪化する可能性がある以上、両側で見る必要があります。データを見て大きい側に出たから後付けで「右片側」にする、はもちろん反則です(実質 α が $5\%$ を超える)。迷ったら両側が安全です。

具体例ⅰ:新薬で回復日数は変わったか(両側)

従来薬は、これまでの膨大な投与記録から、飲み始めてから平均 $7.0$ 日で回復することが分かっています($\mu_0=7.0$)。新薬を $25$ 人に投与したところ、回復日数は平均 $6.4$ 日、不偏標準偏差は $1.5$ 日でした。新薬で回復日数は変わったと言えるでしょうか($5\%$、$t_{0.025,\,24}=2.064$ とする)。
・$H_0:\ \mu=7.0$、$H_1:\ \mu\neq7.0$(両側)。新薬のばらつきは分からないので t検定。
・標準誤差 $\dfrac{s_u}{\sqrt{n}}=\dfrac{1.5}{\sqrt{25}}=\dfrac{1.5}{5}=0.3$
・$t=\dfrac{6.4-7.0}{0.3}=\dfrac{-0.6}{0.3}=-2.0$、自由度 $24$。
・両側 $5\%$ の棄却域は $|t|>2.064$。$2.0<2.064$ なので棄却できない。p値 $\approx0.057$。
→ $0.6$ 日の短縮は見えているが、$25$ 人では「効いた」と言い切れない(差がないと証明されたのではなく、判断保留)。
※ 薬の承認試験で両側にするのは、「効かない」だけでなく「悪化させる」可能性も見なければならないからです。「効くはずだ」という期待だけでは片側にできません。
※ 試験の問題文では、単に「標準偏差」「標本標準偏差」とだけ書かれていることが多いです。t検定や区間推定で使うのは $n-1$ で割った不偏標準偏差 $s_u$ なので、その文脈なら不偏の方だと解釈してよいです(「$n$ で割った」と明示されているときだけ要注意)。

具体例ⅱ:内容量が表示を下回っていないか(片側)

お菓子の袋には「内容量 $500$g」と表示されています($\mu_0=500$)。ラインから $16$ 袋を抜き取って測ったら、平均 $496$g、不偏標準偏差は $8$g でした。実際の商品は、表示の内容量を下回っていると言えるでしょうか($5\%$、$t_{0.05,\,15}=1.753$ とする)。
・$H_0:\ \mu=500$、$H_1:\ \mu<500$(下回る方向=左片側)。困るのは不足側だけなので片側で問います。多いぶんはメーカーの損だが、消費者は困らないし違法でもありません。
・標準誤差 $\dfrac{s_u}{\sqrt{n}}=\dfrac{8}{\sqrt{16}}=\dfrac{8}{4}=2$
・$t=\dfrac{496-500}{2}=\dfrac{-4}{2}=-2.0$、自由度 $15$。
・片側 $5\%$ の棄却域は $t<-1.753$。$-2.0<-1.753$ なので棄却。
→ 内容量は表示を有意に下回っていると言えます。

2つの例は、どちらも $t=-2.0$ です。なのに具体例ⅰは棄却できず、具体例ⅱは棄却されました。違いは片側か両側かです。同じ $5\%$ でも、片側は $5\%$ を片方の裾にまとめて置けるぶん、境界が中央寄り($1.753$)になります。両側は $2.5\%$ ずつに分けるので境界が遠くなります($2.064$)。向きを決められる問いは、それだけ有利です。だからこそ、向きはデータを見る前に決めておく必要があります。

検定と区間推定は表裏一体

「両側 $5\%$ で $\mu_0$ を棄却する」ことと「$95\%$ 信頼区間が $\mu_0$ を含まない」ことはまったく同じことです。具体例ⅰの $95\%$ 区間は $6.4\pm2.064\times0.3=[5.78,\ 7.02]$ で、$7.0$ を含んでいます。だから棄却できません。第7章で区間が「$0$ をまたぐか」を気にしたのは、この検定とつながっていたからです。

検定の見方:μ₀ を中心に置いて、x̄ が棄却域に入るか 6.38 7.62 臨界値 μ₀ = 7.0 観測 x̄ = 6.4 臨界値のわずか内側 → 棄却できない 物差し 0.62 日(=2.064 × 0.3) 推定の見方:x̄ を中心に置いて、μ₀ が区間に入るか 同じ 0.62 日 5.78 x̄ = 6.4 7.02 μ₀ = 7.0 は区間の中 → 棄却できない
4

2標本:母平均の差の検定

「A と B で平均が違うか」:独立か対応ありかで、扱いが大きく変わる

現場で最も多いのが「2つの群で平均に差があるか」です。$H_0$ は「差なし($\mu_1=\mu_2$)」です。ここで重要なのが、2群が独立か・対応(ペア)かの見極めです。

独立2標本

別々の対象からなる2群です。
例:A組30人 と B組30人のテストです。
2群のばらつきを足して評価

対応のあるペア

同じ対象を2回測ります。
例:同じ20人の、服薬前と後の血圧。
各人の「差」をとって1標本にする

それぞれのやり方をこれから見ますが、骨格はすべて同じです。差の検定の統計量は、いつも次の形をしています。

差の検定の共通の型
$$t\ (\text{または}\ z)=\frac{\text{(標本平均の差)}-\text{(母平均の差)}}{\text{標本平均の差の標準誤差}}$$
↓ $H_0$ が「母平均の差 = 0」と決める
$$t\ (\text{または}\ z)=\frac{\text{標本平均の差}}{\text{標本平均の差の標準誤差}}$$
記号で書けば、標本平均の差は $\bar{x}_1-\bar{x}_2$、母平均の差は $\mu_1-\mu_2$ です。$H_0$ が母平均の差を $0$ に固定するので、以降は分子から消えます。

つまり分子はどのやり方でも「標本平均の差」で、迷うところがありません。違いが出るのは分母です。標本平均の差の標準誤差をどう見積もるかだけです。ここから紹介するのは、その見積もり方の違いです。

① 独立2標本 t検定:ばらつきは足し算

2群が独立なら、差 $\bar{x}_1-\bar{x}_2$ のばらつき(分散)はそれぞれの分散の和(第5章・第7章で既出)です。だから標準誤差は $\sqrt{\frac{s_{u1}^2}{n_1}+\frac{s_{u2}^2}{n_2}}$ です。これで差を割れば検定統計量になります。

独立2標本 t検定(H₀: μ₁ = μ₂)
$$t=\frac{\bar{x}_1-\bar{x}_2}{\sqrt{\dfrac{s_{u1}^2}{n_1}+\dfrac{s_{u2}^2}{n_2}}}$$
※ 各群の不偏分散を $s_{u1}^2,\ s_{u2}^2$ と書きます。各群のばらつきを別々に見積もった形で、ウェルチ (Welch) 検定と呼ばれます。

母分散が両群とも分かっている場合(分散既知)は、分母の不偏分散を母分散に置き換えて、$t$ ではなく $z$ で判定します。1標本のときの「既知なら $z$、未知なら $t$」の使い分けがそのまま2標本にも当てはまります。

分散既知版(H₀: μ₁ = μ₂、$z$ 検定)
$$z=\frac{\bar{x}_1-\bar{x}_2}{\sqrt{\dfrac{\sigma_1^2}{n_1}+\dfrac{\sigma_2^2}{n_2}}}\sim N(0,1)$$
※ 形は上とまったく同じで、$s_u^2$ が $\sigma^2$ に変わっただけです。判定の境界は $t$ 分布の値ではなく $1.96$(両側5%)になります。たとえば下の塾の例で母標準偏差が両塾とも $10$ 点と分かっているなら、$z=\dfrac{72-63}{\sqrt{100/16+100/12}}=\dfrac{9}{3.82}\approx 2.36 > 1.96$ で棄却です。
具体例:2つの塾で模試の平均点に差はあるか(ばらつきが違う2群)

A塾は入塾テストで選抜しています。B塾は誰でも入れます。両塾の生徒から無作為に選んで同じ模試を受けさせたところ、
・A塾:$n_1=16$ 人、標本平均 $72$ 点、不偏標準偏差 $8$ 点
・B塾:$n_2=12$ 人、標本平均 $63$ 点、不偏標準偏差 $12$ 点
見えている $9$ 点差は、たまたま選ばれた生徒のせいかもしれません。両塾の実力(母平均)に差があると言えるでしょうか(両側 $5\%$、自由度は近似で $18$、$t_{0.025,\,18}=2.101$ とする)。
・$H_0:\ \mu_1=\mu_2$、$H_1:\ \mu_1\neq\mu_2$。
・標準誤差 $=\sqrt{\dfrac{8^2}{16}+\dfrac{12^2}{12}}=\sqrt{4+12}=\sqrt{16}=4$
・$t=\dfrac{72-63}{4}=\dfrac{9}{4}=2.25$。$|2.25|>2.101$ なので棄却。
→ 2塾の平均点には有意差がある。
※ ばらつきを別々に見積もると自由度がきれいな整数にならず、近似で求めます(ここでは $18.1\to18$)。これがウェルチ検定の特徴で、試験では自由度が与えられることがほとんどです。

いまの例は、選抜の有無でばらつきそのものが違う2群でした。一方で、2群のばらつきが等しいとみなせる場面もあります(等分散)。同じ装置・同じ工程で水準だけを変えたとき、同じ集団をランダムに2群へ割り付けたとき(A/Bテスト)、同じテストを2クラスに実施したときです。ばらつきが「測り方や環境」で決まっていて、介入は平均だけを動かす、という状況です。
逆に等分散といえないのは、集団の性質からして違う(さきほどの塾)/介入がばらつき自体を変える(効く人には劇的、効かない人には無効な薬)/比率や件数のように分散が平均に連動するデータ、といった場合です。判断がつかないときは 6「母分散・等分散の検定」の F検定でふるいにかけます(等分散を「証明」する手段ではありません。理由は 6)。ただし本来の根拠は、上のようなデータの取られ方のほうです。

等分散とみなせるなら、ばらつきを2つ別々に見積もる必要はありません。同じ1つのばらつきを2回測ったことになるので、両群のデータをまとめて1つの見積もりにするほうが精度が上がります。これがプール分散 $s_p^2$ です(pool=ためる。試験では「合併分散」「プールした分散」とも書かれます)。自由度も $n_1+n_2-2$ ときれいに決まり、計算は少し楽になります(もっとも、試験ではどちらも知っておく必要があるので、その意味では楽になりませんが)。

等分散版(プール)の t検定
$$t=\frac{\bar{x}_1-\bar{x}_2}{s_p\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}\qquad(\text{自由度}\ n_1+n_2-2)$$
具体例:2クラスの平均点に差はあるか(等分散・プール)

同じ試験をA組・B組で実施し、各クラスから無作為に $8$ 人ずつ選んで採点しました。A組は標本平均 $86$ 点、B組は $78$ 点です。両群のばらつきは等しいとみなせ、プール標準偏差は $s_p=6$ 点でした。2クラスの母平均に差があると言えるでしょうか(両側 $5\%$、$t_{0.025,\,14}=2.145$)。
・$H_0:\ \mu_1=\mu_2$、$H_1:\ \mu_1\neq\mu_2$。自由度 $n_1+n_2-2=14$。
・標準誤差 $=s_p\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}=6\sqrt{\dfrac{1}{8}+\dfrac{1}{8}}=6\sqrt{0.25}=6\times0.5=3$
・$t=\dfrac{86-78}{3}=\dfrac{8}{3}\approx2.67$。$|2.67|>2.145$ なので棄却。
→ 2クラスの平均点には有意差がある。

② 対応のある t検定:「差」をとって1標本に落とす

同じ人の前後を比べるなら、個人差(もともと血圧が高い人・低い人)が邪魔です。そこで各人の差 $d_i=(\text{後})-(\text{前})$ をとると、個人差は引き算で消え、残るのは「変化量」だけです。あとは差 $d$ を1標本として「その平均が $0$ か」を検定するだけです。

対応のある t検定(H₀: 母平均の差は 0)
$$t=\frac{\bar{d}}{s_d/\sqrt{n}}\sim t_{n-1}$$
※ $\bar{d}$=差の平均、$s_d$=差の不偏標準偏差です。同じ人数のペアなので $\bar{d}=\bar{x}_1-\bar{x}_2$ です。分子は他の2つとまったく同じで、分母の作り方だけが違います。
具体例:薬で血圧は下がったか(5人の前後)

5人の収縮期血圧を服薬前後で測定しました。差 $d=(\text{後})-(\text{前})$ は
$-8,\ -7,\ +1,\ -7,\ -9$ です(3人目はむしろ上がったのに注意)。血圧は下がったと言えるでしょうか(両側 $5\%$、$t_{0.025,\,4}=2.776$)。
・差の平均 $\bar{d}=\dfrac{-8-7+1-7-9}{5}=\dfrac{-30}{5}=-6$
・差の不偏分散 $s_d^2=\dfrac{(-2)^2+(-1)^2+7^2+(-1)^2+(-3)^2}{5-1}=\dfrac{4+1+49+1+9}{4}=\dfrac{64}{4}=16$ → $s_d=4$
・標準誤差 $\dfrac{s_d}{\sqrt{n}}=\dfrac{4}{\sqrt{5}}\approx1.789$
・$t=\dfrac{-6}{1.789}\approx-3.35$。$|{-3.35}|>2.776$ なので棄却。
→ 血圧は有意に下がった。3人目のような個人のバラつきがあっても、ペアで差をとると変化が浮き彫りになります。

各人の差 dᵢ =(後)−(前) を数直線に並べる −12 −8 −4 0(変化なし=H₀) +4 d̄ = −6 差の平均
5つの差(茶)はほぼ $0$(青破線=「変化なし」の $H_0$)より左に固まっています。$+1$ の1人が右に出ても、全体の重心 $\bar{d}=-6$(赤)は $0$ から十分離れており、$t$ 検定はこの「$0$ からの離れ具合」を標準誤差で測っています。
⚠️ 独立 vs 対応:取り違えると結論が変わる

同じ対象を2回測ったデータに独立の検定を使うと、個人差が誤差に紛れ込んで差を見逃しやすくなります(検出力が落ちる)。逆に別々の対象なのに対応ありとして扱うのは誤りです。判断基準は1つです。「各データに1対1の相手がいるか」です。前後・左右・双子・マッチングなら対応ありです。

5

母比率 p の検定

「クリック率は上がったか」「支持率に差はあるか」:割合の検定

賛成率・不良率・クリック率など割合を検定したいとします。ここで使うのは t ではなく z です。母平均のときは t だったのに、なぜでしょうか。順に整理します。
・大前提のルール:母分散が未知なら t、既知なら z。
・3「母平均 $\mu$ の検定」では、$H_0$ で母平均を $\mu_0$ と置いても、母分散は別の未知数として残りました。現実には調べようがないので、標本から不偏分散で代用するしかなく、そのぶんの不確かさを引き受けて t検定を使いました。
・ところが母比率では事情が変わります。$H_0$ で $p=p_0$ と置いた瞬間、ばらつきも $\dfrac{p_0(1-p_0)}{n}$ と自動的に決まります。割合のばらつきは $p$ だけで決まるからです(コイン投げと同じで、表の出る確率が決まればブレ方も決まる)。母分散が既知の状況になるので、z が使えます。

あとは $n$ が大きければ、標本比率 $\hat{p}$ の分布は正規分布で近似できます(第6章)。

1標本・母比率の検定(H₀: p = p₀)
$$z=\frac{\hat{p}-p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}}\sim N(0,1)$$

標準誤差の分母には $\hat{p}$ ではなく$p_0$(仮説の値)を使います。「$H_0$ が正しい世界」での分布を考えるからです。ここが区間推定との違いです。

⚠️ 区間推定は p̂、検定は p₀:標準誤差の中身が違う

第7章の区間推定では真の $p$ が不明なので $\hat{p}$ で代用しました。検定では「$H_0$ が正しい(=$p=p_0$)と仮定した世界」での散らばりを計算するので、分母は$p_0(1-p_0)$ です。同じ「比率の標準誤差」でも、目的が違えば中身が変わります。

具体例ⅰ:アプリ改修で翌日継続率は変わったか(両側)

このアプリの翌日継続率(インストールした人が翌日も起動する割合)は、これまでの膨大なログから $20\%$ と分かっています($p_0=0.20$)。起動画面を改修したあとにインストールした $n=400$ 人を見ると、$100$ 人が翌日も起動しました(標本比率 $\hat{p}=0.25$)。改修で継続率は変わった(母比率 $p\neq0.20$)と言えるでしょうか(両側 $5\%$)。
・$H_0:\ p=0.20$、$H_1:\ p\neq0.20$(両側)。改修で下がる可能性もあるため片側にはしない。
・標準誤差 $=\sqrt{\dfrac{0.20\times0.80}{400}}=\sqrt{\dfrac{0.16}{400}}=\sqrt{0.0004}=0.02$
・$z=\dfrac{0.25-0.20}{0.02}=\dfrac{0.05}{0.02}=2.5$。両側棄却域は $|z|>1.96$(標準正規分布表より)。$2.5>1.96$ なので棄却。
・p値 $=2\times P(Z>2.5)\approx0.012<0.05$。
→ 翌日継続率は有意に変わった(上がった)と言えます。

具体例ⅱ:その政策の賛成は過半数を超えたと言えるでしょうか(片側)

ある政策への賛否を、有権者から無作為に選んだ $n=400$ 人に聞いたところ、$216$ 人が賛成でした(標本比率 $\hat{p}=0.54$)。有権者全体でも賛成が過半数(母比率 $p>0.5$)だと言えるでしょうか(片側 $5\%$)。
・「過半数」が問いなので、基準は $p_0=0.5$。$H_0:\ p=0.5$、$H_1:\ p>0.5$(右片側)。
・標準誤差 $=\sqrt{\dfrac{0.5\times0.5}{400}}=\sqrt{\dfrac{0.25}{400}}=\sqrt{0.000625}=0.025$
・$z=\dfrac{0.54-0.50}{0.025}=\dfrac{0.04}{0.025}=1.6$。片側棄却域は $z>1.645$(標準正規分布表より)。$1.6<1.645$ なので棄却できない。
・p値 $=P(Z>1.6)\approx0.055>0.05$。
→ 聞いた $400$ 人では $54\%$ だったが、有権者全体で過半数とまでは言い切れない(惜しくも届かない)。
※ 世論調査の「$54\%$ が賛成」がそのまま「国民の過半数が賛成」を意味しないのは、これが理由です。聞いた人数を増やせば同じ $54\%$ でも判定は変わります($n=1000$ なら $z\approx2.53$ で棄却)。

2標本・母比率の差の検定:プール推定量

2群の比率を比べるとき、$H_0$ は「$p_1=p_2$」です。つまり2つの群は同じ $p$ を持つという仮定です。

型は 4「2標本:母平均の差の検定」とまったく同じで、母平均が母比率に変わっただけです。

差の検定の共通の型(母比率版)
$$z=\frac{\text{(標本比率の差)}-\text{(母比率の差)}}{\text{標本比率の差の標準誤差}}$$
↓ $H_0$ が「母比率の差 = 0」と決める
$$z=\frac{\text{標本比率の差}}{\text{標本比率の差の標準誤差}}$$
記号で書けば、標本比率の差は $\hat{p}_1-\hat{p}_2$、母比率の差は $p_1-p_2$ です。$H_0$ が母比率の差を $0$ に固定するので、分子は標本比率の差だけになります。

つまりここでも主題は分母です。標本比率の差の標準誤差をどう見積もるかが問題です。ところがこの標準誤差の式には、未知の母比率 $p$ が入り込みます(下の導出のとおり $\sqrt{p(1-p)\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}$ という形)。標準誤差を計算するには、まずその $p$ を見積もる必要があります。そして $H_0$ が「両群とも同じ $p$」と言っている以上、見積もりは両群のデータを合算して1つ作るのが自然です。これがプール標本比率 $\hat{p}$ です(等分散のときプール分散を作ったのと同じ発想)。

2標本・母比率の差の検定(H₀: p₁ = p₂)
$$z=\frac{\hat{p}_1-\hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\dfrac{1}{n_1}+\dfrac{1}{n_2}\right)}}, \qquad \hat{p}=\frac{x_1+x_2}{n_1+n_2}$$
※ $x_1,\ x_2$ は各群で「そうだった」人数です。$\hat{p}$ は合算するだけなので、プール分散と違い自分で計算するのがふつうです。
具体例:同じ政策への賛成率が、A町とB町で違うか(両側)

ある政策について、A町の有権者から無作為に $n_1=200$ 人、B町から $n_2=200$ 人を選んで賛否を聞いたところ、賛成はA町 $80$ 人($\hat{p}_1=0.40$)、B町 $60$ 人($\hat{p}_2=0.30$)でした。両方の町の賛成率に差がある(母比率 $p_1\neq p_2$)と言えるでしょうか(両側 $5\%$)。
・プール比率 $\hat{p}=\dfrac{80+60}{200+200}=\dfrac{140}{400}=0.35$
・標準誤差 $=\sqrt{0.35\times0.65\times\left(\tfrac{1}{200}+\tfrac{1}{200}\right)}=\sqrt{0.2275\times0.01}=\sqrt{0.002275}\approx0.0477$
・$z=\dfrac{0.40-0.30}{0.0477}=\dfrac{0.10}{0.0477}\approx2.10$。両側棄却域は $|z|>1.96$(標準正規分布表より)。$2.10>1.96$ → 棄却。
→ 2つの町の賛成率には有意差がある(p値 $\approx0.036$)。

6

母分散・等分散の検定

「ばらつきが大きすぎないか」「2群の分散は等しいか」:χ²検定と F検定

工場のラインから 20個だけ抜き取って測ったら、寸法が思ったよりバラついていました。 規定なら分散は $4$ くらいに収まるはずなのに、手元の値は $6.5$ です。

ここで湧く疑問は2つです。「20個しか見ていないから、たまたま散らばっただけ?」か、 「機械が傷んで、本当にバラつきが大きくなった?」か、という2つです。 3 で母平均に対して立てたのとまったく同じ問いを、 今度はばらつきそのものに立てているわけです。

答え方も同じです。「規定どおり(分散 $4$)だとしたら、$20$ 個からこれだけ散らばった値が出るのは どれくらい珍しいか」を確率で測ります。使う分布は第6章のカイ二乗分布と F分布で、 あそこで見た形がそのまま検定統計量になります。

① 母分散の検定(χ²検定)

第6章で、標本のばらつきを $\dfrac{(n-1)s_u^2}{\sigma^2}$ という形にすると自由度 $n-1$ のカイ二乗分布に従う、と学びました(第6章)。この性質が、そのまま検定の道具になります。

$H_0$ で母分散を $\sigma_0^2$ と置くと、式の中の $\sigma^2$ が $\sigma_0^2$ に確定します(母比率のときと同じで、$H_0$ が未知数を埋めてくれる)。あとは計算した値がカイ二乗分布のどこに落ちるかを見るだけです。標本のばらつきが規定どおりなら分布の重心あたり、大きければ右、小さければ左に落ちます。

自由度 n−1 のカイ二乗分布(図は n=20、つまり自由度 19) 重心=自由度 19 χ² = 19 ここが sᵤ² = σ₀²(規定どおり) 30.14 上側 5% の臨界値 ← ばらつきが規定より小さい 大きい → 左右非対称なので、棄却域は「上側だけ」「下側だけ」「両側」で取り方が変わる。
母分散の検定(H₀: σ² = σ₀²)
$$\chi^2=\frac{(n-1)s_u^2}{\sigma_0^2}\sim\chi^2_{\,n-1}$$

$H_0$ が $\sigma_0^2$ を決めるので、分母は既知の値になります。

具体例:加工精度のバラつきは規定より大きいか(片側)

規定の分散は $\sigma_0^2=4$ です。$n=20$ 個の標本で不偏分散 $s_u^2=6.5$ です。バラつきが大きくなったと言えるでしょうか(片側 $5\%$、$\chi^2_{0.05,\,19}=30.14$)。
・$H_0:\ \sigma^2=4$、$H_1:\ \sigma^2>4$(上側片側)。
・$\chi^2=\dfrac{(20-1)\times6.5}{4}=\dfrac{19\times6.5}{4}=\dfrac{123.5}{4}\approx30.88$
・棄却域 $\chi^2>30.14$。$30.88>30.14$ → 棄却。
→ バラつきは有意に大きくなった。

補足:上側だけとは限らない

この例で疑ったのは「ばらつきが大きくなったのでは」なので上側でした。疑いが「小さすぎないか」なら下側、「規定と違うのでは」なら両側になり、使う臨界値が変わります。カイ二乗分布は左右非対称なので、$z$ のように符号を変えるだけでは下側の点が出せません。そのためカイ二乗分布表には、上側の列と下側の列の両方が用意されています。
読むときの注意が1つです。$\chi^2_{0.975,\,9}=2.70$ は「下から $97.5\%$ の点」ではなく「上側確率が $0.975$ の点」=下から $2.5\%$ の点です。第7章の母分散の信頼区間で使ったのと同じ値です。

② 2標本の等分散検定(F検定)

2群の分散が等しいか($H_0:\ \sigma_1^2=\sigma_2^2$)は、分散の比で測ります。第6章の通り、2つの不偏分散の比は F分布に従います。比が $1$ から大きく外れれば「分散が違う」と判断できます。

等分散の検定(H₀: σ₁² = σ₂²)
$$F=\frac{s_{u1}^2}{s_{u2}^2}\sim F_{\,n_1-1,\ n_2-1}\qquad(\text{慣例:大きい方の }s_u^2\text{ を分子に})$$
具体例:2つの製造ラインの分散は等しいか(両側)

ライン1($n_1=10$)の不偏分散 $s_{u1}^2=18$、ライン2($n_2=10$)の $s_{u2}^2=6$ です。分散は等しいでしょうか(両側 $5\%$、$F_{0.025,\,9,\,9}=4.03$)。
・$F=\dfrac{s_{u1}^2}{s_{u2}^2}=\dfrac{18}{6}=3.0$、自由度 $(9,\ 9)$。
・棄却域 $F>4.03$。$3.0<4.03$ なので棄却できない。
→ 分散が異なるとは言えない。 (「等しいと分かった」ではない)

F検定は、4「2標本:母平均の差の検定」でどちらの式を使うかを決めるための前段です。 2群の平均を比べる前に F検定をかけ、棄却されなければ等分散を仮定してプール版の独立 t検定(自由度 $n_1+n_2-2$)、 棄却されたらウェルチ検定です。上の例は棄却されなかったのでプール版へ進む、という流れです。 あくまで「違う証拠が出なかったから仮定する」であって、等しいと分かったわけではありません。
7

検定結果の解釈と注意

p値が小さい=「重大な発見」とは限らない:落とし穴を避ける

検定は強力ですが、結果の読み方を誤ると正反対の結論を導きます。試験でも実務でも問われる、3つの典型的な注意点を押さえます。

① 統計的有意 ≠ 実質的に重要

p値は「差が存在するか」を見るだけで、「差が大きいか」は別問題です。標本 $n$ を巨大にすると、標準誤差 $\sigma/\sqrt{n}$ がいくらでも小さくなり、ごく僅かな差でも統計的に有意になります。

⚠️ 大標本では「無意味に小さい差」も有意になる

ある薬が回復日数を平均 $0.05$ 日(約1時間)だけ短縮するとします。$n=100{,}000$ 人で調べれば p $<0.001$ で「有意」になりえます。だが1時間の短縮に臨床的な価値があるかは別の話です。「有意(significant)」は統計用語で、日常語の「重要」ではありません。効果量(差の大きさ)や信頼区間を併せて見る必要があります。

② 多重検定:何度も検定すれば、いつか偶然当たる

有意水準 $5\%$ は「$H_0$ が正しくても $20$ 回に $1$ 回は誤って棄却する」という意味です。だからたくさん検定すれば、本当は差がなくても、どれか1つは偶然「有意」になります。

具体例:20項目を一気に検定すると

差のない $20$ 項目を、それぞれ $\alpha=0.05$ で検定します。少なくとも1つが誤って有意になる確率は
$1-(1-0.05)^{20}=1-0.95^{20}\approx1-0.358=0.642$ → 約 64% です。
つまり「差がない」のに、6割以上の確率で「何か有意な発見」が紛れ込みます。検定回数が増えるなら、$\alpha$ を厳しくする(ボンフェローニ補正など)対策が要ります。

③ 有意でも「因果」ではない/棄却できなくても「差ゼロ」ではない

⚠️ 2つの言い過ぎに注意

言い過ぎ①:「有意だから A が B の原因だ」です。検定は関連を示すだけです。因果は実験デザイン(第3章のRCT)で担保するもので、p値からは出てきません。
言い過ぎ②:「棄却できなかったから差はない」です。1「仮説検定の枠組み」の通り、これは判断保留であって「差ゼロの証明」ではありません。標本が小さくて検出力が足りなかっただけ、という可能性が常に残ります。

ここまでの検定は主に量的データ(平均・分散・比率)が相手でした。次の第9章では、質的データ(カテゴリの度数)の「偏り」や「関連」を検定する χ² 検定へ進みます。第2章の分割表・第6章の χ² 分布が、ここで検定として結実します。
次のステップ
第9章「カイ二乗検定」へ →
質的データ(カテゴリの度数)の「偏り」と「関連」を検定する