仮説検定
最終更新:
新薬を飲んだ群は、飲まない群より回復が 0.6日 早くなりました。改修後のサイトはクリック率が 10% → 13% に上がりました。ここで必ず湧く疑問が「その差は本物か、それともたまたまか」です。標本は取り直すたびに揺れるので、真の差がゼロでも、見かけ上の差は普通に出ます。その揺れの範囲を超えた「本物の差」かを、確率で判定するのが仮説検定 (hypothesis testing)です。
第7章(推定)は「母数はどのへんか」を幅で答えました。第8章は問いの形が違います。「母数は特定の値(例:差ゼロ)と言えるか/違うと言えるか」に Yes / No で答えます。推定が位置を測るなら、検定は判定を下すわけです。道具(標本分布・標準誤差)は推定と完全に共通です。
第7章(推定)
「いくつ?」に答える
母数の値を点 or 区間で見積もる
例:支持率は 38〜44%
第8章(検定)
「言えるか?」に答える
ある主張が成り立つかを Yes/No 判定
例:支持率は前回と「変わった」と言える
「差なんて無い」と仮定したら、いま観測されたこの差はどれくらい起こりにくいか?
起こりにくすぎる(例:5%未満)なら、「差なんて無い」という仮定の方が間違っていた、と結論します。
仮説検定の枠組み 🌟
帰無仮説・対立仮説・棄却域・有意水準・p値:全検定に共通する骨格
どの検定も、登場人物と手順はまったく同じです。骨格を1つ通してつかめば、あとは「使う分布が z か t か χ² か」が変わるだけです。ここでは実務でいちばん多い形です。2つのグループの比較を例にします。
たとえば、サイト改修の効果を見たいとします。改修前は長期間の運用でクリック率が $10\%$ で安定していました。改修後の1週間に来た訪問者を数えたら、500人中65人がクリック($13\%$)しました。
ここで肝心なのは、改修後の この $13\%$ は全訪問者の“真のクリック率”ではなく、その1週間にたまたま来た 500人(=標本)から測った値だということです。観測する週が違えば来る人も入れ替わり、数字も揺れます(別の週に同じ規模で測れば $11\%$ や $15\%$ …といった具合に)。しかも揺れの大きさは見る人数しだいです。$500$ 人ではなく $3000$ 人を見れば、数字はもっと真の値に近く安定します(人数が多いほどブレは小さくなります。第6章)。だから +$3\%$ を見て即「改修が効いた」とは言えません。
この +3% は本物の差なのでしょうか? それとも 真のクリック率は改修前と同じ $10\%$ のままなのに、たまたま観測した1週間の 500人でだけ高く出ただけなのでしょうか。
差が見えても、原因は2通りです。⒜本当に真のクリック率が上がったから、⒝真の値は $10\%$ のままなのに、標本のブレで見かけ上ズレただけです。仮説検定は、この「本物の差 か 偶然の見かけの差 か」を確率で見分ける道具です。
① 帰無仮説 H₀ と 対立仮説 H₁:なぜ「否定したい方」を立てるのか
検定では、相反する2つの仮説を立てます。
帰無仮説 H₀(null hypothesis)
「差がない・効果がない・いつも通り」という、否定されることを狙って立てる仮説です。
例:改修前後で真のクリック率は同じ(差 = 0)
対立仮説 H₁(alternative)
「差がある・効果がある」という、本当は主張したい仮説です。H₀ を棄却できて初めて採用されます。
例:改修でクリック率が変わった(差 ≠ 0)
わざわざ「主張したいことの逆(差がない)」を $H_0$ に置くのは、回りくどく見えます。
② 検定統計量・棄却域・有意水準 α
$H_0$ は「差はない」と置きました。では、仮に本当に差がないとしたら、観測される差は実際どうなるのでしょうか。さっきのクリック率の例で確かめます。
改修の前も後も、見られるのは訪問者全員ではなく一部(標本)のクリック率だけです。第6章で見た通り、標本は取るたびにブレます。だから、たとえ本当はまったく差が無くても、前後で観測されるクリック率がピッタリ同じになることはまずなく、観測される差は「0」の周りに散らばります。
観測された 13% という1つの数字の裏には、2つの世界がありえます。本当に効果があった世界と、本当は何も変わっていない世界です。どちらの世界でも「後の群が 13%」は起こりえます。起こりやすさが違うだけです。
あとは、実際に観測した差をこの横軸の上で見るだけです。中央近くなら「差が無くても偶然よく出る差」なので差ありとは言えません。両端の遠くまで外れていたら「差が無いなら、まずこんな差は出ない」ので、「差なし」という仮定の方が苦しい → 棄却します。その「まず出ない」端を棄却域、面積を有意水準 α(ふつう $5\%$)と前もって決めておきます。検定統計量・棄却域・α は、すべてこの1枚の図に乗ります。
検定統計量:観測データ全体を1つの数にまとめたものです(例:観測された差)。この数が横軸のどこに来るかで判定します。
棄却域(赤い両裾):「差が無い($H_0$)なら、まず出ない」差の範囲です。観測した差がここなら $H_0$ を棄てます。
採択域(中央):それ以外です。ここなら「差があるとは言えない」です。
臨界値(破線):採択域と棄却域の境目です。
有意水準 α:棄却域の面積=「本当は差が無いのに、誤って『差あり』と言ってしまう確率」を、あらかじめ $5\%$ などに固定します。
③ p値:観測値の「起こりにくさ」を1つの確率に
棄却域は「入ったか・入らないか」の白黒判定でした。どれくらい際どかったかまで数値にしたのがp値です。定義は「$H_0$ が正しいとき、いま観測された統計量と同じか、それ以上に極端な値が出る確率」です。分布の裾の面積です。
第5章で見た通り、連続分布では1点ちょうどの確率は $0$ です($P(Z=2.0)=0$)。だから「観測値ぴったりの確率」では何も測れません。意味を持つのは区間の面積だけです。そこで「観測値以上に極端な側の面積」をとります。これなら「観測が裾の奥にあるほど面積は小さく、起こりにくい」を、ちゃんと $0$ でない数で表せます。
判定はシンプルです。p値 $<$ α なら $H_0$ を棄却します(=統計的に有意)。p値が小さいほど「$H_0$ のもとでは、ありえないほど極端なことが起きた」ので、$H_0$ を疑う根拠が強くなります。下のスライダーで観測値を動かし、裾の面積(p値)と判定がどう連動するかを見てください。
有意=「偶然では説明しにくい」です。日常語の「重要」「差が大きい」ではありません。
有意水準 α:データを見る前に決めておく基準です(ふつう $5\%$)。
有意確率:p値の別名です。データから後で計算する値です。試験ではこの呼び方も出ます。
「有意差がある」:p値 $<$ α で $H_0$ を棄却できた、という意味です。「差がゼロとは考えにくい」であって、差が大きいとは言っていません。
「A は B より有意に高い」:$H_0$ を棄却でき、しかも差の向きが「A のほうが高い」側だった、ということです。片側検定でも両側検定でも使う言い方です。
この5つのうち、いちばん直感に反するのが有意確率(p値)です。名前に「有意」と付いているのに、小さいほど有意という向きになります。
p値(有意確率)は「$H_0$ が正しいとしたら、これほど極端なデータが出る確率」なので、小さいほど $H_0$ が苦しいです。
つまり有意確率が低いほど「有意(偶然では説明しにくい)」と言えます。直感に反するので注意が必要です。
④ 検定の5ステップ(どの検定でも共通)
- 仮説を立てる:$H_0$(差なし)と $H_1$(差あり/片側なら向きも)。
- 有意水準 α を決める:ふつう $0.05$。厳しくするなら $0.01$。
- 検定統計量を計算:$\dfrac{\text{推定値}-\text{}H_0\text{の値}}{\text{標準誤差}}$ の形。$H_0$ のもとで z/t/χ²/F のどれに従うか確認。
- 比較:統計量が棄却域に入ったかを見る。p値と α を比べても同じ。同じ図を「横軸の位置」で見るか「裾の面積」で見るかの違いだけで、結論は必ず一致する。
- 結論:棄却 →「有意差あり($H_1$)」/棄却できず →「差があるとは言えない」。
検定が言えるのは「$H_0$ を否定できた」か「否定する証拠が足りなかった」か、だけです。後者は「差がないと証明された」のではなく、ただ判断を保留している状態です(「証拠不十分で無罪」に近い状態で、無実が証明されたわけではありません)。「$H_0$ を採択=差はないと確定」と書くと誤りです。
この5ステップを、2つの例でそのまま通してみます。まずは導入のクリック率で流れ全体を、次に手計算で追えるコインで細部を見ます。
状況:改修前は長期間(過去半年)の運用でクリック率が $10\%$ で安定しています。大量のデータがあるので、ほぼ真の値(基準)$p_0=0.10$ とみなせます。改修後の1週間に来た $n=500$ 人のうち $65$ 人がクリックしました($\hat{p}=13\%$)。改修で本当に上がったと言えるでしょうか。
※ 揺れるのは「後の $500$ 人」の側だけです。前は長期の実績なので、固定した基準として扱います(だから $1$ 標本の検定になる)。
- 仮説:$H_0:\ p=0.10$(改修前と同じ)/ $H_1:\ p\neq0.10$(変わった・両側)。
改修はクリック率を下げてしまう可能性もあるので、片側にはしない。「上がった場合しか見ない」と決めてよいのは、下がる心配が理屈のうえで無いときだけ。 - 有意水準:$\alpha=0.05$。
- 検定統計量:「差が無い($p=0.10$)」なら、$500$ 人から測る $\hat{p}$ は $0.10$ を中心に、標準誤差 $\sqrt{\dfrac{p_0(1-p_0)}{n}}=\sqrt{\dfrac{0.10\times0.90}{500}}=\sqrt{0.00018}\approx0.0134$ のブレで散らばる(第6章)。この標準誤差で観測差を割って $z$ を計算する:
$\;z=\dfrac{\hat{p}-p_0}{\sqrt{p_0(1-p_0)/n}}=\dfrac{0.13-0.10}{0.0134}=\dfrac{0.03}{0.0134}\approx 2.24$
=観測した +$3\%$ は、「差が無いとき出るブレ」の約 2.2 個ぶん外側、ということ。(この $z$ の形は 5「母比率の検定」で正式に扱う。) - 比較:両側 $5\%$ の棄却域は $|z|>1.96$(標準正規分布表より)。$2.24>1.96$ なので棄却域に入る。p値 $=2\times P(Z>2.24)\approx0.025<0.05$。
- 結論:$H_0$ を棄却。改修後はクリック率が統計的に有意に上がったと言える。
検定で言えたのは「前後で差がある」という関連だけです(第2章「相関は因果ではない」と同じ話です。2つの量が一緒に動くのが「相関」で、群の間で違いがあるのも含めた広い言い方が「関連」です)。その差が改修のおかげなのか、たまたま年末商戦などの季節要因で全体が底上げされたのか、同時期に打った別施策のせいなのかは、この検定からは区別できません。「差が有意 → 改修が効いた」と飛びつくのは誤りです。因果を言うには、同時期に改修なし群(対照群)を置いてランダムに振り分けます。第3章の RCT のような仕組みが要ります。Webでよく聞く A/Bテスト がまさにこれで、訪問者をランダムに旧デザイン(A)と新デザイン(B)へ振り分けます。同時期・ランダムなので季節要因も別施策も両群に等しくかかり、差の原因を改修に絞り込めます。検定は「差の有無」、因果は「実験デザイン」の担当です(詳しくは 7)。
具体例ⅰは途中の数式を 5「母比率 p の検定」にあずけました。もう1つ、最後まで手計算で追える例を挙げます。新しい公式は要らず、第5章の二項分布だけで枠組みがそのまま動きます。
状況:いかさまを疑うコインを $10$ 回投げたら、表が $9$ 回出ました。このコインは「公平でない」と言えるでしょうか。
- 仮説:$H_0:\ p=0.5$(公平)/ $H_1:\ p\neq0.5$(公平でない・両側)。
- 有意水準:$\alpha=0.05$ に決める。
- 検定統計量:表の回数 $X$。$H_0$ が正しければ $X\sim\text{Bin}(10,\,0.5)$(第5章の二項分布)。観測は $X=9$。
- どれくらい極端か(p値):「$9$ 回以上表」の確率は
$\;P(X\ge9)=\dfrac{{}_{10}C_{9}+{}_{10}C_{10}}{2^{10}}=\dfrac{10+1}{1024}=\dfrac{11}{1024}$。
両側なので反対の端「$1$ 回以下」も同じ $\dfrac{11}{1024}$。合計 p値 $=\dfrac{22}{1024}\approx0.0215$。 - 結論:$0.0215<0.05$ なので $H_0$ を棄却。このコインは公平でないと言える。
この $X$ の分布を絵にすると、さきほどの棄却域と採択域の図がそっくりそのまま現れます。中央が採択域、両端の赤が棄却域、その面積が p値です(≒α と比べる相手)。
クリック率の例で使ったのは、大標本の z検定 $z=\dfrac{\hat{p}-p_0}{\sqrt{p_0(1-p_0)/n}}$ です。コインも同じ「割合(母比率)の検定」ですが、$n=10$ と小さく正規近似が使えないので、$z$ ではなく二項分布で厳密に計算した版(5 の $z$ は $n$ が大きいときの近似)。検定の枠組みは1つ、計算の道具が「大標本→z/小標本→二項」と変わるだけです。
第1種・第2種の過誤と検出力
判定は2方向に間違えうる:そのトレードオフを2つの分布の重なりで見る
検定は確率に基づく判定なので、必ず間違える可能性があります。間違いには2方向あり、裁判の比喩がぴたりと当てはまります($H_0$=「被告は無実」)。
α(第1種)= $H_0$ が真なのに棄却する確率です。=有意水準です(自分で $5\%$ に設定する)。
β(第2種)= $H_0$ が偽なのに棄却しそこなう確率です。見逃し率です。
検出力 (power) = 1−β= 本当に差があるとき、それを正しく検出できる確率です。検定の「感度」です。
αとβは「2つの分布の重なり」で決まる
引き続きクリック率の例で考えます。横軸は「観測される差(後 − 前)」、単位は%ポイントです($10\%\to13\%$ なら +$3$pt)。1「仮説検定の枠組み」で描いた、「差がない世界」での標本の差の分布です。
ここに世界を2つ並べます。$H_0$ の世界=真の差が $0$pt です(改修に効果なし)。$H_1$ の世界=真の差が +$2$pt です($10\%$ が本当は $12\%$ になった)。どちらの世界でも標本はブレるので、観測される差はそれぞれの真の値を中心に散らばります。これが2つの山です。
判定は1本の境界線 c で行います。「観測した差が $c$ より大きければ棄却」です。すると、$H_0$ の山が境界の右へはみ出した面積が α(差が無いのに「あった」と言う確率)、$H_1$ の山が境界の左へはみ出した面積が βです(本当は +$2$pt あるのに見逃す確率)。境界を動かすと、片方が減れば必ずもう片方が増えるのが見えます。
「冤罪(第1種)を絶対に出したくない」なら境界を右端まで動かせばよいのです。でもそうすると誰も有罪にできず、本物の差をすべて見逃します(β→100%、検出力→0)。逆に α を大きくすれば些細な揺れでも「差あり」と騒ぎます。だから実務は「第1種を $5\%$ までは許容する」と先に α を固定し、その制約の中で検出力を上げる(n を増やす)戦略をとります。α と β は非対称に扱われます。
母平均 μ の検定(1標本)
「平均は μ₀ と違う/より小さい」を判定する:z検定・t検定・片側・両側
いよいよ具体的な検定へ進みます。実務でいちばん多いのは「新しいやり方は、これまでと違うと言えるか?」という問いです。従来のやり方にはこれまでのデータの蓄積があるので、母平均 $\mu$ は分かっています(ときには母標準偏差 $\sigma$ まで)。新しいやり方は、まだ限られた期間・個数しか試せていません。その少ないデータで「変わった」と言い切れるかを判定します。
たとえば、こんな場面です。
・従来薬:これまでの膨大な投与記録から、平均回復日数は $7.0$ 日と分かっている
・新薬:まだ $25$ 人にしか投与できていない。その平均は $6.4$ 日
見えている −$0.6$ 日は、たまたま治りの早い25人だっただけかもしれないし、本当に効いているのかもしれません。「新薬のほうが効く」と言い切れるかを判定するのがこの節です(計算はこの後の具体例ⅰで)。
この「従来の $7.0$ 日」のような比べる相手の値を、以降 $\mu_0$ と書きます。比べる相手は従来の実績とはかぎらず、決められた規格でもかまいません。袋の表示「内容量 $500$g」を $\mu_0$ と置けば、そのまま同じ検定です(具体例ⅱ)。
やることは今までと同じで、新しく標本を取った方の母平均が、従来データの母平均 $\mu_0$ と異なるかを調べます。手元にあるのは $25$ 人ぶんの標本だけなので、そこから母平均を判定することになります。統計量は推定で使った標準化と同じ形です。「(標本平均 − 仮説の値)÷ 標準誤差」です。第7章の区間推定と同様、$\sigma$ を知っているかで使う分布が変わります。ここでの $\sigma$ はいま標本を取った側(新薬)の母標準偏差です。知っているなら z検定、知らなければ標本から見積もって t検定です。
$\sigma$ = 標本を取ってきた母集団の標準偏差です。
$H_0$ の世界では、母集団は「中心 $\mu_0$・ばらつき $\sigma$」です。$\sigma$ が分からなければ標本から $s_u$ で代用し、そのぶんの不確実さを自由度 $n-1$ の t分布が吸収します(第6章)。
ほぼありません。$\sigma$ は新しく標本を取った群のばらつきなので、「従来データで分かっている」だけでは足りません。z検定を使うには 「やり方を変えてもばらつきは変わらない(動くのは平均だけ)」という仮定が要ります。測定器の精度や工程のブレのように、介入で変わらないと考えられる量が相手のときです。
この仮定が通る場面は多くないので、実務ではほぼ t検定です。$n$ が大きければ t分布は正規分布とほぼ重なる(第6章)ので、結果として z と同じ答えになります。
ただし例外が1つです。5「母比率 p の検定」では、$H_0$ で $p_0$ を決めた瞬間にばらつき $\sqrt{p_0(1-p_0)/n}$ も自動的に決まります。ここは本当に「既知」です。冒頭のクリック率の例で $z$ が使えたのは、そのためです。
片側検定 vs 両側検定:棄却域の置き方が違う
「$\mu_0$ と違うか(大きくても小さくてもダメ)」を問うなら、棄却域は両裾に分けます(両側検定)。「$\mu_0$ より小さい(一方向)」だけを問うなら、棄却域を片側に集めます(片側検定)。同じ α $=5\%$ でも置き方が変わります。
片側にしてよいのは、逆向きの結果に関心がない(または起こりえない)とあらかじめ言い切れるときだけです。「内容量が表示を下回っていないか」(多いぶんは問題にならない)はその典型です。
一方「新薬は効くはず」のような期待は理由になりません。悪化する可能性がある以上、両側で見る必要があります。データを見て大きい側に出たから後付けで「右片側」にする、はもちろん反則です(実質 α が $5\%$ を超える)。迷ったら両側が安全です。
従来薬は、これまでの膨大な投与記録から、飲み始めてから平均 $7.0$ 日で回復することが分かっています($\mu_0=7.0$)。新薬を $25$ 人に投与したところ、回復日数は平均 $6.4$ 日、不偏標準偏差は $1.5$ 日でした。新薬で回復日数は変わったと言えるでしょうか($5\%$、$t_{0.025,\,24}=2.064$ とする)。
・$H_0:\ \mu=7.0$、$H_1:\ \mu\neq7.0$(両側)。新薬のばらつきは分からないので t検定。
・標準誤差 $\dfrac{s_u}{\sqrt{n}}=\dfrac{1.5}{\sqrt{25}}=\dfrac{1.5}{5}=0.3$
・$t=\dfrac{6.4-7.0}{0.3}=\dfrac{-0.6}{0.3}=-2.0$、自由度 $24$。
・両側 $5\%$ の棄却域は $|t|>2.064$。$2.0<2.064$ なので棄却できない。p値 $\approx0.057$。
→ $0.6$ 日の短縮は見えているが、$25$ 人では「効いた」と言い切れない(差がないと証明されたのではなく、判断保留)。
※ 薬の承認試験で両側にするのは、「効かない」だけでなく「悪化させる」可能性も見なければならないからです。「効くはずだ」という期待だけでは片側にできません。
※ 試験の問題文では、単に「標準偏差」「標本標準偏差」とだけ書かれていることが多いです。t検定や区間推定で使うのは $n-1$ で割った不偏標準偏差 $s_u$ なので、その文脈なら不偏の方だと解釈してよいです(「$n$ で割った」と明示されているときだけ要注意)。
お菓子の袋には「内容量 $500$g」と表示されています($\mu_0=500$)。ラインから $16$ 袋を抜き取って測ったら、平均 $496$g、不偏標準偏差は $8$g でした。実際の商品は、表示の内容量を下回っていると言えるでしょうか($5\%$、$t_{0.05,\,15}=1.753$ とする)。
・$H_0:\ \mu=500$、$H_1:\ \mu<500$(下回る方向=左片側)。困るのは不足側だけなので片側で問います。多いぶんはメーカーの損だが、消費者は困らないし違法でもありません。
・標準誤差 $\dfrac{s_u}{\sqrt{n}}=\dfrac{8}{\sqrt{16}}=\dfrac{8}{4}=2$
・$t=\dfrac{496-500}{2}=\dfrac{-4}{2}=-2.0$、自由度 $15$。
・片側 $5\%$ の棄却域は $t<-1.753$。$-2.0<-1.753$ なので棄却。
→ 内容量は表示を有意に下回っていると言えます。
検定と区間推定は表裏一体
「両側 $5\%$ で $\mu_0$ を棄却する」ことと「$95\%$ 信頼区間が $\mu_0$ を含まない」ことはまったく同じことです。具体例ⅰの $95\%$ 区間は $6.4\pm2.064\times0.3=[5.78,\ 7.02]$ で、$7.0$ を含んでいます。だから棄却できません。第7章で区間が「$0$ をまたぐか」を気にしたのは、この検定とつながっていたからです。
2標本:母平均の差の検定
「A と B で平均が違うか」:独立か対応ありかで、扱いが大きく変わる
現場で最も多いのが「2つの群で平均に差があるか」です。$H_0$ は「差なし($\mu_1=\mu_2$)」です。ここで重要なのが、2群が独立か・対応(ペア)かの見極めです。
独立2標本
別々の対象からなる2群です。
例:A組30人 と B組30人のテストです。
2群のばらつきを足して評価
対応のあるペア
同じ対象を2回測ります。
例:同じ20人の、服薬前と後の血圧。
各人の「差」をとって1標本にする
それぞれのやり方をこれから見ますが、骨格はすべて同じです。差の検定の統計量は、いつも次の形をしています。
つまり分子はどのやり方でも「標本平均の差」で、迷うところがありません。違いが出るのは分母です。標本平均の差の標準誤差をどう見積もるかだけです。ここから紹介するのは、その見積もり方の違いです。
① 独立2標本 t検定:ばらつきは足し算
2群が独立なら、差 $\bar{x}_1-\bar{x}_2$ のばらつき(分散)はそれぞれの分散の和(第5章・第7章で既出)です。だから標準誤差は $\sqrt{\frac{s_{u1}^2}{n_1}+\frac{s_{u2}^2}{n_2}}$ です。これで差を割れば検定統計量になります。
母分散が両群とも分かっている場合(分散既知)は、分母の不偏分散を母分散に置き換えて、$t$ ではなく $z$ で判定します。1標本のときの「既知なら $z$、未知なら $t$」の使い分けがそのまま2標本にも当てはまります。
A塾は入塾テストで選抜しています。B塾は誰でも入れます。両塾の生徒から無作為に選んで同じ模試を受けさせたところ、
・A塾:$n_1=16$ 人、標本平均 $72$ 点、不偏標準偏差 $8$ 点
・B塾:$n_2=12$ 人、標本平均 $63$ 点、不偏標準偏差 $12$ 点
見えている $9$ 点差は、たまたま選ばれた生徒のせいかもしれません。両塾の実力(母平均)に差があると言えるでしょうか(両側 $5\%$、自由度は近似で $18$、$t_{0.025,\,18}=2.101$ とする)。
・$H_0:\ \mu_1=\mu_2$、$H_1:\ \mu_1\neq\mu_2$。
・標準誤差 $=\sqrt{\dfrac{8^2}{16}+\dfrac{12^2}{12}}=\sqrt{4+12}=\sqrt{16}=4$
・$t=\dfrac{72-63}{4}=\dfrac{9}{4}=2.25$。$|2.25|>2.101$ なので棄却。
→ 2塾の平均点には有意差がある。
※ ばらつきを別々に見積もると自由度がきれいな整数にならず、近似で求めます(ここでは $18.1\to18$)。これがウェルチ検定の特徴で、試験では自由度が与えられることがほとんどです。
いまの例は、選抜の有無でばらつきそのものが違う2群でした。一方で、2群のばらつきが等しいとみなせる場面もあります(等分散)。同じ装置・同じ工程で水準だけを変えたとき、同じ集団をランダムに2群へ割り付けたとき(A/Bテスト)、同じテストを2クラスに実施したときです。ばらつきが「測り方や環境」で決まっていて、介入は平均だけを動かす、という状況です。
逆に等分散といえないのは、集団の性質からして違う(さきほどの塾)/介入がばらつき自体を変える(効く人には劇的、効かない人には無効な薬)/比率や件数のように分散が平均に連動するデータ、といった場合です。判断がつかないときは 6「母分散・等分散の検定」の F検定でふるいにかけます(等分散を「証明」する手段ではありません。理由は 6)。ただし本来の根拠は、上のようなデータの取られ方のほうです。
等分散とみなせるなら、ばらつきを2つ別々に見積もる必要はありません。同じ1つのばらつきを2回測ったことになるので、両群のデータをまとめて1つの見積もりにするほうが精度が上がります。これがプール分散 $s_p^2$ です(pool=ためる。試験では「合併分散」「プールした分散」とも書かれます)。自由度も $n_1+n_2-2$ ときれいに決まり、計算は少し楽になります(もっとも、試験ではどちらも知っておく必要があるので、その意味では楽になりませんが)。
同じ試験をA組・B組で実施し、各クラスから無作為に $8$ 人ずつ選んで採点しました。A組は標本平均 $86$ 点、B組は $78$ 点です。両群のばらつきは等しいとみなせ、プール標準偏差は $s_p=6$ 点でした。2クラスの母平均に差があると言えるでしょうか(両側 $5\%$、$t_{0.025,\,14}=2.145$)。
・$H_0:\ \mu_1=\mu_2$、$H_1:\ \mu_1\neq\mu_2$。自由度 $n_1+n_2-2=14$。
・標準誤差 $=s_p\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}=6\sqrt{\dfrac{1}{8}+\dfrac{1}{8}}=6\sqrt{0.25}=6\times0.5=3$
・$t=\dfrac{86-78}{3}=\dfrac{8}{3}\approx2.67$。$|2.67|>2.145$ なので棄却。
→ 2クラスの平均点には有意差がある。
② 対応のある t検定:「差」をとって1標本に落とす
同じ人の前後を比べるなら、個人差(もともと血圧が高い人・低い人)が邪魔です。そこで各人の差 $d_i=(\text{後})-(\text{前})$ をとると、個人差は引き算で消え、残るのは「変化量」だけです。あとは差 $d$ を1標本として「その平均が $0$ か」を検定するだけです。
5人の収縮期血圧を服薬前後で測定しました。差 $d=(\text{後})-(\text{前})$ は
$-8,\ -7,\ +1,\ -7,\ -9$ です(3人目はむしろ上がったのに注意)。血圧は下がったと言えるでしょうか(両側 $5\%$、$t_{0.025,\,4}=2.776$)。
・差の平均 $\bar{d}=\dfrac{-8-7+1-7-9}{5}=\dfrac{-30}{5}=-6$
・差の不偏分散 $s_d^2=\dfrac{(-2)^2+(-1)^2+7^2+(-1)^2+(-3)^2}{5-1}=\dfrac{4+1+49+1+9}{4}=\dfrac{64}{4}=16$ → $s_d=4$
・標準誤差 $\dfrac{s_d}{\sqrt{n}}=\dfrac{4}{\sqrt{5}}\approx1.789$
・$t=\dfrac{-6}{1.789}\approx-3.35$。$|{-3.35}|>2.776$ なので棄却。
→ 血圧は有意に下がった。3人目のような個人のバラつきがあっても、ペアで差をとると変化が浮き彫りになります。
同じ対象を2回測ったデータに独立の検定を使うと、個人差が誤差に紛れ込んで差を見逃しやすくなります(検出力が落ちる)。逆に別々の対象なのに対応ありとして扱うのは誤りです。判断基準は1つです。「各データに1対1の相手がいるか」です。前後・左右・双子・マッチングなら対応ありです。
母比率 p の検定
「クリック率は上がったか」「支持率に差はあるか」:割合の検定
賛成率・不良率・クリック率など割合を検定したいとします。ここで使うのは t ではなく z です。母平均のときは t だったのに、なぜでしょうか。順に整理します。
・大前提のルール:母分散が未知なら t、既知なら z。
・3「母平均 $\mu$ の検定」では、$H_0$ で母平均を $\mu_0$ と置いても、母分散は別の未知数として残りました。現実には調べようがないので、標本から不偏分散で代用するしかなく、そのぶんの不確かさを引き受けて t検定を使いました。
・ところが母比率では事情が変わります。$H_0$ で $p=p_0$ と置いた瞬間、ばらつきも $\dfrac{p_0(1-p_0)}{n}$ と自動的に決まります。割合のばらつきは $p$ だけで決まるからです(コイン投げと同じで、表の出る確率が決まればブレ方も決まる)。母分散が既知の状況になるので、z が使えます。
あとは $n$ が大きければ、標本比率 $\hat{p}$ の分布は正規分布で近似できます(第6章)。
標準誤差の分母には $\hat{p}$ ではなく$p_0$(仮説の値)を使います。「$H_0$ が正しい世界」での分布を考えるからです。ここが区間推定との違いです。
第7章の区間推定では真の $p$ が不明なので $\hat{p}$ で代用しました。検定では「$H_0$ が正しい(=$p=p_0$)と仮定した世界」での散らばりを計算するので、分母は$p_0(1-p_0)$ です。同じ「比率の標準誤差」でも、目的が違えば中身が変わります。
このアプリの翌日継続率(インストールした人が翌日も起動する割合)は、これまでの膨大なログから $20\%$ と分かっています($p_0=0.20$)。起動画面を改修したあとにインストールした $n=400$ 人を見ると、$100$ 人が翌日も起動しました(標本比率 $\hat{p}=0.25$)。改修で継続率は変わった(母比率 $p\neq0.20$)と言えるでしょうか(両側 $5\%$)。
・$H_0:\ p=0.20$、$H_1:\ p\neq0.20$(両側)。改修で下がる可能性もあるため片側にはしない。
・標準誤差 $=\sqrt{\dfrac{0.20\times0.80}{400}}=\sqrt{\dfrac{0.16}{400}}=\sqrt{0.0004}=0.02$
・$z=\dfrac{0.25-0.20}{0.02}=\dfrac{0.05}{0.02}=2.5$。両側棄却域は $|z|>1.96$(標準正規分布表より)。$2.5>1.96$ なので棄却。
・p値 $=2\times P(Z>2.5)\approx0.012<0.05$。
→ 翌日継続率は有意に変わった(上がった)と言えます。
ある政策への賛否を、有権者から無作為に選んだ $n=400$ 人に聞いたところ、$216$ 人が賛成でした(標本比率 $\hat{p}=0.54$)。有権者全体でも賛成が過半数(母比率 $p>0.5$)だと言えるでしょうか(片側 $5\%$)。
・「過半数」が問いなので、基準は $p_0=0.5$。$H_0:\ p=0.5$、$H_1:\ p>0.5$(右片側)。
・標準誤差 $=\sqrt{\dfrac{0.5\times0.5}{400}}=\sqrt{\dfrac{0.25}{400}}=\sqrt{0.000625}=0.025$
・$z=\dfrac{0.54-0.50}{0.025}=\dfrac{0.04}{0.025}=1.6$。片側棄却域は $z>1.645$(標準正規分布表より)。$1.6<1.645$ なので棄却できない。
・p値 $=P(Z>1.6)\approx0.055>0.05$。
→ 聞いた $400$ 人では $54\%$ だったが、有権者全体で過半数とまでは言い切れない(惜しくも届かない)。
※ 世論調査の「$54\%$ が賛成」がそのまま「国民の過半数が賛成」を意味しないのは、これが理由です。聞いた人数を増やせば同じ $54\%$ でも判定は変わります($n=1000$ なら $z\approx2.53$ で棄却)。
2標本・母比率の差の検定:プール推定量
2群の比率を比べるとき、$H_0$ は「$p_1=p_2$」です。つまり2つの群は同じ $p$ を持つという仮定です。
型は 4「2標本:母平均の差の検定」とまったく同じで、母平均が母比率に変わっただけです。
つまりここでも主題は分母です。標本比率の差の標準誤差をどう見積もるかが問題です。ところがこの標準誤差の式には、未知の母比率 $p$ が入り込みます(下の導出のとおり $\sqrt{p(1-p)\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}$ という形)。標準誤差を計算するには、まずその $p$ を見積もる必要があります。そして $H_0$ が「両群とも同じ $p$」と言っている以上、見積もりは両群のデータを合算して1つ作るのが自然です。これがプール標本比率 $\hat{p}$ です(等分散のときプール分散を作ったのと同じ発想)。
ある政策について、A町の有権者から無作為に $n_1=200$ 人、B町から $n_2=200$ 人を選んで賛否を聞いたところ、賛成はA町 $80$ 人($\hat{p}_1=0.40$)、B町 $60$ 人($\hat{p}_2=0.30$)でした。両方の町の賛成率に差がある(母比率 $p_1\neq p_2$)と言えるでしょうか(両側 $5\%$)。
・プール比率 $\hat{p}=\dfrac{80+60}{200+200}=\dfrac{140}{400}=0.35$
・標準誤差 $=\sqrt{0.35\times0.65\times\left(\tfrac{1}{200}+\tfrac{1}{200}\right)}=\sqrt{0.2275\times0.01}=\sqrt{0.002275}\approx0.0477$
・$z=\dfrac{0.40-0.30}{0.0477}=\dfrac{0.10}{0.0477}\approx2.10$。両側棄却域は $|z|>1.96$(標準正規分布表より)。$2.10>1.96$ → 棄却。
→ 2つの町の賛成率には有意差がある(p値 $\approx0.036$)。
母分散・等分散の検定
「ばらつきが大きすぎないか」「2群の分散は等しいか」:χ²検定と F検定
工場のラインから 20個だけ抜き取って測ったら、寸法が思ったよりバラついていました。 規定なら分散は $4$ くらいに収まるはずなのに、手元の値は $6.5$ です。
ここで湧く疑問は2つです。「20個しか見ていないから、たまたま散らばっただけ?」か、 「機械が傷んで、本当にバラつきが大きくなった?」か、という2つです。 3 で母平均に対して立てたのとまったく同じ問いを、 今度はばらつきそのものに立てているわけです。
答え方も同じです。「規定どおり(分散 $4$)だとしたら、$20$ 個からこれだけ散らばった値が出るのは どれくらい珍しいか」を確率で測ります。使う分布は第6章のカイ二乗分布と F分布で、 あそこで見た形がそのまま検定統計量になります。
① 母分散の検定(χ²検定)
第6章で、標本のばらつきを $\dfrac{(n-1)s_u^2}{\sigma^2}$ という形にすると自由度 $n-1$ のカイ二乗分布に従う、と学びました(第6章)。この性質が、そのまま検定の道具になります。
$H_0$ で母分散を $\sigma_0^2$ と置くと、式の中の $\sigma^2$ が $\sigma_0^2$ に確定します(母比率のときと同じで、$H_0$ が未知数を埋めてくれる)。あとは計算した値がカイ二乗分布のどこに落ちるかを見るだけです。標本のばらつきが規定どおりなら分布の重心あたり、大きければ右、小さければ左に落ちます。
$H_0$ が $\sigma_0^2$ を決めるので、分母は既知の値になります。
規定の分散は $\sigma_0^2=4$ です。$n=20$ 個の標本で不偏分散 $s_u^2=6.5$ です。バラつきが大きくなったと言えるでしょうか(片側 $5\%$、$\chi^2_{0.05,\,19}=30.14$)。
・$H_0:\ \sigma^2=4$、$H_1:\ \sigma^2>4$(上側片側)。
・$\chi^2=\dfrac{(20-1)\times6.5}{4}=\dfrac{19\times6.5}{4}=\dfrac{123.5}{4}\approx30.88$
・棄却域 $\chi^2>30.14$。$30.88>30.14$ → 棄却。
→ バラつきは有意に大きくなった。
この例で疑ったのは「ばらつきが大きくなったのでは」なので上側でした。疑いが「小さすぎないか」なら下側、「規定と違うのでは」なら両側になり、使う臨界値が変わります。カイ二乗分布は左右非対称なので、$z$ のように符号を変えるだけでは下側の点が出せません。そのためカイ二乗分布表には、上側の列と下側の列の両方が用意されています。
読むときの注意が1つです。$\chi^2_{0.975,\,9}=2.70$ は「下から $97.5\%$ の点」ではなく「上側確率が $0.975$ の点」=下から $2.5\%$ の点です。第7章の母分散の信頼区間で使ったのと同じ値です。
② 2標本の等分散検定(F検定)
2群の分散が等しいか($H_0:\ \sigma_1^2=\sigma_2^2$)は、分散の比で測ります。第6章の通り、2つの不偏分散の比は F分布に従います。比が $1$ から大きく外れれば「分散が違う」と判断できます。
ライン1($n_1=10$)の不偏分散 $s_{u1}^2=18$、ライン2($n_2=10$)の $s_{u2}^2=6$ です。分散は等しいでしょうか(両側 $5\%$、$F_{0.025,\,9,\,9}=4.03$)。
・$F=\dfrac{s_{u1}^2}{s_{u2}^2}=\dfrac{18}{6}=3.0$、自由度 $(9,\ 9)$。
・棄却域 $F>4.03$。$3.0<4.03$ なので棄却できない。
→ 分散が異なるとは言えない。
(「等しいと分かった」ではない)
検定結果の解釈と注意
p値が小さい=「重大な発見」とは限らない:落とし穴を避ける
検定は強力ですが、結果の読み方を誤ると正反対の結論を導きます。試験でも実務でも問われる、3つの典型的な注意点を押さえます。
① 統計的有意 ≠ 実質的に重要
p値は「差が存在するか」を見るだけで、「差が大きいか」は別問題です。標本 $n$ を巨大にすると、標準誤差 $\sigma/\sqrt{n}$ がいくらでも小さくなり、ごく僅かな差でも統計的に有意になります。
ある薬が回復日数を平均 $0.05$ 日(約1時間)だけ短縮するとします。$n=100{,}000$ 人で調べれば p $<0.001$ で「有意」になりえます。だが1時間の短縮に臨床的な価値があるかは別の話です。「有意(significant)」は統計用語で、日常語の「重要」ではありません。効果量(差の大きさ)や信頼区間を併せて見る必要があります。
② 多重検定:何度も検定すれば、いつか偶然当たる
有意水準 $5\%$ は「$H_0$ が正しくても $20$ 回に $1$ 回は誤って棄却する」という意味です。だからたくさん検定すれば、本当は差がなくても、どれか1つは偶然「有意」になります。
差のない $20$ 項目を、それぞれ $\alpha=0.05$ で検定します。少なくとも1つが誤って有意になる確率は
$1-(1-0.05)^{20}=1-0.95^{20}\approx1-0.358=0.642$ → 約 64% です。
つまり「差がない」のに、6割以上の確率で「何か有意な発見」が紛れ込みます。検定回数が増えるなら、$\alpha$ を厳しくする(ボンフェローニ補正など)対策が要ります。
③ 有意でも「因果」ではない/棄却できなくても「差ゼロ」ではない
言い過ぎ①:「有意だから A が B の原因だ」です。検定は関連を示すだけです。因果は実験デザイン(第3章のRCT)で担保するもので、p値からは出てきません。
言い過ぎ②:「棄却できなかったから差はない」です。1「仮説検定の枠組み」の通り、これは判断保留であって「差ゼロの証明」ではありません。標本が小さくて検出力が足りなかっただけ、という可能性が常に残ります。