| 健康 | 肺疾患 | 計 | |
|---|---|---|---|
| 喫煙者 | 30 | 70 | 100 |
| 非喫煙者 | 180 | 20 | 200 |
| 計 | 210 | 90 | 300 |
カイ二乗検定
最終更新:
第8章で検定したのは、平均・比率・分散です。どれも数値(量的データ)でした。でも現実のデータには、カテゴリ(質的データ)がたくさんあります。血液型(A・B・O・AB)、支持政党、通勤手段(電車・バス・車・自転車)、出たサイコロの目などです。これらは平均が取れないので、代わりに「各カテゴリに何件あるか(度数)」を数えます。
そして度数にも、第8章と同じような疑問が湧きます。「サイコロを60回振って6が20回。偏っている?それとも偶然?」「アンケートで喫煙と肺疾患に関連がありそう。本物の関連?それとも偶然?」という疑問です。この度数のズレの偶然/本物を判定するのがカイ二乗(χ²)検定です。
ところで カイ二乗検定は、この章が初対面ではありません。第8章の母分散の検定です。「このラインの寸法、バラつきすぎでは?」を判定したあれが、1つ目のカイ二乗検定でした。数値のばらつきを見るのがあちら、度数のばらつきを見るのがこちらです。名前が同じなのは偶然ではなく、カイ二乗はもともと「ばらつき」の分布だからです。ここは 1 で正面から見ます。
第8章(z・t・χ²検定)
量的データが相手
平均・比率・分散のズレを検定
例:平均回復日数は短くなったか
第9章(χ²検定)
質的データ(度数)が相手
カテゴリごとの件数のズレを検定
例:サイコロの出目は偏っているか
「ズレは無い」と仮定($H_0$)→ そのとき偶然だけで出るズレの分布を描く → 観測がその裾に落ちたら棄却します。
変わるのは1点だけです。何の「ばらつき」を見るかです。第8章は数値のばらつき、この章は度数のばらつきです。どちらも同じカイ二乗分布に乗ります。
そしてこの章は伏線回収の章でもあります。第2章の分割表で「喫煙×肺疾患は関連が強そう」と記述し、「χ²の計算は第9章で」と予告しました。第6章ではカイ二乗分布という道具を作りました。ここでその両方を使い、「関連があると言えるか」に白黒をつけます。
カイ二乗分布は「何の」分布か
ばらつきが従う分布:数値でも度数でも、正体は同じ
第6章でも触れましたが、カイ二乗分布は「ばらつき」が従う分布です。あそこでは $s_u^2$(数値のばらつき)が何に従うかを調べて、この分布にたどり着きました。
同じ母集団から標本を取り直すたびに、手元のばらつきの値は毎回変わります。工場から20個抜き取れば分散は $6.5$ だったり $3.2$ だったりします。サイコロを60回振れば、出目の散らばり方も毎回違います。取り直すたびにばらつきの値がどこに落ちやすいか、それを表したのがカイ二乗分布です。
だから話は単純で、手元のばらつきが怪しいかどうかを調べたければ、この分布と照らせばいいのです。それがカイ二乗検定です。
① 「ばらつき」には2つの顔がある
第8章の母分散の検定と、この章の検定は、見た目はまるで違うのに同じ分布を使います。理由は、どちらも「中心からのズレを、標準化して、2乗して、全部足す」というまったく同じ作り方をしているからです。そしてこの「ズレの2乗の合計」こそが、第1章で学んだばらつき(分散)の定義です。
② だからこの形になる:定義と自由度
「標準化したズレ」は第5章の $Z$ です。それを2乗して足すのだから、カイ二乗分布の定義はこう書けます(第6章の再掲):
期待値 $=k$(自由度)/ 値は $0$ 以上 / 右に歪む / $k$ が大きいほど左右対称に近づく
形の特徴はすべて「2乗して足す」から出ています。2乗するから値は $0$ 以上で左に壁ができ、たまに大きな $Z$ が出ると合計が跳ねるので右に長い裾を引きます。そして$k$ 個足すから、合計の期待値(重心)は $k$ です。これが自由度です。
ここは取り違えやすいところです。重心は母分散 $\sigma^2$ ではありません。$\sigma^2$ が重心なのは $s_u^2$ の方です。$\sigma^2$ で割って目盛りを付け替えた後の姿がカイ二乗分布で、そちらの重心は自由度です(第6章)。
③ どちらの裾を見るかは、何を疑うかで決まる
同じカイ二乗分布を使っても、棄却域をどちら側に取るかは「何を疑っているか」で決まります。
数値のばらつき(第8章)で疑ったのは「ばらつきが大きくなったのでは」でした。だから右側です。
ただし数値のばらつきなら、場面は少ないものの「ばらつきが小さすぎるのでは」という疑いもありえます(たとえば自由度15で $\chi^2=5$ なら下側 $1\%$ 弱)。このときは左側を見ることになります。
では度数のズレ(この章)はどうでしょうか。サイコロを60回振って、出目がちょうど10回ずつだったとします。ズレはゼロ、$\chi^2$ も $0$ で分布のいちばん左です。このとき「このサイコロ、おかしいのでは」と疑うでしょうか。疑いません。想定どおりの、いちばん公平な結果です。
度数のズレは一方通行です。想定どおりなら小さく、想定から外れるほど大きくなります。小さい側には「怪しさ」がありません。だからこの章の棄却域はつねに右側の片側です。
$z$ 表と同じように、カイ二乗分布にも「この値を超える確率が5%」という上側5%点の表があります。統計量がこれを超えたら棄却します。自由度ごとに値が違うのがポイント:
| 自由度 df | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 上側5%点 $\chi^2_{0.05}$ | 3.84 | 5.99 | 7.81 | 9.49 | 11.07 | 12.59 |
※ 自由度が上がるほど「偶然でも合計は大きくなる」(期待値=df)ので、合格ラインも上がります。スライダーで確認してみてください。
適合度検定 🌟
観測した度数は「想定した比率」に合っているか
怪しいサイコロを60回振ったら、出目の度数はこうなった:
| 出目 | 1 | 2 | 3 | 4 | 5 | 6 | 計 |
|---|---|---|---|---|---|---|---|
| 観測度数 | 5 | 8 | 9 | 8 | 10 | 20 | 60 |
6が20回出ました。公平なら各目とも $60 \times \frac{1}{6} = 10$ 回のはずです。でも第8章で学んだ通り、公平でも偶然のブレは必ず出ます。このブレは偶然の範囲か、それとも「公平」を疑うべきでしょうか?
① 期待度数:「$H_0$ が正しいなら何回のはずか」
$H_0$:「サイコロは公平(各目の確率 $\frac{1}{6}$)」です。$H_1$:「公平でない」です。
$H_0$ が正しい世界での理論値が期待度数 $E$(Expected=期待される):$E = n \times (\text{想定した確率})= 60 \times \frac{1}{6} = 10$ 回ずつです。実際に数えたほうは観測度数 $O$(Observed=観測された)。この2つを並べて見ると:
② ズレの総量を1つの数に:カイ二乗統計量
$O_i$=観測度数、$E_i$=期待度数。各カテゴリのズレを2乗し、$E_i$ で割って足します。
| 出目 | 1 | 2 | 3 | 4 | 5 | 6 | 合計 |
|---|---|---|---|---|---|---|---|
| O | 5 | 8 | 9 | 8 | 10 | 20 | 60 |
| E | 10 | 10 | 10 | 10 | 10 | 10 | 60 |
| $O-E$ | −5 | −2 | −1 | −2 | 0 | +10 | 0 |
| $(O-E)^2/E$ | 2.5 | 0.4 | 0.1 | 0.4 | 0.0 | 10.0 | 13.4 |
$\chi^2 = 2.5+0.4+0.1+0.4+0+10.0 = $ 13.4 です。ズレの合計の4分の3を「6の目」1つが占めているのも見えます。
③ 自由度はなぜ「カテゴリ数 − 1」?
カテゴリは6個なのに自由度は $6-1=5$ です。理由は合計60回が固定されているから、5つの目の度数が決まれば、最後の1つは「$60-$ 残り」で自動的に決まってしまい、自由に動けるのは5個だけです。第6章の $n-1$($\bar{x}$ に1個縛られる)と同じ理屈です。
④ 判定:カイ二乗分布の右裾と比べる
$H_0$(公平)が正しければ、$\chi^2$ は自由度5のカイ二乗分布に従います。上側5%点は 11.07(1 の表)。観測した 13.4 はその右です。「公平なら5%未満しか起きないズレ」です。
- $H_0$:想定の比率に従う(公平)/ $H_1$:従わない。
- $\alpha = 0.05$。
- 期待度数 $E$ を作り、$\chi^2 = \sum\frac{(O-E)^2}{E} = 13.4$(自由度 $6-1=5$)。
- $13.4 > 11.07$(上側5%点)→ 棄却域に入る(p値 $\approx 0.02$)。
- 棄却。このサイコロは公平とは言えない。
体感:公平なサイコロでも χ² はこれだけ揺れる
「公平でもズレは出る」を体で確かめます。本当に公平なサイコロを60回振って χ² を計算する、を何度も繰り返すシミュレータです。χ² が合格ライン11.07を超える(=公平なのに誤って棄却される)のは、どれくらいの頻度でしょうか。
遺伝の法則では、エンドウ豆の4タイプが 9:3:3:1 に分かれるはずです。メンデルの観測(556個):
O = 315, 108, 101, 32 / E = 556×(9,3,3,1)/16 = 312.75, 104.25, 104.25, 34.75
$\chi^2 = \frac{2.25^2}{312.75}+\frac{3.75^2}{104.25}+\frac{3.25^2}{104.25}+\frac{2.75^2}{34.75} \approx$ 0.47(自由度3、上側5%点は7.81)
→ $0.47 \ll 7.81$ で棄却できない。理論とよく適合。「合っているか」を確かめる方向にも使えるのが適合度検定です。
① 期待度数が小さすぎるとダメです。χ² がカイ二乗分布に従うのは近似です。期待度数が5未満のセルがあると近似が悪くなります(目安)。カテゴリを併合するなどの対処が要ります。
これは第6章の「標本比率を正規近似してよい目安 $np \ge 5$」と同じ条件です。1マスの期待度数はまさに $E=np$ なので、$E\ge5$ は $np\ge5$ と同じ意味です。度数が正規分布とみなせて初めて、その2乗和がカイ二乗分布になります。
② 「棄却できない」=「従うと証明された」ではありません。メンデルの例も「矛盾しない」までです。第8章の鉄則はここでも同じです。
独立性検定 🌟
分割表の2変数に「関連がある」と言えるか:第2章の伏線を回収する
第2章の分割表を覚えていますか。300人を「喫煙×肺疾患」で集計し、喫煙者の肺疾患率70% vs 非喫煙者10%、オッズ比21倍です。「関連が強そう」でした。でもあれは調べた300人にそういう差があったというだけです。関連が無くても、別の300人を調べればこれくらいの差が出ることはあります。母集団で関連があると言い切るには検定が要ります。ここで白黒をつけます。
① 仮説と期待度数:「独立なら何人のはずか」
$H_0$:「喫煙と肺疾患は独立(無関係)」/ $H_1$:「関連がある」です。
独立なら $P(\text{喫煙}\cap\text{肺疾患}) = P(\text{喫煙}) \times P(\text{肺疾患})$ です(第4章)。これを度数に直すと期待度数の公式になります:
| 健康 | 肺疾患 | 計 | |
|---|---|---|---|
| 喫煙者 | 70 | 30 | 100 |
| 非喫煙者 | 140 | 60 | 200 |
| 計 | 210 | 90 | 300 |
例:喫煙者×肺疾患のマス → $E = \dfrac{100 \times 90}{300} = 30$ 人です。観測は70人です。40人分のズレが全マスにあります。
ここでひとつ、順番が引っかかります。
これまでに出てきた期待値・期待度数は、「期待」と付くだけあって観測する前から分かっている値でした。サイコロなら $\frac{1}{6}$、メンデルなら 9:3:3:1(2)。先に「こうなるはず」を決めておいて、あとから観測と見比べます。
ところがこの公式は、観測した表から行合計・列合計を取ってきて期待度数を作っています。観測が先に来てしまっていて、ワクワク感がありません。
理由は $H_0$ の中身にあります。「各目の確率は $\frac{1}{6}$」は値まで言い切っているので、観測を見ずに期待度数を作れました。いっぽう「喫煙と肺疾患は独立」が言っているのは掛け算の関係だけで、喫煙者が何割か・肺疾患が何割かは何も指定していません。足りない部分はデータから借りるしかありません。それが「周辺合計を使う」の正体です。
そして借りるのはタダではありません。データから比率を借りたぶん、自由に動けるマスが減ります。適合度検定が「合計を借りて $-1$」で $k-1$ だったのに対し、独立性検定は行と列の比率も借りるので、そのぶんさらに引かれて $(r-1)(c-1)$ になります。次の②で、マスを数える側から同じことを確かめます。
② 統計量と自由度
あとは適合度検定と同じ公式で、全マスのズレを合計するだけ:
$\chi^2 = \dfrac{(30-70)^2}{70} + \dfrac{(70-30)^2}{30} + \dfrac{(180-140)^2}{140} + \dfrac{(20-60)^2}{60}$
$\;\;= \dfrac{1600}{70} + \dfrac{1600}{30} + \dfrac{1600}{140} + \dfrac{1600}{60} = 22.9 + 53.3 + 11.4 + 26.7 \approx$ 114.3
※ 2×2ではどのマスもズレの絶対値が同じ40になります(周辺合計が固定されているため)。分母 $E$ だけが違います。
2×2 表なら $(2-1)(2-1) = 1$ です。
なぜ $(r-1)(c-1)$ なのでしょうか。周辺合計(行の計・列の計)がすべて固定されているので、自由に決められるマスは左上の1つだけです。そこを決めれば、残り3マスは引き算で全部決まります:
③ 判定
$H_0$(独立)が正しければ、$\chi^2$ は自由度1のカイ二乗分布に従います($2\times2$ 表なので $(2-1)(2-1)=1$)。自由度1の上側5%点は 3.84(1 の表)。これが合格ラインです。
$\chi^2 = 114.3 \gg 3.84$ です。合格ラインの約30倍で、p値は実質ゼロです。
→ H₀(独立)を棄却。喫煙と肺疾患には統計的に有意な関連がある。
第2章で見た「70% vs 10%」「オッズ比21倍」という強烈な差は、偶然のブレでは説明できない本物の関連だった、と確定できました。
ところでこの手順、2 の適合度検定とほとんど同じだったことに気づきます。実際、独立性検定は適合度検定の一種です。
言えたのは「関連がある」までです。喫煙が肺疾患の原因だと言うには、交絡(第3章)を排除した実験デザインの議論が別に必要です。観察データのχ²検定は関連の存在を示すだけです。
④ 発展:カテゴリが「2択」のとき
ここまでの例は、サイコロ(6択)・喫煙×肺疾患(2×2)と、カテゴリ数がまちまちでした。じつはカテゴリが2択のときだけ、χ²検定は第8章の検定とまったく同じものになります。「2択もカテゴリデータなのに、なぜ第8章では比率の検定で済んだのか」という疑問への答えです。
残差分析・効果量
「有意」で終わらせない:どこが・どれくらいズレているのか
χ²検定が答えるのは「関連があるか」の Yes/No だけです。実務で次に知りたいのは2つです。①どのマスがズレの犯人か(特に表が大きいとき)、②関連はどれくらい強いか、の2点です。それぞれに道具があります。
① 標準化残差:犯人のマスを特定する
各マスのズレを z スコア化したものです。目安:絶対値が2を超えるマスは「偶然では説明しにくいズレ」です。
この $\frac{O-E}{\sqrt{E}}$ は、そのマス本来のばらつきよりやや大きい値で割っているため、残差は控えめ(小さめ)に出ます。 分母を本来のばらつきに直した調整済み標準化残差を使うと値はもう少し大きくなり、$|2|$ の線がより正しく引けます。 2級では上の式で「どのマスが目立つか」を読めれば十分です。
喫煙×肺疾患の4マスで計算し、ヒートマップにすると(赤=期待より多い/青=期待より少ない、濃いほど大きなズレ):
| 健康 | 肺疾患 | |
|---|---|---|
| 喫煙者 | −4.8 | +7.3 |
| 非喫煙者 | +3.4 | −5.2 |
例:喫煙者×肺疾患 → $(70-30)/\sqrt{30} = +7.3$ です。4マスすべて $|2|$ 超え、最大の犯人は「喫煙者の肺疾患が期待より多すぎる」マスです。
600人(各年代200人ずつ)に通勤手段を聞いた結果です。列合計は 電車240・バス60・車240・自転車60 なので、独立なら各年代とも 電車80・バス20・車80・自転車20 のはず:
| 電車 | バス | 車 | 自転車 | 計 | |
|---|---|---|---|---|---|
| 20代 | 110 | 20 | 40 | 30 | 200 |
| 40代 | 80 | 22 | 80 | 18 | 200 |
| 60代 | 50 | 18 | 120 | 12 | 200 |
| 計 | 240 | 60 | 240 | 60 | 600 |
$\chi^2 \approx$ 71.3、自由度 $(3-1)(4-1)=6$、上側5%点は 12.59(1 の表)。文句なく棄却です。年代と通勤手段には関連があります。
ですが、この 71.3 という1つの数字からは「12マスのどこが大きくずれているのか」がまったく読めません。標準化残差にしてみます:
| 電車 | バス | 車 | 自転車 | |
|---|---|---|---|---|
| 20代 | +3.4 | 0.0 | −4.5 | +2.2 |
| 40代 | 0.0 | +0.4 | 0.0 | −0.4 |
| 60代 | −3.4 | −0.4 | +4.5 | −1.8 |
構造が一目で出ます。20代は電車と自転車に寄り、車が極端に少なくなっています。60代はその裏返しで車に寄ります。そして40代の行は真っ白で、どの手段も期待どおりです。
「関連がある」の中身は20代と60代の対比で、40代は関与していませんでした。$\chi^2$ の値をいくら眺めても、ここには辿り着けません。
② クラメールの V:関連の「強さ」を測る
第2章では、量的データどうしの関連の強さを相関係数($-1$〜$1$)で測りました。カテゴリデータにも同じものが欲しいところです。独立(関連ゼロ)から完全連動(片方が決まればもう片方も決まる)までを、0〜1の1つの数で言えるようにしたいわけです。
ところが、いま手元にある「関連の量」は $\chi^2$ しかありません。そしてこれは物差しになりません。上限がなく、$n$ を10倍にすれば10倍になり、表が大きくなればさらに大きくなります。「114.3」と言われても、強いのか弱いのか判断できないのです。
そこでクラメールは、$\chi^2$ をその表で取りうる最大値で割ることを考えました。
$V = \sqrt{\dfrac{114.3}{300 \times \min(1,1)}} = \sqrt{0.381} \approx$ 0.62
→ 目安(0.5以上で強い)に照らして強い関連。「有意(p値)」と「強い(V)」の両方が揃いました。
全マスの比率を変えずに標本を10倍(n=3000)にすると、χ² も10倍(1143)になり p値はさらに極小へ向かいます。でも $V=\sqrt{\chi^2/n}$ はまったく変わりません。
→ 大標本ではごく弱い関連でも p値は簡単に有意になります。第8章 7「統計的有意 ≠ 実質的に重要」の質的データ版です。p値は「あるか」、V は「どれくらいか」です。役割を分けて両方見ます。
| ステップ | 道具 | 答える問い |
|---|---|---|
| ① 検定 | $\chi^2$ と p値 | 関連(ズレ)はあるか? |
| ② 残差分析 | 標準化残差 $\frac{O-E}{\sqrt{E}}$ | どのマスがズレているか? |
| ③ 効果量 | クラメールの $V$ | 関連はどれくらい強いか? |
※ ①② は適合度検定(1行の表)でも使えます。サイコロなら $(20-10)/\sqrt{10} \approx +3.2$ で「6の目」が犯人です。③ の $V$ は2変数の関連の強さを測る量なので、分割表($r \times c$)専用です。