第2章 / STEP 1

2変数以上のデータ

2つの変数の「関係」を見抜き、予測モデルにつなげる
散布図 相関係数 疑似相関 単回帰 最小二乗法 分割表

最終更新:

なぜ「2つの変数の関係」を見るのか
1つずつ見ていては絶対に気づけないことがある

第1章では変数を1つずつ要約しました。でも実務で本当に知りたいのは、たいてい 2つの量のあいだの関係です。たとえば「広告費を増やすと売上は伸びるのか」 「勉強時間と点数は連動しているのか」「喫煙者は肺の病気になりやすいのか」といった問いです。

こうした問いは、変数を別々に平均・標準偏差で眺めていても答えが出ません。 2つを組にして見て初めて、関係の向き・強さ・形が現れます。

第1章(前章)

変数1つを要約する
「数学の平均は62点」
「物理の平均は58点」

第2章(本章)

変数2つの関係を測る
「数学ができる人は物理もできる」
相関 0.85 / 予測式 y = 0.9x + 2.2

1

散布図と相関のイメージ

2つの変数の「関係性」をまず目で見る

身のまわりには、こんな「2つの量の関係」があふれています。

身長 × 体重

身長が高い人は体重も重い傾向

勉強時間 × 点数

勉強時間が長いと点数が高い傾向

駅徒歩分 × 家賃

駅から遠いほど家賃は安い傾向

こうした関係を、まずは数式を使わず目で見るところから始めます。関係の向き・強さ・形は、散布図を1枚描けばほとんど分かります。

散布図とは

横軸 $x$ と縦軸 $y$ に2つの変数を取り、各データを1点としてプロットしたものを散布図といいます。点の並び方は、大きく分けて次の3パターンです。

正の相関
x が増えると y も増える
負の相関
x が増えると y は減る
無相関
関係なし(バラバラ)

相関をスライダーで体験

相関係数 $r$ を動かすと、点の散らばり方がどう変わるかを観察しましょう。

散布図(相関係数 r を動かしてみる)
+0.70

目安:相関係数の強さ
|r| < 0.2
ほぼ無相関
0.2〜0.4
弱い相関
0.4〜0.7
中程度
|r| ≥ 0.7
強い相関

※ 分野によって基準は異なります。心理学や社会科学では「弱い」基準が緩めになることもあります。

2

共分散と相関係数

「関係の強さ」を数値で表す

共分散(covariance)

公式
$$s_{xy} = \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})$$

共分散は、各点を「平均からのズレ」で見て、x のズレと y のズレの符号が同じか反対かを集計する量です。

共分散を「象限」で見る

平均位置で4つの象限に分け、各点が共分散に寄与する符号を色で表示しました。

緑=正の寄与(右上・左下) / 赤=負の寄与(右下・左上)

このデータを、各点の「ズレ×ズレ」の長方形で描き直します。平均の交差点と各点を対角とする長方形の面積が、その点の寄与の大きさです。

緑の長方形の面積の和 − 赤の長方形の面積の和 を $n$ で割ったものが共分散

共分散は、この緑の点たちと赤の点たちの綱引きです。各点の「ズレ×ズレ」を足し合わせるので、緑(正の寄与)が勝てば共分散は正、赤(負の寄与)が勝てば負になります。上の図では緑が4点、赤が2点で、しかも赤は平均のすぐ近くにあって力が弱いので、共分散は正です。つまり共分散を計算すれば、散布図を描かなくても正の相関か負の相関かを符号1つで判断できます。

共分散の問題点

符号は分かる一方で、共分散の大きさから「相関の強さ」を判断しようとすると、2つの問題があります。

問題点①:同じデータでも、単位を変えると共分散の値が変わる

同じ5人の身長と体重のデータがあるとします。身長を cm で測るか mm で測るかだけ違う2パターンを比べてみます。

パターン A:身長を cm で測る
身長 x [cm]160165170175180
体重 y [kg]5557606365
$\bar{x}=170$、$\bar{y}=60$
共分散:$s_{xy} = $ 26 cm·kg
パターン B:身長を mm で測る(同じデータ!)
身長 x [mm]16001650170017501800
体重 y [kg]5557606365
$\bar{x}=1700$、$\bar{y}=60$
共分散:$s_{xy} = $ 260 mm·kg

同じ人たちの同じ関係性なのに、単位を mm に変えただけで共分散が 10 倍です!
身長と体重の「相関の強さ」は変わったはずがありません。つまり共分散の絶対値はそのデータの相関の強さを表していないのです。

問題点②:異なる変数ペアどうしで強さを比較できない

同じ5人について、別の組み合わせも見てみます。

A:身長×体重
身長 [cm]160165170175180
体重 [kg]5557606365
共分散:26 cm·kg
(点はほぼ一直線に並んでいる)
B:身長×手の長さ
身長 [cm]160165170175180
手の長さ [mm]170165195180190
共分散:55 cm·mm
(点はかなりバラついている)
2つのペアの散布図を見比べてみる

共分散だけ見ると… A=26 < B=55 なので、「B(身長×手)の方が相関が強い!」と判断してしまいそうです。
でも散布図を見ると… A はきれいに一直線、B はかなりバラついている → 明らかに A の方が相関が強いのに、共分散の値は逆です!

ピアソンの相関係数

上の2つの問題(単位依存・ペア間比較不能)を解決するために、共分散をそれぞれの標準偏差で割って正規化します。これがピアソンの相関係数です。

公式
$$r = \frac{s_{xy}}{s_x \cdot s_y} = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum(x_i-\bar{x})^2}\sqrt{\sum(y_i-\bar{y})^2}}$$

範囲:$-1 \leq r \leq 1$ / $r=+1$ で完全な正の直線、$r=-1$ で完全な負の直線、$r=0$ で線形関係なしです。

「標準偏差で割る」と何が起きるか
  • ① 単位がキャンセルされる:$\dfrac{s_{xy}\,[\text{cm·kg}]}{s_x\,[\text{cm}] \times s_y\,[\text{kg}]} = $ 単位なしの数
  • ② スケールに依存しなくなる:身長を cm にしても mm にしても同じ値
  • ③ 必ず $-1 \leq r \leq 1$ の範囲に収まる(数学的に証明される)
  • ④ 異なるペアどうしで「強さ」を比較できる(無次元なので)

先ほどの2つのペアに相関係数を適用すると

ペア $s_{xy}$(共分散) $s_x$ $s_y$ $r = s_{xy}/(s_x s_y)$
A:身長×体重 26 cm·kg ≈7.07 cm ≈3.69 kg ≈ 0.997(ほぼ完璧)
B:身長×手の長さ 55 cm·mm ≈7.07 cm ≈11.40 mm ≈ 0.682(中くらい)

相関係数で見ると明らかに A の方が強い相関(0.997 vs 0.682)と判断できます。共分散の大小に騙されなくなりました。

※ ちなみにパターン A の身長を mm に変えても、$s_x$ も10倍、$s_{xy}$ も10倍になるため、$r$ の値は完全に同じ 0.997 です。これが「単位に依存しない」ということです。

別の計算例(10人の数学と物理の点数)

データ
生徒ABCDEFGHIJ
数学 $x$60657075808570758090
物理 $y$55626870788065727585
この10人のデータの散布図と相関係数
$\bar{x}$(数学平均)
75.0
$\bar{y}$(物理平均)
71.0
共分散 $s_{xy}$
—
相関係数 $r$
—
補足:標本共分散と不偏共分散

本サイトの式は $n$ で割る「標本共分散」です。母集団の共分散を不偏推定する場合は $n-1$ で割ります。
ただし相関係数 $r$ は分子分母どちらでも同じ値になります(割る数が分子分母で約分される)。

3

相関の落とし穴

相関係数を見るときに必ず気をつけるべき4つの罠

⚠️ 罠①:相関は因果ではない

これは統計を学ぶうえで最も重要な原則の1つです。

有名な例:アイスクリームと水難事故

アイスクリームの売上と水難事故の件数を月別に集計すると、強い正の相関が見られます。
では、「アイスクリームを食べると水難事故に遭いやすくなる」のでしょうか?

❌ ありがちな誤解:「アイス → 水難事故」と直結する
アイス売上 ??? 因果あり 水難事故

本当の構造はこうなっています:

✅ 実際は「暑い」が共通原因 → 両方を同時に押し上げているだけ
暑い → 食べたくなる → 水遊びが増える アイス売上 ↑ 水難事故 ↑ 見かけ上の相関(疑似相関)
このように、2つの変数の両方に影響を与える「第3の変数」を交絡因子(confounder)といいます。
見かけ上の相関を「疑似相関(spurious correlation)」と呼びます。

疑似相関を見破る道具:層別した散布図

交絡因子が疑わしいとき、いちばん簡単な確かめ方は、その第3の変数でデータをグループ分けしてから散布図を見ることです。この操作を層別といいます。「暑い日どうし」「涼しい日どうし」で比べても相関が残るなら本物の関係、消えるなら気温のせいだったと分かります。

気温で層別すると、アイスと水難事故の相関はどうなるか

30日ぶんの「アイス売上」と「水難事故」です。ボタンで、全体で見るか、気温の層ごとに見るかを切り替えます。

疑似相関を見破るもう1つの道具:偏相関係数

層別を「数値」でやるのが偏相関係数です。第3の変数 $z$ の影響を $x$ と $y$ の両方から取り除いたうえで、残った $x$ と $y$ の相関を測ります。

偏相関係数($z$ の影響を除いた $x$ と $y$ の相関)
$$r_{xy\cdot z} = \frac{r_{xy} - r_{xz}\, r_{yz}}{\sqrt{(1 - r_{xz}^2)(1 - r_{yz}^2)}}$$

分子は「見えている相関 $r_{xy}$ から、$z$ を経由して生まれる分 $r_{xz}\,r_{yz}$ を引いたもの」です。分母は残りを $-1$〜$1$ の範囲に戻すための調整です。

材料は3つの相関係数だけです。3つ以上の変数があるとき、すべてのペアの相関係数を表にまとめたものを相関行列と呼びます。上のデータの相関行列はこうなります。

アイス売上 $x$水難事故 $y$気温 $z$
アイス売上 $x$10.840.96
水難事故 $y$0.8410.89
気温 $z$0.960.891

※ 対角線は自分自身との相関なので必ず 1、対角線をはさんで対称です。実質的な情報は右上(または左下)の3つだけです。

具体例:気温を除いたアイスと水難事故の偏相関

$r_{xy}=0.84$、$r_{xz}=0.96$、$r_{yz}=0.89$ を公式に入れます。
・分子:$0.84 - 0.96 \times 0.89 = 0.84 - 0.85 = -0.01$
・分母:$\sqrt{(1-0.96^2)(1-0.89^2)} = \sqrt{0.078 \times 0.208} \approx 0.13$
・偏相関係数:$r_{xy\cdot z} \approx -0.01 \div 0.13 \approx -0.1$
→ 見えていた相関 $0.84$ は、気温を除くとほぼ $0$ になりました。アイスと水難事故に直接の関係はなく、気温が両方を動かしていただけです。層別の散布図で見た結果と一致します。

偏相関係数がほぼ $0$ なら疑似相関の疑いが濃厚です。逆に $z$ を除いても相関が残るなら、少なくとも $z$ のせいではありません(ただし別の交絡因子が隠れている可能性は残ります)。

⚠️ 罠②:外れ値1つで相関係数は大きく変わる

相関係数は外れ値の影響を強く受けます。たった1つの外れた点で値が劇的に変わることがあります。

外れ値 vs 相関係数
相関係数 $r$
—
データ数
—

⚠️ 罠③:ピアソン相関は「直線関係」しか測れない

$y = x^2$ のような曲線関係の場合、ピアソン相関係数はほぼ 0になります。「相関なし」ではなく「線形相関なし」と理解する必要があります。

明らかな関係があるのに r ≈ 0 の例

このU字型データは強い関係性があるのに、ピアソン相関係数は約0 です。
→ 必ず散布図を見ましょう!

コラム:相関の「広い意味」と「狭い意味」

そもそも相関には広い意味と狭い意味があります。広い意味の相関とは、$x$ を知ることで $y$ がどれだけ予測しやすくなるかの度合いのことです。関数っぽさの度合いとも言えます。上のU字型データは $x$ が決まれば $y$ が一意に決まる完全な関数なので、広い意味では相関が最大です。

ところがピアソンの相関係数は直線的な関数っぽさしか測れない、狭いモノサシです。だから上のデータを相関ゼロと判定します。単に「相関がある」と言うときは、たいていこの狭い意味(ピアソン)の方を指します。

⚠️ 罠④:同じ統計量でも形は全く違う(アンスコムのカルテット)

下の4つのデータセットは、平均・分散・相関係数・回帰直線がほぼ全て同じです。しかし散布図は…

データ I(普通の直線関係)
データ II(実は曲線)
データ III(外れ値1つに歪められる)
データ IV(外れ値1点に全依存)
統計量IIIIIIIV
$\bar{x}$9.09.09.09.0
$\bar{y}$7.57.57.57.5
$s_x^2$10101010
$s_y^2$3.753.753.753.75
相関係数 $r$0.820.820.820.82
⭐

数値だけ見ると同じに見えるデータも、図にすると全く違うことがあります。
→ 統計量を計算する前に「必ず散布図を描く」のが鉄則です!

4

単回帰分析

「x から y を予測する」直線をデータから求める

これまでは「2変数に関係があるか」を見てきました。ここからは一歩進んで「予測」に挑戦します。まずはこの散布図から:

問い:x = 7.5 のとき、y はいくつくらいになりそう?

観測した10点(グレー)の情報だけで、まだ観測していない x=7.5 の y を予想できますか?

たぶん「6くらいかな」と、点の並びの傾向から目分量で読めたはずです。この「なんとなくの目分量」を、誰がやっても同じ答えになる道具に変えるのがこの節のゴールです。実務でもこの「予測」は至る所に登場します:

こんなとき使う
  • 身長 → 体重を予測する(健康診断)
  • 勉強時間 → 試験点数を予測する
  • 駅徒歩分 → 家賃を予測する(不動産)
  • 広告費 → 売上を予測する(マーケティング)

予測の道具は「関数」:その最小形が直線

欲しいのは「$x$ を入れると $y$ の予測値が1つ返ってくる仕組み」です。数学でいう関数です。その中でいちばんシンプルな関数が直線です。そこで、散布図の傾向を代表する1本の直線を引き、それを「回帰直線」と呼びます。この線さえ引ければ、どんな $x$ でも線をなぞるだけで $y$ を予測できます。

単回帰モデル(直線の式。ただし a と b はまだ未定)
$$y = a + b x$$

$b$:傾き($x$ が1増えると $y$ がどれだけ増えるか) $a$:切片($x=0$ のときの $y$ の値)
$a$ と $b$ が決まって初めて、直線は1本に定まります。その決め方が次のテーマです。

a と b をどう決める? 最小二乗法

直線の候補は無数にあり、データ点はバラついているのですべての点を通る1本は引けません。そこで「データから一番近い」直線を選びます。「近さ」を測るのが残差(=観測値 − 予測値)です。

残差 = 観測値 − 予測値 = $y_i - (a + b x_i)$
すべての残差を二乗して合計したものを残差二乗和(RSS)と呼びます。これを最小にする $a$, $b$ を選ぶのが最小二乗法です。
最小二乗法デモ:自分で直線を引いてみよう

5つのデータ (1,3), (2,5), (3,6), (4,8), (5,9) に対し、直線 $y = a + bx$ をどう引くかを試します。
赤い線は「観測値と直線のズレ(残差)」、その長さの二乗の合計が RSS です。

1.00
0.00
残差二乗和 RSS
—
予測式 $\hat{y}$
—

公式:最小二乗解。覚えるのは「1つの点」と「1つの傾き」

最小二乗法の答えがこの $a, b$ です。これを $y = a + bx$ に代入したものが、回帰直線の(完成した)式になります。

最小二乗法による回帰係数
$$b = \frac{s_{xy}}{s_x^2} = \frac{\sum(x_i-\bar{x})(y_i-\bar{y})}{\sum(x_i-\bar{x})^2}\qquad a = \bar{y} - b\,\bar{x}$$

① 回帰直線は必ず平均の点 $(\bar{x}, \bar{y})$ を通る。これが $a$ の式。
② 傾き $b$ は「共分散 ÷ $x$ の分散」。遠い点ほど重みが大きい「重み付きの傾き」。

決定係数 $R^2$ :モデルの「説明力」

回帰直線が引けたら、次に気になるのは「この直線、データにどれくらいしっくりハマってるの?」です。観測値 $(x_i, y_i)$ は回帰直線のぴったり上には乗らず、線から少しズレて散らばっています。これが残差でした。この残差(線とのズレ)を全データ分集めたとき、どれだけ小さく抑えられているか(言い換えると、点がどれだけ線に沿っているか)を0〜1の数値で表すのが決定係数 $R^2$ です。

まずは、決定係数が低い例と高い例を見てみましょう。

$R^2$ が低い例と高い例
R² ≈ 0.16 点が線から大きく離れている R² ≈ 0.87 点が線にぴったり沿っている

同じ右肩上がりの関係でも、点が線からどれだけ離れているかで $R^2$ は大きく変わります。点が線にぴったりくっつくほど、回帰直線が観測点(実際のデータ)の性質をうまく説明できているということです。

決定係数は「残差がどれだけ小さく抑えられているか」と言いましたが、それを $0$〜$1$ の範囲に数値化するにあたって、$x$ を見ずに全員を平均 $\bar{y}$ と予測したときの残差と比べて、回帰直線で予測したときの残差がどれだけマシかを数値にしたもの、とも言えます。$R^2 = 0.16$ のデータで、この2種類の残差を見比べます。

平均 ȳ で予測したときの残差x を見ずに全員を ȳ と予測ȳ 回帰直線で予測したときの残差x を使って予測

点線が残差です。点線の長さを2乗して全部足すと、左を $100$ としたとき右は $84$ で、$16$% しか減っていません。平均で予測したときと大差ないからこそ、$R^2$ は $0.16$ と低いのです。

$R^2 = 0.87$ のデータで同じ2枚を描くとこうなります。

平均 ȳ で予測したときの残差x を見ずに全員を ȳ と予測ȳ 回帰直線で予測したときの残差x を使って予測

回帰直線からの残差はどれも短くなり、2乗和は左を $100$ として右が $13$、つまり $87$% 減っています。この「平均予測からの改善率」が決定係数です。

薄々気づいた方もいるかと思いますが、データが直線的に並んでいるほど、つまり2 の相関係数 $r$ が高いほど、決定係数も大きくなる性質があります(誤解されやすいですが、直線の傾きの大きさは関係ありません。緩い傾きでも点がぴったり乗っていれば $R^2$ は高くなります)。実は単回帰の場合、決定係数は相関係数の2乗と一致します。上の例なら $R^2 = 0.16$ は $r \approx 0.40$、$R^2 = 0.87$ は $r \approx 0.93$ のデータです。なぜそうなるかは、式を見たあとで説明します。

決定係数が極端な例も見ていきましょう。

R² = 1 残差がゼロ 直線で予測すれば外さない R² = 0 回帰直線は水平(ȳ) ȳ 直線で予測しても平均と同じ 定義できない y が散らばっていない ȳ 説明すべき変動がそもそも無い
左は全点が直線に乗っていて残差がゼロ、平均予測の残差を 100% 減らせたので $R^2 = 1$ です。中央は点が雲のように散らばり、回帰直線は水平に $\bar{y}$ を通っています。つまり回帰直線の予測は平均予測とまったく同じで、残差は少しも減っていないので $R^2 = 0$ です。右は全点が水平線に乗っていますが、$y$ に散らばりがないので平均予測の時点で残差がゼロです。「そこからどれだけ減ったか」を測りようがなく、$R^2$ は定義できません($0 \div 0$ になります)。
決定係数
$$R^2 = 1 - \frac{\sum(y_i - \hat{y}_i)^2}{\sum(y_i - \bar{y})^2}\quad (0 \leq R^2 \leq 1)$$

$y_i$:$i$ 番目のデータの実測値(観測値) / $\hat{y}_i$:回帰直線による $i$ 番目の予測値 / $\bar{y}$:$y$ 全体の平均
($i$ は $1, 2, \dots, n$ と、データを1つ1つ区別するための番号)

決定係数 $R^2$ は「$y$ の全変動のうち、回帰モデルで説明できる割合」です。

相関係数との関係:単回帰では $R^2 = r^2$

さきほど予告した「決定係数は相関係数の2乗」の理由です。極端な3パターンで確かめると、$R^2 = 1$ の図は点が直線に乗っているので $r = 1$(右下がりなら $-1$)、$R^2 = 0$ の雲は $r = 0$ で、たしかに2乗の関係です。

偶然ではありません。単回帰では引ける直線は1本だけなので、$r$ も $R^2$ も同じ「その1本にどれだけ沿っているか」を測っています。違いは、$r$ が向きつきで $-1$〜$1$、$R^2$ が向きを捨てて $0$〜$1$ で表すことだけです。だから単回帰では必ず $R^2 = r^2$ になります。$r = 0.9$ なら $R^2 = 0.81$ で「$y$ の変動の 81% を $x$ で説明できる」と読みます。逆に $R^2$ から $r$ に戻すときは、符号を回帰直線の傾きから決めます。

※ この関係は説明変数が1つのときだけです。第10章の重回帰では、$R^2$ は個々の説明変数との相関係数の2乗とは一致しません。

残差分析:「そもそも直線で当てはめていいか?」を確認する

$R^2$ は「数値での説明力」を測る指標ですが、そもそもこのデータに直線モデルを当てはめていいのかは別問題です。それを目で確認するのが残差プロット(residual plot)です。

定義:残差プロット

横軸に $x$(または予測値 $\hat{y}$)、縦軸に残差($e_i = y_i - \hat{y}_i$、観測値から予測値を引いたもの)をとってプロットしたものです。
残差にパターンがなくランダムにばらついていれば、直線モデルは妥当です。

残差プロットの 4 パターン
① ランダム(パターンなし) ✅ 線形モデルでOK ② 曲線パターン ❌ 非線形性あり(変換を検討) ③ 漏斗状(不等分散) ❌ 分散が x に依存 ④ 周期的(時系列で頻出) ❌ 自己相関あり(独立性違反)
回帰モデルの4つの前提条件
  1. 線形性:$y$ と $x$ の関係が直線で表せる ← 残差が「曲線パターン」だと違反
  2. 独立性:残差どうしに相関がない ← 「周期的」だと違反(時系列で要注意)
  3. 等分散性:残差の分散が一定 ← 「漏斗状」だと違反
  4. 正規性:残差が正規分布に従う ← ヒストグラムや Q-Q プロットで確認

※ まずは「残差プロットを見るのが基本」と、上の4つの仮定を押さえてください。

曲がっていたら変換する:変数変換

ある会社の12年分の売上データがあります。知りたいのは「まだ来ていない13年目の売上はいくらか」です。手元のデータで回帰直線を作り、$x = 13$ を入れれば予想が出ます。ところがこのデータ、下の図のように点が上に曲がって伸びています。

246810120200400600800 年 売上(万円) 12年目:実測 705 に対し直線は 460
12年分の売上(青)と、そのまま引いた回帰直線(点線)です。点は右にいくほど急に上へ曲がり、直線は後半で点の下を通っています。

直線はこの曲がりを追えないので、12年目の時点ですでに予測(460万円)が実測(705万円)を大きく下回り、13年目の予想も同じように低めに外れます。残差プロットの曲線パターンは「この直線は端で外す」という警告でした。

曲線の式を使ってもよいのですが、最小二乗法の道具は直線用にできています。そこで、データの目盛りのほうを変えて、直線が当てはまる形に直します。これが変数変換です。売上のように「毎年○倍」で増えるデータなら、$y$ の対数をとると点が直線に乗ります。直線を1年ぶん延ばして、元の単位に戻せば、曲がりに沿った予想になります。

13年目の売上を予測する:そのまま vs 対数をとる

ボタンで切り替えて、直線の当てはまり(残差プロット)と、13年目の予測値(白抜きの点)がどう変わるかを見てください。

変換後に $R^2$ が上がるのは、直線が合うようになったことの現れで、それ自体が目的ではありません。目的はあくまで「外さない予測」です。変換後の傾きにも意味があり、対数なら「1年で何倍になるか」を表します。

どの変換を選ぶかは、データの増え方で決めます。

増え方変換直線になる理由
指数的に増える$y \to \log y$$y = a \cdot b^x$ の両辺の対数をとると $\log y = \log a + x \log b$ で、$x$ の1次式になる
伸びが鈍る$x \to \log x$ または $\sqrt{x}$横軸を圧縮して、伸びの鈍りを直線に伸ばす
反比例に近い$x \to 1/x$$y = a + b/x$ は $1/x$ に対して直線

※ 変換したモデルで予測した値は、元の単位に戻して使います($\log_{10} y$ で予測したら $10^{\text{予測値}}$)。試験では「対数をとると直線に近づく」と読み取れれば十分で、どの底の対数かは問題側で指定されます。

5

分割表とクロス集計

質的データ(カテゴリ)の2変数の関係を集計する

これまでは数値データの関係を見てきましたが、データはカテゴリ(質的データ)のこともあります。たとえば「血液型と性別」「喫煙習慣と肺疾患」などです。これらを2次元の表で集計したものが分割表(クロス集計表)です。

例:喫煙習慣と肺疾患の関係

ある調査で 300人を「喫煙習慣あり/なし」と「肺疾患あり/なし」で分類しました。

健康 肺疾患あり 合計
喫煙者 30 70 100
非喫煙者 180 20 200
合計 210 90 300

表の内側にある4つの数(30、70、180、20)を同時度数と呼びます。「喫煙者で、かつ健康」のように、2つの条件を同時に満たす人数です。右端と下端の合計(100、200、210、90)は周辺度数です。片方の変数だけで数えた人数で、表のふち(周辺)に並ぶのでこう呼びます。右下の 300 は全員の人数で、総度数と呼びます。

条件付き分布で「関連性」を見る

関連を直感的に掴むには、条件付き割合(行や列内での比率)を見るのが分かりやすいです。

喫煙者 100人のうち
70% 肺疾患
非喫煙者 200人のうち
10%

喫煙者の肺疾患率(70%)は非喫煙者(10%)の約7倍です。これだけ差があれば、関連がありそうだと感じます。ただしこれは見た目の判断で、「何倍以上なら関連あり」という決まりがあるわけではありません。関連の有無をきちんと判定するには、「もし関連がなかったら表はどうなるはずか」を基準にして、そこからのズレを測ります。次でその基準を作ります。

独立とは

「関連がない」、つまり「喫煙の有無」が「肺疾患の有無」にまったく影響しない状態を、統計では2つの変数が独立であると言います。独立なら、喫煙者でも非喫煙者でも肺疾患率は同じになるはずです。
全体の肺疾患率は $90/300 = 30\%$ なので、独立なら両グループとも30%程度になるはずです。

独立を仮定したときの期待度数
$$E_{ij} = \frac{(\text{行の合計}) \times (\text{列の合計})}{n}$$

例:喫煙×肺疾患の期待度数 $= \dfrac{100 \times 90}{300} = 30$
実測値 70 と期待値 30 の差が大きいほど、独立から離れている=関連が強い。

↓ 期待度数(独立を仮定した場合の予想値)
健康 肺疾患あり 合計
喫煙者 70.0 30.0 100
非喫煙者 140.0 60.0 200
合計 210 90 300
実測値と期待値の「ズレ」を カイ二乗統計量 で測り、関連の有意性を判定するのが「カイ二乗検定」です。詳しくは第9章で扱います。

2×2分割表ではオッズ比も使える

公式の前に、まずオッズ(odds)という数を知っておきましょう。オッズとは「起きた度数 ÷ 起きなかった度数」のことです。競馬のオッズと同じ語源で、「起きやすさ」を1つの数で表します。

まず「オッズ」を喫煙データで計算

喫煙者100人:肺疾患70人 ÷ 健康30人 → オッズ $= 70/30 \approx \mathbf{2.33}$(病気になる方が2.3倍多い)
非喫煙者200人:肺疾患20人 ÷ 健康180人 → オッズ $= 20/180 \approx \mathbf{0.11}$(病気にならない方が9倍多い)

この2つのオッズの比を取ったものがオッズ比です。「喫煙すると、肺疾患の起きやすさ(オッズ)が何倍になるか」を表します。

オッズ比(Odds Ratio)
$$\text{OR} = \frac{a/b}{c/d} = \frac{a \cdot d}{b \cdot c}\quad\text{(2×2分割表)}$$

$a, b, c, d$ は次のように 2×2 表の各セル(曝露=調べたい要因を持つこと。ここでは「喫煙」):

結果あり結果なし
曝露あり$a$$b$
曝露なし$c$$d$

OR=1 →関連なし / OR>1 → 曝露ありで結果が起きやすい / OR<1 → 曝露ありで結果が起きにくい

喫煙データのオッズ比

$a=70, b=30, c=20, d=180$ なので
$\text{OR} = \dfrac{70/30}{20/180} = \dfrac{2.33}{0.11} = \dfrac{70 \times 180}{30 \times 20} = $ 21.0
→「喫煙者は非喫煙者より、肺疾患の起きやすさ(オッズ)が約21倍」と解釈できます。
※ 「分数 ÷ 分数」を整理すると、たすき掛け $\frac{a\cdot d}{b\cdot c}$ になるだけです。公式の正体は「オッズの比」です。

クラメールの V:$2 \times 2$ より大きい表でも使える関連の強さ

オッズ比は$2 \times 2$ 表専用です。3行3列、4×5列などもっと大きな分割表でも「関連の強さ」を測りたいとき、よく使うのがクラメールのV (Cramér's V)です。「分割表版の相関係数」のような立ち位置です。

クラメールのVは、式の中に出てくる $\chi^2$(カイ二乗)ともども、第9章で正式に扱います。ここで式を覚える必要はありません。「0 から 1 の値をとり、1 に近いほど関連が強い」という雰囲気だけつかんでおけば十分です。

クラメールのV
$$V = \sqrt{\frac{\chi^2}{n \cdot \min(r-1,\ c-1)}}$$

・$\chi^2$:独立性検定のカイ二乗統計量(第9章で扱う)
・$n$:全データ数
・$r, c$:行数・列数
・$\min(r-1, c-1)$:行と列のうち少ない方マイナス1
・範囲:$0 \leq V \leq 1$

解釈の目安:
・$V \approx 0$:関連ほぼなし(独立に近い)
・$V \approx 0.1〜0.3$:弱い関連
・$V \approx 0.3〜0.5$:中程度の関連
・$V \geq 0.5$:強い関連
具体例:喫煙×肺疾患(先ほどの$2\times 2$表)

先ほどの表について、独立性検定のカイ二乗統計量は $\chi^2 \approx 114.3$ です(計算は第9章)。
$V = \sqrt{\dfrac{114.3}{300 \cdot \min(2-1, 2-1)}} = \sqrt{\dfrac{114.3}{300}} \approx $ 0.62
→ 強い関連あり(喫煙と肺疾患の関係が強い)と判定できます。

まとめ:オッズ比 vs クラメールのV
指標使える表範囲意味
オッズ比 (OR)$2 \times 2$ のみ$0 \sim \infty$方向と倍率(曝露の影響倍率)
クラメールのV任意の $r \times c$$0 \sim 1$関連の強さ(方向はわからない)
次のステップ →
第3章「推測のためのデータ収集法」へ進む
観察と実験・標本調査・フィッシャーの3原則