推測のためのデータ収集法
最終更新:
第1〜2章では、すでに手元にあるデータを要約しました。 でも現実での問いは「全国の有権者約1億人はどう考えているか」のように、 全部は測れない相手に向かいます。だから一部(標本)だけを取ってきて、 そこから全体(母集団)を推し量ることになります。
このとき重要なのが「どう取ってくるか」です。 取り方が偏っていれば、標本は母集団の縮図になりません。そして 偏った標本からは、どんなに高度な統計を使っても正しい結論は出ません。 第4章以降のすべての手法は「標本が正しく取れている」ことを前提にしています。
ある雑誌が 1,000万人にアンケート用紙を送り、回答が返ってきた 約240万人のデータをもとに、ランドン候補の圧勝を予測しました。
→ 実際はルーズベルトが圧勝し、大外れでした。
失敗の原因:アンケート送付先が「電話帳・自動車登録名簿」から作られていました。当時これらを持つのは富裕層中心(=ランドン支持層)で、貧困層(ルーズベルト支持層)は標本にほとんど入っていませんでした。
教訓:標本数を増やしても、偏った集め方では真実に近づけません(標本数 < 標本の代表性)。
偏った集め方
駅前で声をかけて100人に聞く
→ 平日昼に駅にいる人だけです。学生・高齢者に偏る
何人集めても偏りは消えない
無作為な集め方
名簿から乱数で100人を選ぶ
→ どの人も等しく選ばれる
誤差は残るが、計算できる誤差になる
母集団と標本
「全部」は調べられないから「一部」で推測する
統計でいちばん基本となる枠組み:
- 母集団 (Population):知りたい対象すべての集まり(例:全国の有権者)
- 標本 (Sample):母集団から抽出した一部(例:選ばれた1,000人)
- 標本サイズ $n$ :標本に含まれる個体の数
- 母数(パラメータ):母集団の平均 $\mu$、分散 $\sigma^2$ など。通常は未知
- 統計量:標本から計算する量(標本平均 $\bar{x}$、標本分散 $s^2$ など)。こちらは既知
全数調査 vs 標本調査
全数調査(悉皆調査)
母集団の全員を調べる方法です。
例:国勢調査(5年に1度、全世帯)
- ✅ 推測誤差なし(直接「真の値」が分かる)
- ❌ 莫大なコストと時間
- ❌ そもそも不可能なことが多い(例:日本人全員の血液検査)
標本調査
母集団の一部だけを調べ、母集団全体を「推測」する方法です。
例:世論調査、視聴率調査
- ✅ 安く・速く・どんな対象でも可能
- ⚠️ 標本誤差がある(標本の選び方次第で結果がブレる)
- ⚠️ 偏った標本だと結論が真実から外れる(→ 標本抽出法が重要)
母集団と「標本フレーム」のズレ
母集団(=本当に知りたい対象)と、実際にアクセスできる対象のリスト=標本フレーム(抽出枠)は必ずしも一致しません。両者にズレがあると、いくら無作為抽出しても結果は歪みます。
- 母集団=「日本人有権者」、標本フレーム=「選挙人名簿」「電話帳」「ネット会員リスト」など。両者は完全には一致しない。ズレは2方向に出る:
- 🟢 母集団のみ(カバレッジ漏れ):電話帳ベースの調査 → 固定電話を持たない若者が抜ける(知りたい人なのにフレームに載っていない)
- 🟢 母集団のみ(カバレッジ漏れ):ネットアンケート → ネット非利用者が抜ける
- 🔵 標本フレームのみ(フレーム過剰):電話帳には企業・店舗の番号も載る → 「個人有権者」でないものがフレームに混じる(フレームに載っているが母集団の対象ではない)
- 🔵 標本フレームのみ(フレーム過剰):ネット会員リストに外国籍・18歳未満の会員が含まれる → 有権者でない人がフレームに混じる
→ 章の冒頭の「1936年大統領選」も、標本フレーム(電話帳・自動車登録)が母集団(全有権者)と大きくズレていたために失敗した例。
観察研究 vs 実験研究
「因果関係」が言えるのは実験だけ
データの集め方には大きく2種類あり、どちらを選んだかで主張できる結論のレベルが変わります。
対象に手を加えず、そのまま観察してデータを集めます。
- 例:「タバコを吸う人と吸わない人の肺がん罹患率を比べる」
- 研究者は「誰が吸うか」を決めない(その人の選択)
- 主張できるのは「相関」まで
- 因果は交絡因子のせいかもしれない
研究者が条件を意図的に操作してデータを集めます。
- 例:「無作為に50人を新薬群、50人を偽薬群に分け、効果を比べる」
- 研究者が「誰がどの群か」を決める(無作為に)
- 主張できるのは「因果」まで
- 交絡因子も無作為化で打ち消せる
同じ問いでも、設計次第で結論の強さが変わる
1万人を10年追跡し、毎日コーヒーを飲む群と飲まない群で心臓病発症率を比較 → 飲む群の方が低い結果でした。
言えること:「コーヒーを飲む習慣と心臓病リスク低下に相関がある」
⚠️ 言えないこと:「コーヒーが心臓病を防ぐ」(運動・食生活など交絡因子が原因かも)
1万人を無作為に2群に分け、片方には毎日コーヒーを飲ませ、もう片方には飲ませません(10年間)。
言えること:「コーヒーは心臓病リスクを下げる(因果)」
※ 倫理的・現実的に長期間こんな実験はできないので、実際には観察研究と短期の実験を組み合わせます。
実験研究を「科学的」に成立させる3つの仕組み
「無作為に2群に分ける」だけでは実は不十分です。実験研究を信頼できる形で行うには、対照群・プラセボ・盲検法の3つを組み合わせる必要があります。
「新薬を飲ませた群が良くなった」だけでは、本当に薬のおかげか分かりません。同じ条件で薬を飲まない群(対照群)と比較してはじめて効果が見えます。
処理群(実験群):新薬を投与
対照群:何もしない or 偽薬(プラセボ)を投与
人は「薬を飲んだ」と思うだけで症状が良くなることがあります(プラセボ効果)。これは新薬でも偽薬でも同じように起こりえます。対照群にも見た目が同じ偽薬を渡すことで、心理効果の大きさを両群でそろえ、純粋な薬の効果だけを取り出せます。
※ 対照群を「無処置」ではなく「プラセボ」にする実験を プラセボ対照試験 と呼びます。
被験者・実験者の「期待」や「先入観」が結果を歪めないように、「誰がどの群か」を伏せる仕組みです。まず2人の登場人物を区別します。
期待効果(プラセボ効果)
「効く薬だ」と思うだけで気分が上向き、薬の力ではないのに「効いた」と感じてしまいます。
実験者バイアス
「この人は本物だから効くはず」と無意識に思い込み、症状の評価を甘くつけてしまいます。
- 被験者=痛みを抱える患者(薬を飲む)/実験者=薬を渡して痛みの強さを評価・記録する医師。
- 単盲検:患者は本物か偽薬か知らない(期待効果は防げる)。でも医師は知っている → 本物群の患者に「だいぶ和らぎましたよね?」と誘導的に聞き、痛みスコアを甘めにつける(実験者バイアスが残る)。
- 二重盲検:薬を「A・B」の記号で管理し、医師も患者もどちらが本物か分からない → 両方のバイアスを除去。集計が終わってから記号の正体を開封する。
二重盲検が最も信頼性が高いです。新薬の承認試験では原則として二重盲検が要求されます。
医療・社会科学の因果証拠としてのゴールドスタンダードです。
標本抽出の方法
母集団から「偏りなく」標本を選ぶ4つの方法
標本調査の「肝」は、母集団を正しく代表する標本を選ぶことです。代表的な抽出法は以下の4つです。
① 単純無作為抽出 (Simple Random Sampling)
母集団の全員に等しい確率で標本に選ばれるチャンスを与える方法です。
くじ引きや乱数表で選ぶイメージです。
② 層化抽出 (Stratified Sampling)
母集団を属性ごとの「層」に分け、各層から無作為に抽出します。
例:年齢層別、男女別に決まった人数ずつ。
③ クラスター抽出(集落抽出)
母集団を「集落」に分け、まず集落を無作為に選び、選ばれた集落の全員を調べます。
例:全国から30市町村を選び、その全住民に調査。
④ 系統抽出 (Systematic Sampling)
名簿を並べ、最初の1人だけを無作為に選び、あとは$k$ 人おきに選ぶ方法です。
例:名簿の3番目を起点に、5人おきに選ぶ(下図の k=5)。
上記4つはいずれも、名簿から乱数やルールに従って機械的に選ぶため、「この人が選ばれる確率はp」と数式で計算できます(=確率抽出)。これに対して、友達に頼む、街頭で声をかける、ネットアンケートに自発的に答えた人だけ集めるなど(=非確率抽出)は母集団を正しく代表しないことが多く、推測統計の枠組みではほぼ使えません。
復元抽出 vs 非復元抽出
抽出方法とは別に、「取り出した個体を戻すか・戻さないか」という選択もあります。
取り出した個体を母集団に戻し、もう一度抽出される可能性を残します。
- 同じ個体が複数回選ばれる可能性あり
- 各抽出が独立になる(確率計算が楽)
- 第5章の「二項分布」の前提
取り出した個体は戻しません。実際の標本調査は通常こちらです。
- 同じ個体は2度選ばれない
- 抽出ごとに確率が変わる(独立ではない)
- このときの「当たりの個数」は超幾何分布に従う(第5章で登場)
そのため実際の世論調査(数千人 ÷ 一億人)では「非復元なのに二項分布で近似できる」とする扱いが定番です。
多段抽出:抽出法を組み合わせて実用化する
大規模調査では、上の4方法を組み合わせて使うのが普通です。代表例が二段抽出です。
- 第1段:全国の市町村から、無作為に 200 市町村を抽出(クラスター抽出)
- 第2段:選ばれた各市町村の住民台帳から、無作為に 10 人を抽出(単純無作為抽出)
→ 全国約 1.2 億人から直接無作為抽出するのはコスト的に不可能です(全員の名簿がない)。市町村ごとに名簿を借りる方が現実的です。
フィッシャーの3原則
実験を「科学的」に設計するための3つの柱
1920年代に統計学者 R. A. フィッシャー が提唱した、実験計画の基本原則です。これを守ることで、データから因果関係を妥当に推測できるようになります。
具体例:肥料の効果を調べる
畑を区画に分け、新肥料 N と従来肥料 T のどちらを使うかを決めて、収穫量を比較します。
新肥料の区画を1つだけにすると、その区画にたまたま虫害があった可能性を排除できません。
→ 各処理に複数区画(例:N×5、T×5)を割り当てます。
北側に新肥料、南側に従来肥料… と並べると、日当たり・水はけなどの違いが処理と混じってしまいます。
→ どの区画に N と T を割り当てるかをくじ引きで決めます。
畑全体には日向ブロック・日陰ブロックのような大きな違いがあります。これを無視して全体無作為だと、たまたま N が日向に偏ったときに「N の効果」と誤判定します。
→ ブロック内で N と T を半々に無作為割り当てします(「乱塊法」)。
各ブロック内で N と T が同数になるように無作為割り当て
- 反復 → 「まぐれ」と「本当の効果」を見分けられるようにする
- 無作為化 → 「未知の交絡因子」をならして打ち消す
- 局所管理 → 「既知の交絡因子」をブロックで取り除く
参考:実験デザインの種類(用語だけ)
| デザイン名 | イメージ | 特徴 |
|---|---|---|
| 完全無作為化法 | 全実験単位の中で完全に無作為に処理を割り当てる(ブロックなし) | |
| 乱塊法 | ブロックを作り、各ブロック内で無作為化(フィッシャー3原則すべて使う) | |
| ラテン方格法 | 行・列の2方向のブロック化を同時に行う方法(畑の縦横の違いを両方処理) | |
| 二元配置 | 2つの要因(例:肥料 × 品種)の主効果と交互作用を同時に評価 |
A・B・C=処理の種類(例:肥料の3水準)。乱塊法は各ブロック(行)に A・B・C が1つずつ、ラテン方格法はさらに各列にも1つずつ入ります。
※ 統計検定2級では、これらの「名前と特徴」を選択肢から選べる程度の理解で十分です。
誤差とバイアス(データ収集の落とし穴)
標本を増やせば消えるズレ、増やしても消えないズレ
標本調査の結果は、真の値(母集団の値)と必ず少しズレます。このズレを誤差と呼び、原因によって2種類に分かれます。
標本誤差と非標本誤差
標本誤差 (Sampling error)
「全体ではなく一部だけ調べた」ことによる避けられない誤差です。
標本サイズ $n$ を大きくすれば小さくなります(理論的には $1/\sqrt{n}$ で減少)。
⚠️ 非標本誤差 (Non-sampling error)
調査の設計や実施の問題から生じる誤差です(質問が誘導的、回答拒否、入力ミスなど)。
標本数を増やしても減りません。これが致命的です。
非標本誤差の中身:バイアスとランダムなミス
非標本誤差はさらに2つに分けられます。ズレの方向が毎回同じなのがバイアス(偏り)、方向がバラバラなのが単純なミスです。全体像はこうなります。
→ $n$ を増やせば減る
例:誘導質問、偏ったフレーム
例:入力ミス、聞き間違い
代表的なバイアス
バイアス(偏り)とは、標本の値が真の値(母平均)からいつも同じ方向にズレることです。的当てでいえば、そもそも狙い自体がズレていて、同じ方向にばかり外れる状態です(標本誤差は「矢の散らばり方」)。同じ方向のズレはいくら平均しても打ち消し合わないので、標本サイズを大きくしても消えません。代表的なバイアスを押さえておきましょう。
「重要な社会保障の X 政策について賛成ですか?」→ 賛成が増えます。
第二次大戦中、軍は帰還した爆撃機の弾痕を調べ、「弾痕の多い翼や胴体を補強しよう」と考えました。それに対し統計学者ウォールドは逆の提案をします。「補強すべきは弾痕のない場所(エンジン)だ」というものです。
手元のデータ(帰還機)は「生き残り」だけです。弾痕がある場所は「撃たれても生還できる場所」であり、本当に危険な場所はデータから消えた機体が知っています。「見えているデータ」だけで判断してはいけない、という教訓です。