第3章 / STEP 2

推測のためのデータ収集法

「正しい結論」を得るための、データの集め方
母集団と標本 観察 vs 実験 無作為抽出 層化抽出 フィッシャーの3原則 バイアス

最終更新:

なぜ「データの集め方」を学ぶのか

第1〜2章では、すでに手元にあるデータを要約しました。 でも現実での問いは「全国の有権者約1億人はどう考えているか」のように、 全部は測れない相手に向かいます。だから一部(標本)だけを取ってきて、 そこから全体(母集団)を推し量ることになります。

このとき重要なのが「どう取ってくるか」です。 取り方が偏っていれば、標本は母集団の縮図になりません。そして 偏った標本からは、どんなに高度な統計を使っても正しい結論は出ません。 第4章以降のすべての手法は「標本が正しく取れている」ことを前提にしています。

歴史的失敗例:1936年米大統領選

ある雑誌が 1,000万人にアンケート用紙を送り、回答が返ってきた 約240万人のデータをもとに、ランドン候補の圧勝を予測しました。
→ 実際はルーズベルトが圧勝し、大外れでした。

失敗の原因:アンケート送付先が「電話帳・自動車登録名簿」から作られていました。当時これらを持つのは富裕層中心(=ランドン支持層)で、貧困層(ルーズベルト支持層)は標本にほとんど入っていませんでした。

教訓:標本数を増やしても、偏った集め方では真実に近づけません(標本数 < 標本の代表性)。

偏った集め方

駅前で声をかけて100人に聞く
→ 平日昼に駅にいる人だけです。学生・高齢者に偏る
何人集めても偏りは消えない

無作為な集め方

名簿から乱数で100人を選ぶ
→ どの人も等しく選ばれる
誤差は残るが、計算できる誤差になる

1

母集団と標本

「全部」は調べられないから「一部」で推測する

統計でいちばん基本となる枠組み:

調べたい対象すべて
母集団 (Population)
例:日本人の成人 約1億人
無作為抽出
(一部だけ選ぶ)
実際に観測した一部
標本 (Sample)
例:抽出した 1,000 人
用語:母集団と標本
  • 母集団 (Population):知りたい対象すべての集まり(例:全国の有権者)
  • 標本 (Sample):母集団から抽出した一部(例:選ばれた1,000人)
  • 標本サイズ $n$ :標本に含まれる個体の数
  • 母数(パラメータ):母集団の平均 $\mu$、分散 $\sigma^2$ など。通常は未知
  • 統計量:標本から計算する量(標本平均 $\bar{x}$、標本分散 $s^2$ など)。こちらは既知

全数調査 vs 標本調査

全数調査(悉皆調査)

母集団の全員を調べる方法です。
例:国勢調査(5年に1度、全世帯)

  • ✅ 推測誤差なし(直接「真の値」が分かる)
  • ❌ 莫大なコストと時間
  • ❌ そもそも不可能なことが多い(例:日本人全員の血液検査)

標本調査

母集団の一部だけを調べ、母集団全体を「推測」する方法です。
例:世論調査、視聴率調査

  • ✅ 安く・速く・どんな対象でも可能
  • ⚠️ 標本誤差がある(標本の選び方次第で結果がブレる)
  • ⚠️ 偏った標本だと結論が真実から外れる(→ 標本抽出法が重要)
統計検定2級で扱うのは主に標本調査です。標本から母集団を推測する「推測統計」が以降の章の主役になります。

母集団と「標本フレーム」のズレ

母集団(=本当に知りたい対象)と、実際にアクセスできる対象のリスト=標本フレーム(抽出枠)は必ずしも一致しません。両者にズレがあると、いくら無作為抽出しても結果は歪みます。

母集団 vs 標本フレーム のズレ
母集団 (本当に知りたい対象) 標本フレーム (実際の対象リスト) 両方に含まれる = 抽出可能 & 知りたい対象 ⚠ アクセス不能 (カバレッジ漏れ) ⚠ 含めるべきでない (フレーム過剰)
具体例
  • 母集団=「日本人有権者」、標本フレーム=「選挙人名簿」「電話帳」「ネット会員リスト」など。両者は完全には一致しない。ズレは2方向に出る:
  • 🟢 母集団のみ(カバレッジ漏れ):電話帳ベースの調査 → 固定電話を持たない若者が抜ける(知りたい人なのにフレームに載っていない)
  • 🟢 母集団のみ(カバレッジ漏れ):ネットアンケート → ネット非利用者が抜ける
  • 🔵 標本フレームのみ(フレーム過剰):電話帳には企業・店舗の番号も載る → 「個人有権者」でないものがフレームに混じる(フレームに載っているが母集団の対象ではない)
  • 🔵 標本フレームのみ(フレーム過剰):ネット会員リストに外国籍・18歳未満の会員が含まれる → 有権者でない人がフレームに混じる

→ 章の冒頭の「1936年大統領選」も、標本フレーム(電話帳・自動車登録)が母集団(全有権者)と大きくズレていたために失敗した例。

2

観察研究 vs 実験研究

「因果関係」が言えるのは実験だけ

データの集め方には大きく2種類あり、どちらを選んだかで主張できる結論のレベルが変わります。

観察研究 (Observational study)

対象に手を加えず、そのまま観察してデータを集めます。

  • 例:「タバコを吸う人と吸わない人の肺がん罹患率を比べる」
  • 研究者は「誰が吸うか」を決めない(その人の選択)
  • 主張できるのは「相関」まで
  • 因果は交絡因子のせいかもしれない
実験研究 (Experimental study)

研究者が条件を意図的に操作してデータを集めます。

  • 例:「無作為に50人を新薬群、50人を偽薬群に分け、効果を比べる」
  • 研究者が「誰がどの群か」を決める(無作為に)
  • 主張できるのは「因果」まで
  • 交絡因子も無作為化で打ち消せる

同じ問いでも、設計次第で結論の強さが変わる

「コーヒーは心臓に良いか?」
観察研究の場合

1万人を10年追跡し、毎日コーヒーを飲む群と飲まない群で心臓病発症率を比較 → 飲む群の方が低い結果でした。
言えること:「コーヒーを飲む習慣と心臓病リスク低下に相関がある」
⚠️ 言えないこと:「コーヒーが心臓病を防ぐ」(運動・食生活など交絡因子が原因かも)

実験研究の場合

1万人を無作為に2群に分け、片方には毎日コーヒーを飲ませ、もう片方には飲ませません(10年間)。
言えること:「コーヒーは心臓病リスクを下げる(因果)」
※ 倫理的・現実的に長期間こんな実験はできないので、実際には観察研究と短期の実験を組み合わせます。

実験研究を「科学的」に成立させる3つの仕組み

「無作為に2群に分ける」だけでは実は不十分です。実験研究を信頼できる形で行うには、対照群・プラセボ・盲検法の3つを組み合わせる必要があります。

① 対照群(コントロール群):比較対象がないと効果は測れない

「新薬を飲ませた群が良くなった」だけでは、本当に薬のおかげか分かりません。同じ条件で薬を飲まない群(対照群)と比較してはじめて効果が見えます。
処理群(実験群):新薬を投与
対照群:何もしない or 偽薬(プラセボ)を投与

② プラセボ(偽薬):心理効果を差し引く

人は「薬を飲んだ」と思うだけで症状が良くなることがあります(プラセボ効果)。これは新薬でも偽薬でも同じように起こりえます。対照群にも見た目が同じ偽薬を渡すことで、心理効果の大きさを両群でそろえ、純粋な薬の効果だけを取り出せます。

※ 対照群を「無処置」ではなく「プラセボ」にする実験を プラセボ対照試験 と呼びます。

③ 盲検法(ブラインド):期待効果・実験者バイアスを排除

被験者・実験者の「期待」や「先入観」が結果を歪めないように、「誰がどの群か」を伏せる仕組みです。まず2人の登場人物を区別します。

被験者 = 実験を「受ける」人
薬を飲む・処理を受ける側です。=患者。
本物だと知ると…
期待効果(プラセボ効果)
「効く薬だ」と思うだけで気分が上向き、薬の力ではないのに「効いた」と感じてしまいます。
実験者 = 実験を「行う」人
薬を渡し、結果を診断・記録する側です。=医師・研究者。
誰が本物か知ると…
実験者バイアス
「この人は本物だから効くはず」と無意識に思い込み、症状の評価を甘くつけてしまいます。
具体例:新しい鎮痛剤の試験
  • 被験者=痛みを抱える患者(薬を飲む)/実験者=薬を渡して痛みの強さを評価・記録する医師。
  • 単盲検:患者は本物か偽薬か知らない(期待効果は防げる)。でも医師は知っている → 本物群の患者に「だいぶ和らぎましたよね?」と誘導的に聞き、痛みスコアを甘めにつける(実験者バイアスが残る)。
  • 二重盲検:薬を「A・B」の記号で管理し、医師も患者もどちらが本物か分からない → 両方のバイアスを除去。集計が終わってから記号の正体を開封する。

二重盲検が最も信頼性が高いです。新薬の承認試験では原則として二重盲検が要求されます。

⭐
RCT(ランダム化比較試験):対象を無作為に処理群と対照群へ分けて比べる実験デザインです。条件は「無作為化」と「対照群」の2つで、プラセボや盲検化は必須ではありません。医療では、ここにプラセボと二重盲検を組み合わせた形がもっとも信頼されます。
医療・社会科学の因果証拠としてのゴールドスタンダードです。
3

標本抽出の方法

母集団から「偏りなく」標本を選ぶ4つの方法

標本調査の「肝」は、母集団を正しく代表する標本を選ぶことです。代表的な抽出法は以下の4つです。

① 単純無作為抽出 (Simple Random Sampling)

母集団の全員に等しい確率で標本に選ばれるチャンスを与える方法です。
くじ引きや乱数表で選ぶイメージです。

母集団
✅ 最も理論的に綺麗(推測の基礎)
❌ 母集団名簿が必要・実施コストが高い

② 層化抽出 (Stratified Sampling)

母集団を属性ごとの「層」に分け、各層から無作為に抽出します。
例:年齢層別、男女別に決まった人数ずつ。

層A(若者) 層B(中年) 層C(高齢)
✅ 母集団の層構成(例:男女比 6:4)を標本にも正確に反映できる(特定の層が過大/過小に出ない)
❌ 層を分ける属性(年齢・性別など)が事前に分かっていないと使えない

③ クラスター抽出(集落抽出)

母集団を「集落」に分け、まず集落を無作為に選び、選ばれた集落の全員を調べます。
例:全国から30市町村を選び、その全住民に調査。

クラスター(市町村など)の集まり 緑:選ばれた集落(全員調査)
✅ コストが安い(場所を絞れる)
❌ 集落内の人が似通っていると誤差が大きい

④ 系統抽出 (Systematic Sampling)

名簿を並べ、最初の1人だけを無作為に選び、あとは$k$ 人おきに選ぶ方法です。
例:名簿の3番目を起点に、5人おきに選ぶ(下図の k=5)。

名簿順に並んだ母集団 3 8 13 18 23 k=5(5人おきに選ぶ)
✅ 実施が簡単
❌ 名簿に周期性があると偏る(例:男女が交互だと片方しか選ばれない)
⚠️ 避けるべき:非確率抽出

上記4つはいずれも、名簿から乱数やルールに従って機械的に選ぶため、「この人が選ばれる確率はp」と数式で計算できます(=確率抽出)。これに対して、友達に頼む、街頭で声をかける、ネットアンケートに自発的に答えた人だけ集めるなど(=非確率抽出)は母集団を正しく代表しないことが多く、推測統計の枠組みではほぼ使えません。

復元抽出 vs 非復元抽出

抽出方法とは別に、「取り出した個体を戻すか・戻さないか」という選択もあります。

復元抽出(With Replacement)

取り出した個体を母集団に戻し、もう一度抽出される可能性を残します。

  • 同じ個体が複数回選ばれる可能性あり
  • 各抽出が独立になる(確率計算が楽)
  • 第5章の「二項分布」の前提
非復元抽出(Without Replacement)

取り出した個体は戻しません。実際の標本調査は通常こちらです。

  • 同じ個体は2度選ばれない
  • 抽出ごとに確率が変わる(独立ではない)
  • このときの「当たりの個数」は超幾何分布に従う(第5章で登場)
箱と玉のイメージ
復元抽出 取り出す 戻す(また選ばれうる) 非復元抽出 取り出す 戻さない
母集団 $N$ が標本サイズ $n$ よりずっと大きい(例:$n/N < 5\%$)とき、復元・非復元の確率はほぼ同じになります。
そのため実際の世論調査(数千人 ÷ 一億人)では「非復元なのに二項分布で近似できる」とする扱いが定番です。

多段抽出:抽出法を組み合わせて実用化する

大規模調査では、上の4方法を組み合わせて使うのが普通です。代表例が二段抽出です。

具体例:全国世論調査(二段抽出の典型)
  1. 第1段:全国の市町村から、無作為に 200 市町村を抽出(クラスター抽出)
  2. 第2段:選ばれた各市町村の住民台帳から、無作為に 10 人を抽出(単純無作為抽出)

→ 全国約 1.2 億人から直接無作為抽出するのはコスト的に不可能です(全員の名簿がない)。市町村ごとに名簿を借りる方が現実的です。

4

フィッシャーの3原則

実験を「科学的」に設計するための3つの柱

1920年代に統計学者 R. A. フィッシャー が提唱した、実験計画の基本原則です。これを守ることで、データから因果関係を妥当に推測できるようになります。

1
反復 (Replication)
同じ処理を複数回実施することで、偶然のばらつきを評価できるようにします。
2
無作為化 (Randomization)
処理の割り当てをくじ引きで決めます。これで交絡因子の影響が平均的に打ち消されます。
3
局所管理 (Local control)
条件が似たもの同士をブロックにまとめ、その中で処理を割り当てます。背景のばらつきを取り除きます。

具体例:肥料の効果を調べる

農地で新肥料の効果を検証したい

畑を区画に分け、新肥料 N と従来肥料 T のどちらを使うかを決めて、収穫量を比較します。

① 反復

新肥料の区画を1つだけにすると、その区画にたまたま虫害があった可能性を排除できません。
→ 各処理に複数区画(例:N×5、T×5)を割り当てます。

② 無作為化

北側に新肥料、南側に従来肥料… と並べると、日当たり・水はけなどの違いが処理と混じってしまいます。
→ どの区画に N と T を割り当てるかをくじ引きで決めます。

❌ 並べる(NG)
N N N N T T T T ← 日陰 ← 日向
✅ 無作為(OK)
T N N T N N T T ← 日陰 ← 日向
③ 局所管理(ブロック化)

畑全体には日向ブロック・日陰ブロックのような大きな違いがあります。これを無視して全体無作為だと、たまたま N が日向に偏ったときに「N の効果」と誤判定します。
→ ブロック内で N と T を半々に無作為割り当てします(「乱塊法」)。

ブロック1(日向) N T T T N N ブロック2(日陰) T N N N T T

各ブロック内で N と T が同数になるように無作為割り当て

まとめ:3原則の役割
  • 反復 → 「まぐれ」と「本当の効果」を見分けられるようにする
  • 無作為化 → 「未知の交絡因子」をならして打ち消す
  • 局所管理 → 「既知の交絡因子」をブロックで取り除く

参考:実験デザインの種類(用語だけ)

デザイン名イメージ特徴
完全無作為化法AACBCBCAB全実験単位の中で完全に無作為に処理を割り当てる(ブロックなし)
乱塊法ブロック1ブロック2ブロック3BACCBAABCブロックを作り、各ブロック内で無作為化(フィッシャー3原則すべて使う)
ラテン方格法行1行2行3列1列2列3ABCBCACAB行・列の2方向のブロック化を同時に行う方法(畑の縦横の違いを両方処理)
二元配置品種X品種Y肥料N肥料TN×XN×YT×XT×Y2つの要因(例:肥料 × 品種)の主効果と交互作用を同時に評価

A・B・C=処理の種類(例:肥料の3水準)。乱塊法は各ブロック(行)に A・B・C が1つずつ、ラテン方格法はさらに各列にも1つずつ入ります。

※ 統計検定2級では、これらの「名前と特徴」を選択肢から選べる程度の理解で十分です。

5

誤差とバイアス(データ収集の落とし穴)

標本を増やせば消えるズレ、増やしても消えないズレ

標本調査の結果は、真の値(母集団の値)と必ず少しズレます。このズレを誤差と呼び、原因によって2種類に分かれます。

標本誤差と非標本誤差

標本誤差 (Sampling error)

「全体ではなく一部だけ調べた」ことによる避けられない誤差です。
標本サイズ $n$ を大きくすれば小さくなります(理論的には $1/\sqrt{n}$ で減少)。

⚠️ 非標本誤差 (Non-sampling error)

調査の設計や実施の問題から生じる誤差です(質問が誘導的、回答拒否、入力ミスなど)。
標本数を増やしても減りません。これが致命的です。

冒頭の「1936年大統領選」の失敗は、標本誤差ではなく非標本誤差(標本フレームの偏り)が原因です。240万人 という巨大な標本でも、偏った集め方では救えませんでした。

非標本誤差の中身:バイアスとランダムなミス

非標本誤差はさらに2つに分けられます。ズレの方向が毎回同じなのがバイアス(偏り)、方向がバラバラなのが単純なミスです。全体像はこうなります。

調査の誤差(真の値とのズレ)の全体像
標本誤差
一部だけ調べたことによる偶然のブレです。
→ $n$ を増やせば減る
⚠️ 非標本誤差
設計・実施の問題から生じます。→ $n$ を増やしても減らない
バイアス(偏り)= 本節の主役
いつも同じ方向にズレる
例:誘導質問、偏ったフレーム
狙い(+)から同じ方向に外れる
ランダムなミス
方向がバラバラのズレ
例:入力ミス、聞き間違い
狙いの周りにバラバラに外れる

代表的なバイアス

バイアス(偏り)とは、標本の値が真の値(母平均)からいつも同じ方向にズレることです。的当てでいえば、そもそも狙い自体がズレていて、同じ方向にばかり外れる状態です(標本誤差は「矢の散らばり方」)。同じ方向のズレはいくら平均しても打ち消し合わないので、標本サイズを大きくしても消えません。代表的なバイアスを押さえておきましょう。

① 選択バイアス(Selection bias)
標本が母集団を代表していないために生じるズレです。最も典型的で危険です。
例:「ネットアンケート」だけで世論を測ると、ネットを使わない高齢者層が抜け落ちます。
② 自己選択バイアス(Self-selection bias)
回答するかどうかを本人が決めるために生じるズレです。意見の強い人だけが答える傾向です。
例:レビューサイト。極端に満足/不満な人だけが書き込む → 中庸な意見が埋もれます。
③ 無回答バイアス(Non-response bias)
調査依頼をしても、回答しない人が一定数います。その人たちの意見が反映されません。
例:忙しい人ほど回答しない → 暇な人の意見が過大評価されます。
④ 回答バイアス(Response bias)
回答者が本音を答えないことから生じるズレです。社会的に望ましい方向に答える傾向です。
例:「タバコは1日何本?」と聞かれて少なめに答える、収入を多めに申告するなどです。
⑤ 質問バイアス(Question wording bias)
質問の聞き方そのものが答えを誘導するパターンです。
例:「税金の無駄遣いの多い X 政策について賛成ですか?」→ 不賛成が増えます。
「重要な社会保障の X 政策について賛成ですか?」→ 賛成が増えます。
⑥ 生存者バイアス(Survivorship bias)
「生き残った」サンプルだけを集めてしまい、消えたサンプルが見えないために生じるズレです。
例:成功した起業家の習慣を調べて「成功の秘訣」を導く → 同じ習慣で失敗した人は調査対象外なので、その習慣が本当に役立つかは分かりません。
生存者バイアスの有名な話:戦闘機の弾痕

第二次大戦中、軍は帰還した爆撃機の弾痕を調べ、「弾痕の多い翼や胴体を補強しよう」と考えました。それに対し統計学者ウォールドは逆の提案をします。「補強すべきは弾痕のない場所(エンジン)だ」というものです。

🔴 弾痕 = 撃たれても帰還できた場所 🟡 エンジン:弾痕なし = ここを撃たれた機は 帰還できず、データに無い

手元のデータ(帰還機)は「生き残り」だけです。弾痕がある場所は「撃たれても生還できる場所」であり、本当に危険な場所はデータから消えた機体が知っています。「見えているデータ」だけで判断してはいけない、という教訓です。

バイアスの対策:無作為抽出、回答率を上げる工夫、二重盲検(実験者・被験者ともに処理を知らない)、質問文の中立化、母集団フレームの吟味です。設計段階で潰すしかありません。分析の段階で「あとから補正」は基本できません。
次のステップ →
第4章「確率」へ進む
条件付き確率・ベイズの定理