第1章 / STEP 1

1変数データ

データの「真ん中」と「バラつき」を数値と図解で捉える
尺度の種類 ヒストグラム 平均・中央値 分散・標準偏差 偏差値 時系列

最終更新:

なぜ「データの要約」から始めるのか

統計検定2級のゴールは、一部のデータ(標本)から全体(母集団)を推測することです(第7〜8章)。 でもその前に、手元にあるデータを正しく「見る」技術がなければ何も始まりません。 100人分の数字をそのまま並べて渡されて、眺めて分かることはほとんどないからです。

この章がやるのは、並んだ数字を「たった数個の値」に圧縮することです。 どこが真ん中で(中心)、どれくらい散らばっていて(広がり)、どんな形をしているか(形)の3つが分かれば、100個の数字は「だいたいこういうデータだ」と一言で言えるようになります。

要約する前

72, 58, 91, 65, 80, …(100個)
見ても何も分からない
他のデータと比べようがない

要約したあと

平均73点・標準偏差12点・やや右に裾が長い
3つの数字で全体像がつかめる
別のクラスとも比較できる

1

データの種類と尺度

「どんな数値か」によって、使える統計操作が変わる

データを集めたとき、まず考えなければならないのが「このデータは何尺度か?」という問いです。尺度によって「平均を取っていいか」「順序に意味があるか」が決まります。

名義尺度
分類するだけ。順序も大小もない。
例: 血液型(A/B/O/AB)・都道府県・性別・野球チームの背番号
背番号10番は9番より「大きい」わけではありません。あくまで識別のための記号です。
✓ 度数・最頻値 ✗ 平均 ✗ 大小比較
順序尺度
順序に意味がある。でも間隔は均等でない。
例: 満足度(とても満足 / 満足 / 普通 / 不満)・成績ランク(A/B/C)・辛さレベル
「とても満足」と「満足」の差 =「満足」と「普通」の差、とは言えません。
✓ 順位・中央値 ✓ パーセンタイル ✗ 平均(本来は不可)
間隔尺度
間隔が均等。ただし絶対的なゼロがない。
例: 気温(℃)・西暦年・IQスコア
「20℃は10℃の2倍暑い」とは言えません(0℃は「熱さのゼロ」ではない)。でも「20℃は10℃より10度高い」はOKです。
✓ 平均・標準偏差 ✓ 差の比較 ✗ 比率の比較
比例尺度
絶対的なゼロがある。すべての演算が可能。
例: 身長・体重・年収・距離・時間・反応時間(ms)
「180cmは90cmの2倍」「年収600万円は300万円の2倍」と言えます。0は「量が何もない」を意味します。
✓ すべての統計量 ✓ 比率の比較 ✓ 変動係数

尺度は名義 → 順序 → 間隔 → 比例の順に「できること」が増えていきます。比例尺度のデータには名義尺度の操作(分類・度数)もそのまま使えます。

2

分布を「見る」

以下のデータはクラス30人の数学テストの点数です。パッと見て分かることはありますか?

42, 55, 58, 62, 65, 65, 67, 68, 70, 71,
72, 73, 74, 75, 76, 77, 78, 79, 80, 81,
82, 85, 85, 87, 89, 91, 93, 95, 97, 100

数字の羅列だと、全体の傾向は全くつかめません。

度数分布表にしてみる

まず「何点台が何人いるか」をまとめます。

階級(点)度数(人)相対度数累積相対度数
40〜50未満10.0330.033
50〜60未満20.0670.100
60〜70未満50.1670.267
70〜80未満100.3330.600
80〜90未満70.2330.833
90〜100以下50.1671.000
合計301.000—

※ 相対度数 = 度数 ÷ 全体(30) 累積相対度数 = その階級までの相対度数の合計

ヒストグラムにすると一目瞭然

階級幅を変えると、見え方がどう変わるか試してみましょう。

ヒストグラム(ビン幅を変えてみる)
10点

ヒストグラム以外の見せ方:幹葉図・累積度数グラフ・円グラフ

同じデータでも、知りたいことによって向いているグラフが変わります。ヒストグラム以外に3つ、試験で名前が出るものを同じ30人の点数で見ておきます。

幹葉図 幹 葉(一の位) 42 55 8 62 5 5 7 8 70 1 2 3 4 5 6 7 8 9 80 1 2 5 5 7 9 91 3 5 7 100 累積相対度数グラフ 4060801000%50%100% 70点未満は 26.7% 点数 円グラフ(血液型) A型 40%O型 30%B型 20%AB型 10%
左の幹葉図は、十の位を「幹」、一の位を「葉」にして数字をそのまま並べたものです。横に倒すとヒストグラムと同じ形になり、しかも元の値(42点、55点…)が消えません。中央の累積相対度数グラフは、度数分布表の右端の列を折れ線にしたもので、「70点未満の人は全体の 26.7%」のように「ある値以下の割合」が一目で読めます。右の円グラフは、質的データ(血液型など)の割合を見るときに使います。

目安として、元の値を残したまま形を見たいなら幹葉図、「何点以下が何%か」を読みたいなら累積度数グラフ、カテゴリごとの割合なら円グラフ、それ以外の量的データの形はヒストグラム、と使い分けます。

分布の「形」3パターン:曲線で見る

データを多く集めて細かく描くと、ヒストグラムは滑らかな曲線の形に近づきます。この曲線が「分布の形」です。代表的な3パターンを見ましょう。
※ カード内の「歪度(わいど)」は形を数値で表す指標です。6 で定義するので、ここでは形のイメージだけつかめばOKです。

① 左右対称(正規型)
平均=中央値=最頻値
歪度 = 0 釣鐘型 正規分布
平均 = 中央値 = 最頻値
例:身長・体重・標準的なテスト点数
② 右に裾が長い(正の歪み)
最頻値 中央値 平均 長い裾 →
歪度 > 0 右に裾が長い 右に歪んだ 左に偏った
最頻値 < 中央値 < 平均
→ 右側の少数の大きな値が平均を引き上げる
例:年収・資産・住宅価格・反応時間
③ 左に裾が長い(負の歪み)
平均 中央値 最頻値 ← 長い裾
歪度 < 0 左に裾が長い 左に歪んだ 右に偏った
平均 < 中央値 < 最頻値
→ 左側の少数の小さな値が平均を引き下げる
例:満点近いテスト・寿命(先進国)
歪み(ゆがみ)の覚え方

左に山があるのに「右に歪んだ」と呼ぶのは、直感に反します。右側には何もないので。
そこで、その何もない側に歪みのかたまりであるブラックホールがあると考えてみてください。

右に歪んだ分布
左に歪んだ分布

ブラックホールが時空を歪めて、分布が逆側に寄って伸びているとイメージすると覚えやすいです。

山の数で分けることもあります。山が1つなら単峰、2つ以上なら多峰(2つなら双峰)と呼びます。多峰は「性質の違う集団が混ざっているサイン」で、たとえば男女混合の身長は、女性の山と男性の山が重なって双峰になります。山がなく平らな形は一様です。

単峰 山が1つ(上の3パターンはすべて単峰) 多峰(双峰) 女性男性 例:男女混合の身長 一様 例:サイコロの目、乱数
ヒストグラムに山が2つ見えたら、平均や標準偏差を出す前に「2つの集団が混ざっていないか」を疑います。混ざったまま平均を出しても、どちらの集団も代表しない値になります。
3

中心(代表値)

データの「真ん中」を1つの数で表す

まとめ:分布を要約する3つの観点

前の節では分布を図で「眺め」ました。ここから先は分布を 3つの軸で数値化 していきます:

  1. 中心:分布の真ん中はどこか → 今ここ(3)
  2. 広がり:分布の散らばり具合 → 4
  3. 形:対称か歪んでいるか/とがっているか平坦か → 6

※ 間に挟まる 5(標準化)は、「形」を数値にするための道具(zスコア)を準備するステップです。

代表値とは、たくさんのデータを1つの数値で要約するものです。

平均値(算術平均)

公式
$$\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i = \frac{x_1 + x_2 + \cdots + x_n}{n}$$
平均はシーソーの「釣り合いポイント」
データを重りだと思うと、平均値の位置にシーソーの支点を置けばちょうど釣り合います。

中央値(メジアン)

データを小さい順に並べたとき、ちょうど真ん中の値です。

小さい順に並べて、真ん中の人を探す

  • データ数 $n$ が奇数:ちょうど $\frac{n+1}{2}$ 番目の値
  • データ数 $n$ が偶数:$\frac{n}{2}$ 番目と $\frac{n}{2}+1$ 番目の平均
平均は「値の大きさ」で、中央値は「順位」で決まる
真ん中の人さえ分かれば、両端の人が何点でも中央値は同じです。だから外れ値に引っ張られません(このあと確認します)。

最頻値(モード)

データの中で最も頻繁に出てくる値です。数値データより、カテゴリデータ(血液型、趣味など)でよく使います。

様々な平均:目的別バリエーション

「平均」と聞いたら算術平均を思い浮かべますが、扱う量の性質によって使い分けるべき平均が3種類あります。

① 加重平均(Weighted Mean):重要度が違うデータを平均する

公式
$$\bar{x}_w = \frac{\sum w_i x_i}{\sum w_i}$$

各データ $x_i$ に重み $w_i$ を掛けて合計し、重みの合計で割ります。重みが全部1なら通常の算術平均と一致します。

具体例:単位数の違う科目の GPA

数学(4単位)80点、英語(3単位)70点、体育(1単位)60点です。
算術平均:$(80+70+60)/3 = 70$ 点
加重平均(単位数を重みに):$\dfrac{4 \cdot 80 + 3 \cdot 70 + 1 \cdot 60}{4+3+1} = \dfrac{590}{8} = $ 73.75 点
→ 重い科目(単位数の多い数学)の点数がより強く反映されます。

② 幾何平均(Geometric Mean):成長率や倍率を平均する

公式
$$\bar{x}_G = \sqrt[n]{x_1 \cdot x_2 \cdots x_n}$$

幾何平均は「掛けて $n$ 乗根」です。成長率(×1.10, ×1.20, ×0.90 など)のような掛け算で積み上がる量に使います。

具体例:3年間の売上成長率の平均

1年目 +30%(×1.30)、2年目 +20%(×1.20)、3年目 −10% です(×0.90)。
3年で売上は $1.30 \times 1.20 \times 0.90 = 1.404$ 倍になります。では、1年あたり何倍でしょうか?
算術平均:$(30 + 20 - 10)/3 = +13.3\%$ → これだと「毎年13.3%ずつ成長」になり $1.133^3 = 1.45$ 倍です。実際の 1.404 倍と合いません。
幾何平均:$\sqrt[3]{1.30 \times 1.20 \times 0.90} = \sqrt[3]{1.404} \approx 1.1198$ → 年率 約 11.98% です。これなら $1.1198^3 = 1.404$ 倍で一致します。

③ 調和平均(Harmonic Mean):速度・効率を平均する

公式
$$\bar{x}_H = \frac{n}{\sum \dfrac{1}{x_i}}$$

調和平均は「逆数の算術平均の逆数」です。同じ量を割って得られる比率(速度=距離/時間など)に使います。

具体例:往復路の平均速度

同じ道を往路 60 km/h、復路 40 km/h で走りました。平均速度は?
算術平均(誤):$(60+40)/2 = 50$ km/h
調和平均(正):$\dfrac{2}{\frac{1}{60} + \frac{1}{40}} = \dfrac{2}{\frac{2+3}{120}} = \dfrac{2 \times 120}{5} = $ 48 km/h

距離を120 kmとすると 往路2時間 + 復路3時間 = 5時間で 240 km → 平均 48 km/h で一致します。「遅い方に引っ張られる」のが調和平均の特徴です。

3つの平均の使い分け早見表

名前計算使う場面大小関係
算術平均足して割る普通の量(点数、身長など)算術 ≥ 幾何 ≥ 調和
(正の値のとき)
幾何平均掛けて $n$ 乗根成長率・倍率(経済成長、複利)
調和平均逆数の算術平均の逆数比率・速度(km/h、燃費)

外れ値があるとどうなる?

「外れ値(他の値と大きく離れたデータ)」があると、平均値は大きく変わるのに、中央値はほとんど動かないという特徴があります。

外れ値シミュレーター
8人のクラスのテスト点数: 60, 65, 70, 72, 75, 78, 80, 85
平均値
—
点
中央値
—
点
データ数
8
人

⚠️ 現実の例:平均年収 vs 中央値年収

日本の給与所得者の平均年収は約460万円ですが、中央値は約360万円です(出典:国税庁「民間給与実態統計調査」。平均は公表値、中央値は同調査の階級別分布から推計した値です)。少数の超高収入者が平均を引き上げているため、「自分は平均以下」と感じる人が多数派になります。
→ このようなケースでは中央値のほうが「実態」を反映しています。

✅ 平均値が適している場面

  • 外れ値がないとき
  • 数学的計算に使うとき(分散などは平均から計算)
  • データが対称分布のとき

✅ 中央値が適している場面

  • 外れ値があるとき(年収・地価など)
  • 分布が左右非対称のとき
  • 「典型的な値」を知りたいとき
4

広がり(散らばり)

「平均が同じ」でも、バラつきが違えば全然違うデータ

具体例:2つのクラスのテスト点数
クラスA(バラつき小)
60, 65, 70, 75, 80
平均 = 70点
クラスB(バラつき大)
40, 55, 70, 85, 100
平均 = 70点

→ 平均は同じ70点なのに、クラスの様子は全然違います。バラつきを表す指標が必要です。

範囲(レンジ)

一番素朴な指標として、範囲(=最大値 − 最小値)があります。クラスAは $80-60=20$ 点、クラスBは $100-40=60$ 点です。一瞬で計算できる反面、両端の2つの値だけで決まるため、外れ値が1つあるだけで激変し、間のデータの散らばり方は完全に無視されます。
→ 「全データを使って散らばりを測りたい」。そこで分散を使います。

分散(バリアンス)と標準偏差

公式
$$\text{分散}\quad s^2 = \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2$$ $$\text{標準偏差}\quad s = \sqrt{s^2}$$
分散のイメージ:平均からの距離を一辺にした正方形

データ 10, 11, 14, 17, 23(平均 15)。各データから平均までの距離を一辺とする正方形を描くと…

正方形の面積は 25, 16, 1, 4, 64 です。その平均 $(25+16+1+4+64)\div5 = 22$ が分散です。
面積22の正方形(点線)の一辺 $\sqrt{22} \approx 4.7$ が標準偏差です。

「分散」の直感的な意味:
各データと平均の「距離」を二乗したものの平均です。「距離の二乗 = 正方形の面積」なので、「面積の平均」とも言えます。面積が大きいほどバラつきが大きくなります。
ただし分散は単位が2乗になってしまう(点なら「点²」)ので、元の単位に戻すため平方根をとったものが標準偏差です(SD=Standard Deviation)。「正方形の面積=分散」なら「正方形の一辺の長さ=標準偏差」にあたります。
表記の約束:本文では「標準偏差」、数式では記号 $s$(分散は $s^2$)、グラフのラベルなど狭い場所では「SD」と書きます。実務のツールや論文でも SD 表記が標準なので、セットで覚えてください。
クラスA vs クラスB

さっきの正方形を、平均が同じ70点の2クラスで描くと…

クラスA:60, 65, 70, 75, 80

平均 70 分散 s² = 50 SD ≈ 7.07

クラスB:40, 55, 70, 85, 100

平均 70 分散 s² = 450 SD ≈ 21.21

→ 両者とも平均は70点です。でもクラスAは平均からだいたい7点、クラスBはだいたい21点ずれます。
標準偏差は「平均からのズレの、だいたいの大きさ」です。

計算ステップ(クラスAで確認)

  1. 平均を計算する:$\bar{x} = 70$
  2. 各データと平均の差(偏差)を求める
  3. 偏差を二乗する(マイナスを消す&大きな差を強調)
  4. 偏差の二乗を合計して $n$ で割る → 分散
  5. 分散の平方根 → 標準偏差(元のデータと同じ単位になる)
$x_i$偏差 $x_i - \bar{x}$偏差の二乗 $(x_i-\bar{x})^2$
60-10100
65-525
7000
75+525
80+10100
合計0(常にゼロ!)250

分散 $s^2 = 250 \div 5 = \mathbf{50}$  標準偏差 $s = \sqrt{50} \approx \mathbf{7.07}$点

⚠️ 不偏分散($n-1$ で割る)との違い

標本データから母集団の分散を推定するには $n-1$ で割る「不偏分散」 を使います(第6章で詳しく)。本サイトでは両者を記号で区別し、標本分散を $s^2$(÷$n$)、不偏分散を $s_u^2$(÷$(n-1)$)と書きます($u$ は unbiased=不偏)。
統計検定2級では問題文をよく読み「$n$ で割るか $n-1$ で割るか」を確認しましょう。

四分位数と箱ひげ図(ボックスプロット)

データを4等分するポイントが四分位数です。

Q1(第1四分位数)

下位25%の点です。「下から4分の1」の位置

Q2(中央値)

ちょうど真ん中50%の点です。中央値と同じ

Q3(第3四分位数)

上位25%の点です。「上から4分の1」の位置

四分位範囲(IQR)
$$\text{IQR} = Q_3 - Q_1$$

IQRは「真ん中50%のデータが収まる幅」です。外れ値の影響を受けにくい散らばりの指標です。

箱ひげ図:クラスA vs クラスB

箱の中が「中央50%」の範囲、線が中央値、ひげが最大・最小を表す

五数要約と「外れ値」の判定基準(1.5×IQR ルール)

箱ひげ図は5つの数値で決まります。この5つを五数要約(five-number summary)と呼びます。

最小値
$\min$
第1四分位
$Q_1$
中央値
$Q_2$ (Med)
第3四分位
$Q_3$
最大値
$\max$
箱ひげ図の構造(厳密な定義):
・箱:$Q_1$ から $Q_3$ まで(=中央50%)
・箱内の線:中央値 $Q_2$
・ひげ:最遠の「外れ値でないデータ」まで(後述の 1.5×IQR ルールで決まる)
・点:ひげの外にあるデータ = 外れ値として個別表示

1.5×IQR ルール:「外れ値」の客観的な定義

「他のデータより明らかに離れているか」を主観で決めるのではなく、IQR を物差しにした客観基準を使います:

外れ値(潜在的)の判定

次のどちらかに該当するデータは「外れ値」とみなす:
・$x < Q_1 - 1.5 \cdot \text{IQR}$(下限ライン未満)
・$x > Q_3 + 1.5 \cdot \text{IQR}$(上限ライン超)

1.5×IQR ルールを箱ひげ図で見る
Q₁ − 1.5·IQR 下限ライン Q₃ + 1.5·IQR 上限ライン 外れ値 外れ値 Q₁ Q₂ Q₃ IQR 1.5 × IQR 1.5 × IQR

ひげは「下限・上限ライン以内の最遠データ」までです。それを超えるデータ点が 外れ値です。

具体例:あるテスト点数

点数:15, 60, 65, 68, 70, 72, 75, 78, 80, 85, 98 (11人)
$Q_1 = 65$、$Q_3 = 80$、$\text{IQR} = 80 - 65 = 15$
下限ライン:$65 - 1.5 \times 15 = 42.5$ → 15点は外れ値
上限ライン:$80 + 1.5 \times 15 = 102.5$ → 98点は範囲内

変動係数(CV)

公式
$$CV = \frac{s}{\bar{x}} \times 100\%$$
使い道:単位が違うデータのバラつきを比較したいとき。
例:身長(cm)と体重(kg)の「バラつき具合」を比べたい場合、標準偏差の単位が違うので直接比較できません。CVは「平均の何%のバラつきか」という無次元の比率なので比較できます。
具体例:身長と体重、どちらの方がバラつきが大きい?

ある集団のデータ:

変数 平均 $\bar{x}$ 標準偏差 $s$ CV = $\dfrac{s}{\bar{x}} \times 100$
身長 170 cm 5 cm $\dfrac{5}{170}\times 100 \approx$ 2.94%
体重 60 kg 8 kg $\dfrac{8}{60}\times 100 \approx$ 13.33%

標準偏差だけ見ると:体重 8kg vs 身長 5cm です。単位が違うので比較不可能です。
CV で比べると:身長 2.94% vs 体重 13.33% → 体重のほうが約4.5倍バラつきが大きいと言えます。

もう一つの例:株価のリスク比較

A社の株価:平均 1000円、標準偏差 100円 → CV = 10%
B社の株価:平均 50円、標準偏差 8円 → CV = 16%
→ B社のほうが「株価が変動しやすい(リスクが大きい)」と分かります。 標準偏差の値(100円 vs 8円)だけ見ると、誤って「A社の方が動いている」と判断してしまいます。

⚠️ CVが使えないケース

CV は 平均が0に近い、または負の値を取りうるデータには使えません(割る数が小さすぎたり、符号が逆転すると無意味)。
気温(℃)や利益率など「正負どちらにもなりうる量」は比例尺度ではないのでCVは不適切です。CVが意味を持つのは、年収・身長・距離など「比例尺度のデータ」だけです。

指数化:基準を100にそろえて比べる

売上が 1,200万円から 1,500万円に、来客数が 800人から 1,000人に増えました。どちらの伸びが大きいでしょうか。「万円」と「人」では目盛りが違うので、そのままでは比べられません。変動係数のときと同じ発想で、単位を消してしまいます。

指数化
$$\text{指数} = \frac{\text{値}}{\text{基準の値}} \times 100$$

基準にした値(基準年、基準時点)を 100 とし、ほかの値を「基準の何%か」で表します。

そのまま(単位が違う) 売上 1,500万円 1,200 来客 1,000人 800 基準今 目盛りが別々で、伸びを比べられない 指数化(基準=100) 100 125 売上も来客も 125(線が重なる) 基準今
売上は $1500 \div 1200 \times 100 = 125$、来客も $1000 \div 800 \times 100 = 125$ です。指数にそろえると2本の線がぴったり重なり、伸びは同じ 25% だと分かります。

指数化は時系列で複数の系列を比べるときの定番で、消費者物価指数(CPI)が代表例です。7 で成長率とセットでもう一度使います。

5

標準化と偏差値

「異なる試験の点数」を同じ土俵で比べる方法

こんな疑問から始まります

Aさんは数学で72点、Bさんは英語で72点を取りました。
どちらが「クラスの中で優秀」だったのでしょうか?
(数学:クラス平均60点・標準偏差10点 / 英語:クラス平均78点・標準偏差6点)

点数が同じでも、クラスの平均や散らばり方が違えば意味が違います。そこで「クラス内での位置」を同じ尺度で表すのが標準化(z変換)です。

z スコア(標準化スコア)
$$z = \frac{x - \bar{x}}{s}$$

「自分の点がクラス平均より何標準偏差分上(下)か」を示します。z=0 が平均、z=1 なら平均より標準偏差1個分上です。

なぜ「平均を引く」のか、なぜ「標準偏差で割る」のか、公式の意味を分布図で見てみましょう。z変換は、異なる平均・異なる散らばりを持つ複数の分布を、すべて「同じ位置・同じ形」に揃えるための2段階の操作です。

z変換の2ステップ(3つの分布を「重ねる」プロセス)
⚠️ 標準化しても「分布の形」は変わらない:年収のような歪んだデータでも使える

上の3つは左右対称の分布でしたが、年収のように右へ歪んだ分布でも標準化はできます(各値から平均を引いて標準偏差で割るだけの操作だから)。ただし、そろうのは中心と幅だけです。歪み(形)はそのまま残ります。

元の分布(例:年収) 平均 02505007501000 (万円) 長い裾 → 標準化 → 横を縮める 標準化後(中心0・幅1) −10123 (z) 歪みは残る →

中心と幅はそろいますが、右に裾を引いた形はそのままです。

→ だから「標準化=正規分布(釣鐘型)になる」ではありません。標準正規分布 $N(0,1)$ になるのは、元がもともと正規分布だったときだけです。この先の「偏差値 → 上位何%」も、元が正規分布に近いことを前提にした目安で、強く歪んだデータでは実際の割合とズレます。

偏差値(T スコア)
$$\text{偏差値} = 50 + 10z = 50 + 10 \times \frac{x - \bar{x}}{s}$$

z スコアを「平均50・標準偏差10」の尺度に変換したものです。日本の入試でお馴染みの指標です。

Aさん(数学72点)
$z = \dfrac{72 - 60}{10} = \mathbf{+1.2}$
偏差値 $= 50 + 10 \times 1.2 = \mathbf{62}$
✅ クラス平均より1.2SD上!優秀
Bさん(英語72点)
$z = \dfrac{72 - 78}{6} = \mathbf{-1.0}$
偏差値 $= 50 + 10 \times (-1.0) = \mathbf{40}$
⚠️ クラス平均より1SD下…

→ 同じ72点でも、Aさんの方がクラス内では優秀だったことが分かります。

偏差値・zスコア 計算機

自分の偏差値を計算してみよう
z スコア
+1.20
偏差値
62
上位何%?
12%

グラフは正規分布を仮定(実際の分布とは異なる場合があります)

6

分布の形(歪度・尖度)

3観点の最後:分布の「形」を1つの数値に圧縮する

2 で「右に裾が長い」「左に偏っている」などを絵で見ました。ここではその「形」を数値で表す方法を学びます。
ポイントは、直前の 5 で学んだ標準化(zスコア $z=\dfrac{x-\bar{x}}{s}$)です。すべてのデータを「平均0・標準偏差1」の共通スケールに直してから、$z$ を3乗・4乗して平均するだけです。これで分布の「形」が1つの数値になります。

① 歪度(Skewness):左右どちらに偏っているか

歪度(標準化した値の3乗の平均)
$$\text{Skew} = \frac{1}{n}\sum_{i=1}^{n} z_i^{\,3} = \frac{1}{n}\sum_{i=1}^{n} \left(\frac{x_i - \bar{x}}{s}\right)^3$$

3乗は奇数乗なので符号が残り、裾が伸びた側の符号になります。
右に裾が長い → 歪度>0 / 左に裾が長い → 歪度<0 / 左右対称 → 歪度=0

歪度の3パターン(裾=しっぽ の向きに注目)
① 左に歪み 歪度 < 0 ⟵ 長い裾 例:寿命、満点近い試験 ② 左右対称 歪度 = 0 両側そろう 例:身長、正規分布 ③ 右に歪み 歪度 > 0 長い裾 ⟶ 例:年収、待ち時間

山(最頻値)の反対側に長い裾が伸びます。裾の向きがそのまま歪度の符号になります。

平均・中央値・最頻値の位置関係
  • 歪度 > 0(右に裾が長い):最頻値 < 中央値 < 平均(裾の方向に平均が引っ張られる)
  • 歪度 = 0(対称):3つとも一致
  • 歪度 < 0(左に裾が長い):平均 < 中央値 < 最頻値

② 尖度(Kurtosis):とがり具合・裾の重さ(外れ値の出やすさ)

尖度(標準化した値の4乗の平均 − 3)
$$\text{Kurt} = \frac{1}{n}\sum_{i=1}^{n} z_i^{\,4} - 3 = \frac{1}{n}\sum_{i=1}^{n} \left(\frac{x_i - \bar{x}}{s}\right)^4 - 3$$

4乗は偶数乗なので全部プラスになり、向きは関係なく外れ値の出やすさ(裾の重さ)を測ります。
正規分布だと $z^4$ の平均がちょうど3なので、−3 して正規分布を0の基準に合わせます。

尖度の3パターン(同じ中心・同じ広がりでとがり具合だけ違う)
① 平坦 尖度 < 0 裾が軽い(外れ値が出にくい) ② 正規分布(基準) 尖度 = 0 標準的な裾の重さ ③ 尖っている 尖度 > 0 裾が重い(外れ値が出やすい)

3つとも標準偏差は同じです。尖度が低いと中心が平らで裾がすぐ切れ、高いと中心が尖って裾が長く伸びます。

尖った分布は「中心にギュッと密集」と「たまに遠くへポツンと外れる」の同居です。ふだんは平均のすぐ近く、でも時々ドカンと外れ値が出ます。この「遠くの外れ値の出やすさ」が“裾の重さ”です。たとえば株価の1日の変動率は、ほとんどの日は 0% 近くに密集しますが、たまに暴落・暴騰するので尖度が高くなります。

「裾が重い」と聞くとバラつきが大きいことだと思いがちですが、この2つは測っている軸が違います。

⚠️ 「SDが小さい」と「尖度が高い」は別もの

標準偏差(SD・広がり)と尖度(裾の重さ)は測っている軸が違います。上の3パターンはすべて同じ中心・同じ標準偏差なのに尖度が違います。つまり尖度は標準偏差では区別できない“裾の重さ”を測る指標です。

  • SD=分布の“平均的な幅”(単位あり:点・円など)
  • 尖度=幅をそろえた後($z$ に直した後)に残る形=外れ値の出やすさ(単位なし)
シミュレータ①:SD(標準偏差)を動かす。山ごと「幅」が伸び縮み
SD = 1.00

グレーは基準です(SD=1)。SDを上げると山全体が横に広がって低くなります(=データが一様に散らばる)。「尖り」ではなく「幅」が変わります。

シミュレータ②:尖度を動かす。SDは1のまま、中心の密集と裾の重さだけ変わる
尖度 ≈ 0.00

グレーは正規分布です(尖度0)。横幅(SD=1)は固定したまま、尖度を上げると中心が尖って密集し、同時に両裾がグレー線より上へ持ち上がります(=平均から遠い値が出やすい)。下げると逆に、裾がグレー線より下がって遠い値が出にくくなります。

7

時系列データ

時間順に並んだデータの「流れ」と「傾向」を読む

時系列データには3つの成分が混在しています。

① トレンド

長期的な増減傾向です。「毎年売上が増えている」など

② 季節変動

1年周期など規則的な変動です。「夏に気温が上がる」

③ 不規則変動

ランダムなノイズです。予測不可能な変動

指数化と成長率:時系列を「基準年=100」で読む

4 で見た指数化は、時系列でこそ本領を発揮します。ある年を基準(=100)にすると、その後の指数はそのまま「基準年からの伸び」になります。指数が 110 なら基準年から 10% 増、95 なら 5% 減です。

年売上(万円)指数(2020年=100)前年比の成長率
20201,200100…
20211,320110+10%
20221,18899−10%
20231,366113.8+15%

※ 指数 = その年の売上 ÷ 2020年の売上 × 100。成長率 = (今年 − 前年)÷ 前年。

成長率は毎年変わるので、「平均して年に何%伸びたか」を出すときは幾何平均(3)を使います。3年間で指数が 100 から 113.8 になったので、年平均成長率は $\sqrt[3]{1.138} \approx 1.044$、つまり年 4.4% です。単純平均の $(10-10+15)\div 3 = 5\%$ とは一致しません。

移動平均(Moving Average)

直近 $k$ 個のデータの平均を連続して計算することで、ノイズを取り除いてトレンドを見やすくする手法です。

k 項移動平均
$$\hat{y}_t = \frac{1}{k}(y_t + y_{t-1} + \cdots + y_{t-k+1}) = \frac{1}{k}\sum_{j=0}^{k-1} y_{t-j}$$
東京の月別平均気温と移動平均

データ例:各月の平均気温(℃)

移動平均の窓幅:

3ヶ月移動平均:季節変動が少し平滑化されます

まとめ:移動平均の窓幅による違い
  • 窓幅 $k$ が大きいほど平滑化され、トレンドが見えやすくなる
  • 窓幅が大きすぎると、直近の変化を見逃す
  • $k$ 項移動平均を計算すると、最初の $k-1$ 個はデータが得られない

自己相関:「過去が現在にどれだけ影響するか」

時系列データの大きな特徴は、「今日の値」が「昨日の値」と関係していることが多いことです。気温・株価・売上などはたいてい、隣接時刻が似た値をとります。これを定量化するのが自己相関係数(autocorrelation)です。

ラグ $k$ の自己相関係数(覚える必要はありません)
$$r_k = \frac{\sum_{t=k+1}^{n}(y_t - \bar{y})(y_{t-k} - \bar{y})}{\sum_{t=1}^{n}(y_t - \bar{y})^2}$$

自己相関係数は、$y_t$ と $y_{t-k}$($k$ 期前の値)のピアソン相関です。同じ時系列の「自分自身の過去」との相関を測ります。

意味と使い方:
・$r_1$(ラグ1)が大きい → 1期前の値が現在に強く影響(持続性あり)
・$r_{12}$ が大きい → 12期前と同じパターン(月次データなら年周期)
・全ラグでほぼ0 → 各時刻が独立(ホワイトノイズ的)
コレログラム(自己相関を全ラグで一覧)

ラグ $k$ ごとの自己相関係数 $r_k$ を棒グラフにしたものをコレログラムと呼びます。気温データなど季節性のあるデータでは特徴的なパターンが出ます。

+1 0 −1 自己相関 rₖ 1 2 3 4 5 6 7 8 9 10 11 12 ラグ k(何期前か) 隣接月との相関高 ← 半年前(夏↔冬)と逆相関 1年前と再び高相関

月次平均気温のコレログラム例です。ラグ12(1年)でほぼ +1 になっていて、季節性が強いことが見えます。

コレログラムの読み取り方
ゆっくり減衰
→ トレンドがある(持続的)
周期的に強く出る
→ 季節性あり(ラグ12が高い=年周期)
全ラグでほぼ0
→ ホワイトノイズ(過去が現在に影響しない)
8

不平等度の指標(ローレンツ曲線・ジニ係数)

「分配がどれだけ偏っているか」を1つの数字で表す

所得・資産・売上シェアなどの分布で「どれだけ偏っているか」を測りたい場面はよくあります。これは「広がり」とは別の観点で、累積(積み上げ)で見るのがポイントです。

ローレンツ曲線(Lorenz Curve)

人を所得の低い順に並べ、横軸=「累積人口比」、縦軸=「累積所得比」をプロットした曲線です。

ローレンツ曲線の見方
完全平等線(45°) 面積 A (45度線と曲線の間) 面積 B ローレンツ曲線 累積人口比(所得の低い順) 累積所得比 0% 50% 100% 0% 50% 100%

完全平等なら 45度線になり、不平等なほど 45度線から下に膨らみます。たとえば横軸 50% のときに縦軸が 20% なら、「下位 50% の人が全所得の 20% しか受け取っていない」という意味です。

ジニ係数(Gini Coefficient)

ローレンツ曲線をたった1つの数字で要約したものがジニ係数です。45度線と曲線の間の面積を、三角形(45度線の下の面積=1/2)に対する比率で表します。

ジニ係数
$$G = \frac{\text{面積 A}}{\text{面積 A + 面積 B}} = 2 \times \text{面積 A}$$ A 面積 A ÷ A+B 面積 A+B(三角形 = 1/2) = G 三角形は 1/2 なので G = 2 × 面積 A

範囲:$0 \leq G \leq 1$
・$G = 0$:完全平等(全員同じ所得)
・$G = 1$:完全不平等(1人が全部独占)

目安:国別の所得のジニ係数

上と同じ「累積人口比 × 累積所得比」のローレンツ曲線から出した値です。国民の間で所得がどれだけ偏っているかを表します。

分類ジニ係数例
低い(平等寄り)0.25 〜 0.30北欧諸国(デンマーク・スウェーデンなど)
中程度0.30 〜 0.40多くの先進国、日本、米国
高い(不平等)0.40 〜 0.50中国、新興国
非常に高い0.50 以上南アフリカ、ブラジルなど

※ いずれも税や社会保障による再分配のあとの所得で見た値です。日本は約 0.33(OECD)〜0.38(厚労省「所得再分配調査」)で中程度です。 再分配前の所得で測ると同じ国でも大きく上がる(日本の当初所得は約 0.57)ので、数字を比べるときは「再分配の前か後か」を必ず確認します。

具体例:5人の所得

5人の所得が 100, 200, 300, 400, 500 万円だとします(総所得 1500 万円)。
所得の低い順に並べ、人数と所得を「累積」していきます。

所得(万円)100200300400500
累積所得(万円)10030060010001500
累積人数比 $p$20%40%60%80%100%
累積所得比 $q$6.7%20%40%66.7%100%

表の $(p,\;q)$ を点として打ち、順に直線で結ぶと この5人のローレンツ曲線になります:

6.7% 20% 40% 66.7% 読み方:下位40%の人で 全所得の20%しかない 0% 20% 40% 60% 80% 100% 0% 20% 40% 60% 80% 100% 累積人数比 p(所得の低い順) 累積所得比 q

曲線は最初ゆるやか(所得の少ない人)→ 終盤で急になります(所得の多い人)。45度線から下に膨らむほど不平等です。あとは色のついた面積Aを測るだけ:

曲線の下の面積B(台形の合計)
$B = 0.2\times\dfrac{0+0.067}{2} + 0.2\times\dfrac{0.067+0.2}{2} + 0.2\times\dfrac{0.2+0.4}{2} + 0.2\times\dfrac{0.4+0.667}{2} + 0.2\times\dfrac{0.667+1}{2} \approx 0.367$
面積 $A = 0.5 - B = 0.5 - 0.367 = 0.133$
$\;\;\Rightarrow\;\; G = 2A = 2\times0.133 \approx \mathbf{0.27}$

もし5人の所得が全員同じ(300万円ずつ)なら曲線は45度線と一致し、面積A=0 → $G=0$(完全平等)になります。

次のステップ →
第2章「2変数以上のデータ」へ進む
相関・単回帰・分割表を図解で学ぶ