1変数データ
最終更新:
統計検定2級のゴールは、一部のデータ(標本)から全体(母集団)を推測することです(第7〜8章)。 でもその前に、手元にあるデータを正しく「見る」技術がなければ何も始まりません。 100人分の数字をそのまま並べて渡されて、眺めて分かることはほとんどないからです。
この章がやるのは、並んだ数字を「たった数個の値」に圧縮することです。 どこが真ん中で(中心)、どれくらい散らばっていて(広がり)、どんな形をしているか(形)の3つが分かれば、100個の数字は「だいたいこういうデータだ」と一言で言えるようになります。
要約する前
72, 58, 91, 65, 80, …(100個)
見ても何も分からない
他のデータと比べようがない
要約したあと
平均73点・標準偏差12点・やや右に裾が長い
3つの数字で全体像がつかめる
別のクラスとも比較できる
データの種類と尺度
「どんな数値か」によって、使える統計操作が変わる
データを集めたとき、まず考えなければならないのが「このデータは何尺度か?」という問いです。尺度によって「平均を取っていいか」「順序に意味があるか」が決まります。
尺度は名義 → 順序 → 間隔 → 比例の順に「できること」が増えていきます。比例尺度のデータには名義尺度の操作(分類・度数)もそのまま使えます。
分布を「見る」
以下のデータはクラス30人の数学テストの点数です。パッと見て分かることはありますか?
42, 55, 58, 62, 65, 65, 67, 68, 70, 71,
72, 73, 74, 75, 76, 77, 78, 79, 80, 81,
82, 85, 85, 87, 89, 91, 93, 95, 97, 100
数字の羅列だと、全体の傾向は全くつかめません。
度数分布表にしてみる
まず「何点台が何人いるか」をまとめます。
| 階級(点) | 度数(人) | 相対度数 | 累積相対度数 |
|---|---|---|---|
| 40〜50未満 | 1 | 0.033 | 0.033 |
| 50〜60未満 | 2 | 0.067 | 0.100 |
| 60〜70未満 | 5 | 0.167 | 0.267 |
| 70〜80未満 | 10 | 0.333 | 0.600 |
| 80〜90未満 | 7 | 0.233 | 0.833 |
| 90〜100以下 | 5 | 0.167 | 1.000 |
| 合計 | 30 | 1.000 | — |
※ 相対度数 = 度数 ÷ 全体(30) 累積相対度数 = その階級までの相対度数の合計
ヒストグラムにすると一目瞭然
階級幅を変えると、見え方がどう変わるか試してみましょう。
ヒストグラム以外の見せ方:幹葉図・累積度数グラフ・円グラフ
同じデータでも、知りたいことによって向いているグラフが変わります。ヒストグラム以外に3つ、試験で名前が出るものを同じ30人の点数で見ておきます。
目安として、元の値を残したまま形を見たいなら幹葉図、「何点以下が何%か」を読みたいなら累積度数グラフ、カテゴリごとの割合なら円グラフ、それ以外の量的データの形はヒストグラム、と使い分けます。
分布の「形」3パターン:曲線で見る
データを多く集めて細かく描くと、ヒストグラムは滑らかな曲線の形に近づきます。この曲線が「分布の形」です。代表的な3パターンを見ましょう。
※ カード内の「歪度(わいど)」は形を数値で表す指標です。6 で定義するので、ここでは形のイメージだけつかめばOKです。
左に山があるのに「右に歪んだ」と呼ぶのは、直感に反します。右側には何もないので。
そこで、その何もない側に歪みのかたまりであるブラックホールがあると考えてみてください。
ブラックホールが時空を歪めて、分布が逆側に寄って伸びているとイメージすると覚えやすいです。
山の数で分けることもあります。山が1つなら単峰、2つ以上なら多峰(2つなら双峰)と呼びます。多峰は「性質の違う集団が混ざっているサイン」で、たとえば男女混合の身長は、女性の山と男性の山が重なって双峰になります。山がなく平らな形は一様です。
中心(代表値)
データの「真ん中」を1つの数で表す
前の節では分布を図で「眺め」ました。ここから先は分布を 3つの軸で数値化 していきます:
- 中心:分布の真ん中はどこか → 今ここ(3)
- 広がり:分布の散らばり具合 → 4
- 形:対称か歪んでいるか/とがっているか平坦か → 6
※ 間に挟まる 5(標準化)は、「形」を数値にするための道具(zスコア)を準備するステップです。
代表値とは、たくさんのデータを1つの数値で要約するものです。
平均値(算術平均)
データを重りだと思うと、平均値の位置にシーソーの支点を置けばちょうど釣り合います。
中央値(メジアン)
データを小さい順に並べたとき、ちょうど真ん中の値です。
- データ数 $n$ が奇数:ちょうど $\frac{n+1}{2}$ 番目の値
- データ数 $n$ が偶数:$\frac{n}{2}$ 番目と $\frac{n}{2}+1$ 番目の平均
真ん中の人さえ分かれば、両端の人が何点でも中央値は同じです。だから外れ値に引っ張られません(このあと確認します)。
最頻値(モード)
データの中で最も頻繁に出てくる値です。数値データより、カテゴリデータ(血液型、趣味など)でよく使います。
様々な平均:目的別バリエーション
「平均」と聞いたら算術平均を思い浮かべますが、扱う量の性質によって使い分けるべき平均が3種類あります。
① 加重平均(Weighted Mean):重要度が違うデータを平均する
各データ $x_i$ に重み $w_i$ を掛けて合計し、重みの合計で割ります。重みが全部1なら通常の算術平均と一致します。
数学(4単位)80点、英語(3単位)70点、体育(1単位)60点です。
算術平均:$(80+70+60)/3 = 70$ 点
加重平均(単位数を重みに):$\dfrac{4 \cdot 80 + 3 \cdot 70 + 1 \cdot 60}{4+3+1} = \dfrac{590}{8} = $ 73.75 点
→ 重い科目(単位数の多い数学)の点数がより強く反映されます。
② 幾何平均(Geometric Mean):成長率や倍率を平均する
幾何平均は「掛けて $n$ 乗根」です。成長率(×1.10, ×1.20, ×0.90 など)のような掛け算で積み上がる量に使います。
1年目 +30%(×1.30)、2年目 +20%(×1.20)、3年目 −10% です(×0.90)。
3年で売上は $1.30 \times 1.20 \times 0.90 = 1.404$ 倍になります。では、1年あたり何倍でしょうか?
算術平均:$(30 + 20 - 10)/3 = +13.3\%$ → これだと「毎年13.3%ずつ成長」になり $1.133^3 = 1.45$ 倍です。実際の 1.404 倍と合いません。
幾何平均:$\sqrt[3]{1.30 \times 1.20 \times 0.90} = \sqrt[3]{1.404} \approx 1.1198$ → 年率 約 11.98% です。これなら $1.1198^3 = 1.404$ 倍で一致します。
③ 調和平均(Harmonic Mean):速度・効率を平均する
調和平均は「逆数の算術平均の逆数」です。同じ量を割って得られる比率(速度=距離/時間など)に使います。
同じ道を往路 60 km/h、復路 40 km/h で走りました。平均速度は?
算術平均(誤):$(60+40)/2 = 50$ km/h
調和平均(正):$\dfrac{2}{\frac{1}{60} + \frac{1}{40}} = \dfrac{2}{\frac{2+3}{120}} = \dfrac{2 \times 120}{5} = $ 48 km/h
距離を120 kmとすると 往路2時間 + 復路3時間 = 5時間で 240 km → 平均 48 km/h で一致します。「遅い方に引っ張られる」のが調和平均の特徴です。
3つの平均の使い分け早見表
| 名前 | 計算 | 使う場面 | 大小関係 |
|---|---|---|---|
| 算術平均 | 足して割る | 普通の量(点数、身長など) | 算術 ≥ 幾何 ≥ 調和 (正の値のとき) |
| 幾何平均 | 掛けて $n$ 乗根 | 成長率・倍率(経済成長、複利) | |
| 調和平均 | 逆数の算術平均の逆数 | 比率・速度(km/h、燃費) |
外れ値があるとどうなる?
「外れ値(他の値と大きく離れたデータ)」があると、平均値は大きく変わるのに、中央値はほとんど動かないという特徴があります。
60, 65, 70, 72, 75, 78, 80, 85
日本の給与所得者の平均年収は約460万円ですが、中央値は約360万円です(出典:国税庁「民間給与実態統計調査」。平均は公表値、中央値は同調査の階級別分布から推計した値です)。少数の超高収入者が平均を引き上げているため、「自分は平均以下」と感じる人が多数派になります。
→ このようなケースでは中央値のほうが「実態」を反映しています。
✅ 平均値が適している場面
- 外れ値がないとき
- 数学的計算に使うとき(分散などは平均から計算)
- データが対称分布のとき
✅ 中央値が適している場面
- 外れ値があるとき(年収・地価など)
- 分布が左右非対称のとき
- 「典型的な値」を知りたいとき
広がり(散らばり)
「平均が同じ」でも、バラつきが違えば全然違うデータ
→ 平均は同じ70点なのに、クラスの様子は全然違います。バラつきを表す指標が必要です。
範囲(レンジ)
一番素朴な指標として、範囲(=最大値 − 最小値)があります。クラスAは $80-60=20$ 点、クラスBは $100-40=60$ 点です。一瞬で計算できる反面、両端の2つの値だけで決まるため、外れ値が1つあるだけで激変し、間のデータの散らばり方は完全に無視されます。
→ 「全データを使って散らばりを測りたい」。そこで分散を使います。
分散(バリアンス)と標準偏差
データ 10, 11, 14, 17, 23(平均 15)。各データから平均までの距離を一辺とする正方形を描くと…
正方形の面積は 25, 16, 1, 4, 64 です。その平均 $(25+16+1+4+64)\div5 = 22$ が分散です。
面積22の正方形(点線)の一辺 $\sqrt{22} \approx 4.7$ が標準偏差です。
各データと平均の「距離」を二乗したものの平均です。「距離の二乗 = 正方形の面積」なので、「面積の平均」とも言えます。面積が大きいほどバラつきが大きくなります。
ただし分散は単位が2乗になってしまう(点なら「点²」)ので、元の単位に戻すため平方根をとったものが標準偏差です(SD=Standard Deviation)。「正方形の面積=分散」なら「正方形の一辺の長さ=標準偏差」にあたります。
表記の約束:本文では「標準偏差」、数式では記号 $s$(分散は $s^2$)、グラフのラベルなど狭い場所では「SD」と書きます。実務のツールや論文でも SD 表記が標準なので、セットで覚えてください。
さっきの正方形を、平均が同じ70点の2クラスで描くと…
クラスA:60, 65, 70, 75, 80
クラスB:40, 55, 70, 85, 100
→ 両者とも平均は70点です。でもクラスAは平均からだいたい7点、クラスBはだいたい21点ずれます。
標準偏差は「平均からのズレの、だいたいの大きさ」です。
計算ステップ(クラスAで確認)
- 平均を計算する:$\bar{x} = 70$
- 各データと平均の差(偏差)を求める
- 偏差を二乗する(マイナスを消す&大きな差を強調)
- 偏差の二乗を合計して $n$ で割る → 分散
- 分散の平方根 → 標準偏差(元のデータと同じ単位になる)
| $x_i$ | 偏差 $x_i - \bar{x}$ | 偏差の二乗 $(x_i-\bar{x})^2$ |
|---|---|---|
| 60 | -10 | 100 |
| 65 | -5 | 25 |
| 70 | 0 | 0 |
| 75 | +5 | 25 |
| 80 | +10 | 100 |
| 合計 | 0(常にゼロ!) | 250 |
分散 $s^2 = 250 \div 5 = \mathbf{50}$ 標準偏差 $s = \sqrt{50} \approx \mathbf{7.07}$点
標本データから母集団の分散を推定するには $n-1$ で割る「不偏分散」 を使います(第6章で詳しく)。本サイトでは両者を記号で区別し、標本分散を $s^2$(÷$n$)、不偏分散を $s_u^2$(÷$(n-1)$)と書きます($u$ は unbiased=不偏)。
統計検定2級では問題文をよく読み「$n$ で割るか $n-1$ で割るか」を確認しましょう。
四分位数と箱ひげ図(ボックスプロット)
データを4等分するポイントが四分位数です。
Q1(第1四分位数)
下位25%の点です。「下から4分の1」の位置
Q2(中央値)
ちょうど真ん中50%の点です。中央値と同じ
Q3(第3四分位数)
上位25%の点です。「上から4分の1」の位置
IQRは「真ん中50%のデータが収まる幅」です。外れ値の影響を受けにくい散らばりの指標です。
箱の中が「中央50%」の範囲、線が中央値、ひげが最大・最小を表す
五数要約と「外れ値」の判定基準(1.5×IQR ルール)
箱ひげ図は5つの数値で決まります。この5つを五数要約(five-number summary)と呼びます。
$\min$
$Q_1$
$Q_2$ (Med)
$Q_3$
$\max$
・箱:$Q_1$ から $Q_3$ まで(=中央50%)
・箱内の線:中央値 $Q_2$
・ひげ:最遠の「外れ値でないデータ」まで(後述の 1.5×IQR ルールで決まる)
・点:ひげの外にあるデータ = 外れ値として個別表示
1.5×IQR ルール:「外れ値」の客観的な定義
「他のデータより明らかに離れているか」を主観で決めるのではなく、IQR を物差しにした客観基準を使います:
次のどちらかに該当するデータは「外れ値」とみなす:
・$x < Q_1 - 1.5 \cdot \text{IQR}$(下限ライン未満)
・$x > Q_3 + 1.5 \cdot \text{IQR}$(上限ライン超)
ひげは「下限・上限ライン以内の最遠データ」までです。それを超えるデータ点が 外れ値です。
点数:15, 60, 65, 68, 70, 72, 75, 78, 80, 85, 98 (11人)
$Q_1 = 65$、$Q_3 = 80$、$\text{IQR} = 80 - 65 = 15$
下限ライン:$65 - 1.5 \times 15 = 42.5$ → 15点は外れ値
上限ライン:$80 + 1.5 \times 15 = 102.5$ → 98点は範囲内
変動係数(CV)
例:身長(cm)と体重(kg)の「バラつき具合」を比べたい場合、標準偏差の単位が違うので直接比較できません。CVは「平均の何%のバラつきか」という無次元の比率なので比較できます。
ある集団のデータ:
| 変数 | 平均 $\bar{x}$ | 標準偏差 $s$ | CV = $\dfrac{s}{\bar{x}} \times 100$ |
|---|---|---|---|
| 身長 | 170 cm | 5 cm | $\dfrac{5}{170}\times 100 \approx$ 2.94% |
| 体重 | 60 kg | 8 kg | $\dfrac{8}{60}\times 100 \approx$ 13.33% |
標準偏差だけ見ると:体重 8kg vs 身長 5cm です。単位が違うので比較不可能です。
CV で比べると:身長 2.94% vs 体重 13.33% → 体重のほうが約4.5倍バラつきが大きいと言えます。
A社の株価:平均 1000円、標準偏差 100円 → CV = 10%
B社の株価:平均 50円、標準偏差 8円 → CV = 16%
→ B社のほうが「株価が変動しやすい(リスクが大きい)」と分かります。
標準偏差の値(100円 vs 8円)だけ見ると、誤って「A社の方が動いている」と判断してしまいます。
CV は 平均が0に近い、または負の値を取りうるデータには使えません(割る数が小さすぎたり、符号が逆転すると無意味)。
気温(℃)や利益率など「正負どちらにもなりうる量」は比例尺度ではないのでCVは不適切です。CVが意味を持つのは、年収・身長・距離など「比例尺度のデータ」だけです。
指数化:基準を100にそろえて比べる
売上が 1,200万円から 1,500万円に、来客数が 800人から 1,000人に増えました。どちらの伸びが大きいでしょうか。「万円」と「人」では目盛りが違うので、そのままでは比べられません。変動係数のときと同じ発想で、単位を消してしまいます。
基準にした値(基準年、基準時点)を 100 とし、ほかの値を「基準の何%か」で表します。
指数化は時系列で複数の系列を比べるときの定番で、消費者物価指数(CPI)が代表例です。7 で成長率とセットでもう一度使います。
標準化と偏差値
「異なる試験の点数」を同じ土俵で比べる方法
Aさんは数学で72点、Bさんは英語で72点を取りました。
どちらが「クラスの中で優秀」だったのでしょうか?
(数学:クラス平均60点・標準偏差10点 / 英語:クラス平均78点・標準偏差6点)
点数が同じでも、クラスの平均や散らばり方が違えば意味が違います。そこで「クラス内での位置」を同じ尺度で表すのが標準化(z変換)です。
「自分の点がクラス平均より何標準偏差分上(下)か」を示します。z=0 が平均、z=1 なら平均より標準偏差1個分上です。
なぜ「平均を引く」のか、なぜ「標準偏差で割る」のか、公式の意味を分布図で見てみましょう。z変換は、異なる平均・異なる散らばりを持つ複数の分布を、すべて「同じ位置・同じ形」に揃えるための2段階の操作です。
上の3つは左右対称の分布でしたが、年収のように右へ歪んだ分布でも標準化はできます(各値から平均を引いて標準偏差で割るだけの操作だから)。ただし、そろうのは中心と幅だけです。歪み(形)はそのまま残ります。
中心と幅はそろいますが、右に裾を引いた形はそのままです。
→ だから「標準化=正規分布(釣鐘型)になる」ではありません。標準正規分布 $N(0,1)$ になるのは、元がもともと正規分布だったときだけです。この先の「偏差値 → 上位何%」も、元が正規分布に近いことを前提にした目安で、強く歪んだデータでは実際の割合とズレます。
z スコアを「平均50・標準偏差10」の尺度に変換したものです。日本の入試でお馴染みの指標です。
偏差値 $= 50 + 10 \times 1.2 = \mathbf{62}$
偏差値 $= 50 + 10 \times (-1.0) = \mathbf{40}$
→ 同じ72点でも、Aさんの方がクラス内では優秀だったことが分かります。
偏差値・zスコア 計算機
グラフは正規分布を仮定(実際の分布とは異なる場合があります)
分布の形(歪度・尖度)
3観点の最後:分布の「形」を1つの数値に圧縮する
2 で「右に裾が長い」「左に偏っている」などを絵で見ました。ここではその「形」を数値で表す方法を学びます。
ポイントは、直前の 5 で学んだ標準化(zスコア $z=\dfrac{x-\bar{x}}{s}$)です。すべてのデータを「平均0・標準偏差1」の共通スケールに直してから、$z$ を3乗・4乗して平均するだけです。これで分布の「形」が1つの数値になります。
① 歪度(Skewness):左右どちらに偏っているか
3乗は奇数乗なので符号が残り、裾が伸びた側の符号になります。
右に裾が長い → 歪度>0 / 左に裾が長い → 歪度<0 / 左右対称 → 歪度=0
山(最頻値)の反対側に長い裾が伸びます。裾の向きがそのまま歪度の符号になります。
- 歪度 > 0(右に裾が長い):最頻値 < 中央値 < 平均(裾の方向に平均が引っ張られる)
- 歪度 = 0(対称):3つとも一致
- 歪度 < 0(左に裾が長い):平均 < 中央値 < 最頻値
② 尖度(Kurtosis):とがり具合・裾の重さ(外れ値の出やすさ)
4乗は偶数乗なので全部プラスになり、向きは関係なく外れ値の出やすさ(裾の重さ)を測ります。
正規分布だと $z^4$ の平均がちょうど3なので、−3 して正規分布を0の基準に合わせます。
3つとも標準偏差は同じです。尖度が低いと中心が平らで裾がすぐ切れ、高いと中心が尖って裾が長く伸びます。
尖った分布は「中心にギュッと密集」と「たまに遠くへポツンと外れる」の同居です。ふだんは平均のすぐ近く、でも時々ドカンと外れ値が出ます。この「遠くの外れ値の出やすさ」が“裾の重さ”です。たとえば株価の1日の変動率は、ほとんどの日は 0% 近くに密集しますが、たまに暴落・暴騰するので尖度が高くなります。
「裾が重い」と聞くとバラつきが大きいことだと思いがちですが、この2つは測っている軸が違います。
標準偏差(SD・広がり)と尖度(裾の重さ)は測っている軸が違います。上の3パターンはすべて同じ中心・同じ標準偏差なのに尖度が違います。つまり尖度は標準偏差では区別できない“裾の重さ”を測る指標です。
- SD=分布の“平均的な幅”(単位あり:点・円など)
- 尖度=幅をそろえた後($z$ に直した後)に残る形=外れ値の出やすさ(単位なし)
グレーは基準です(SD=1)。SDを上げると山全体が横に広がって低くなります(=データが一様に散らばる)。「尖り」ではなく「幅」が変わります。
グレーは正規分布です(尖度0)。横幅(SD=1)は固定したまま、尖度を上げると中心が尖って密集し、同時に両裾がグレー線より上へ持ち上がります(=平均から遠い値が出やすい)。下げると逆に、裾がグレー線より下がって遠い値が出にくくなります。
時系列データ
時間順に並んだデータの「流れ」と「傾向」を読む
時系列データには3つの成分が混在しています。
① トレンド
長期的な増減傾向です。「毎年売上が増えている」など
② 季節変動
1年周期など規則的な変動です。「夏に気温が上がる」
③ 不規則変動
ランダムなノイズです。予測不可能な変動
指数化と成長率:時系列を「基準年=100」で読む
4 で見た指数化は、時系列でこそ本領を発揮します。ある年を基準(=100)にすると、その後の指数はそのまま「基準年からの伸び」になります。指数が 110 なら基準年から 10% 増、95 なら 5% 減です。
| 年 | 売上(万円) | 指数(2020年=100) | 前年比の成長率 |
|---|---|---|---|
| 2020 | 1,200 | 100 | … |
| 2021 | 1,320 | 110 | +10% |
| 2022 | 1,188 | 99 | −10% |
| 2023 | 1,366 | 113.8 | +15% |
※ 指数 = その年の売上 ÷ 2020年の売上 × 100。成長率 = (今年 − 前年)÷ 前年。
成長率は毎年変わるので、「平均して年に何%伸びたか」を出すときは幾何平均(3)を使います。3年間で指数が 100 から 113.8 になったので、年平均成長率は $\sqrt[3]{1.138} \approx 1.044$、つまり年 4.4% です。単純平均の $(10-10+15)\div 3 = 5\%$ とは一致しません。
移動平均(Moving Average)
直近 $k$ 個のデータの平均を連続して計算することで、ノイズを取り除いてトレンドを見やすくする手法です。
データ例:各月の平均気温(℃)
3ヶ月移動平均:季節変動が少し平滑化されます
- 窓幅 $k$ が大きいほど平滑化され、トレンドが見えやすくなる
- 窓幅が大きすぎると、直近の変化を見逃す
- $k$ 項移動平均を計算すると、最初の $k-1$ 個はデータが得られない
自己相関:「過去が現在にどれだけ影響するか」
時系列データの大きな特徴は、「今日の値」が「昨日の値」と関係していることが多いことです。気温・株価・売上などはたいてい、隣接時刻が似た値をとります。これを定量化するのが自己相関係数(autocorrelation)です。
自己相関係数は、$y_t$ と $y_{t-k}$($k$ 期前の値)のピアソン相関です。同じ時系列の「自分自身の過去」との相関を測ります。
・$r_1$(ラグ1)が大きい → 1期前の値が現在に強く影響(持続性あり)
・$r_{12}$ が大きい → 12期前と同じパターン(月次データなら年周期)
・全ラグでほぼ0 → 各時刻が独立(ホワイトノイズ的)
ラグ $k$ ごとの自己相関係数 $r_k$ を棒グラフにしたものをコレログラムと呼びます。気温データなど季節性のあるデータでは特徴的なパターンが出ます。
月次平均気温のコレログラム例です。ラグ12(1年)でほぼ +1 になっていて、季節性が強いことが見えます。
→ トレンドがある(持続的)
→ 季節性あり(ラグ12が高い=年周期)
→ ホワイトノイズ(過去が現在に影響しない)
不平等度の指標(ローレンツ曲線・ジニ係数)
「分配がどれだけ偏っているか」を1つの数字で表す
所得・資産・売上シェアなどの分布で「どれだけ偏っているか」を測りたい場面はよくあります。これは「広がり」とは別の観点で、累積(積み上げ)で見るのがポイントです。
ローレンツ曲線(Lorenz Curve)
人を所得の低い順に並べ、横軸=「累積人口比」、縦軸=「累積所得比」をプロットした曲線です。
完全平等なら 45度線になり、不平等なほど 45度線から下に膨らみます。たとえば横軸 50% のときに縦軸が 20% なら、「下位 50% の人が全所得の 20% しか受け取っていない」という意味です。
ジニ係数(Gini Coefficient)
ローレンツ曲線をたった1つの数字で要約したものがジニ係数です。45度線と曲線の間の面積を、三角形(45度線の下の面積=1/2)に対する比率で表します。
範囲:$0 \leq G \leq 1$
・$G = 0$:完全平等(全員同じ所得)
・$G = 1$:完全不平等(1人が全部独占)
上と同じ「累積人口比 × 累積所得比」のローレンツ曲線から出した値です。国民の間で所得がどれだけ偏っているかを表します。
| 分類 | ジニ係数 | 例 |
|---|---|---|
| 低い(平等寄り) | 0.25 〜 0.30 | 北欧諸国(デンマーク・スウェーデンなど) |
| 中程度 | 0.30 〜 0.40 | 多くの先進国、日本、米国 |
| 高い(不平等) | 0.40 〜 0.50 | 中国、新興国 |
| 非常に高い | 0.50 以上 | 南アフリカ、ブラジルなど |
※ いずれも税や社会保障による再分配のあとの所得で見た値です。日本は約 0.33(OECD)〜0.38(厚労省「所得再分配調査」)で中程度です。 再分配前の所得で測ると同じ国でも大きく上がる(日本の当初所得は約 0.57)ので、数字を比べるときは「再分配の前か後か」を必ず確認します。
5人の所得が 100, 200, 300, 400, 500 万円だとします(総所得 1500 万円)。
所得の低い順に並べ、人数と所得を「累積」していきます。
| 所得(万円) | 100 | 200 | 300 | 400 | 500 |
|---|---|---|---|---|---|
| 累積所得(万円) | 100 | 300 | 600 | 1000 | 1500 |
| 累積人数比 $p$ | 20% | 40% | 60% | 80% | 100% |
| 累積所得比 $q$ | 6.7% | 20% | 40% | 66.7% | 100% |
表の $(p,\;q)$ を点として打ち、順に直線で結ぶと この5人のローレンツ曲線になります:
曲線は最初ゆるやか(所得の少ない人)→ 終盤で急になります(所得の多い人)。45度線から下に膨らむほど不平等です。あとは色のついた面積Aを測るだけ:
$B = 0.2\times\dfrac{0+0.067}{2} + 0.2\times\dfrac{0.067+0.2}{2} + 0.2\times\dfrac{0.2+0.4}{2} + 0.2\times\dfrac{0.4+0.667}{2} + 0.2\times\dfrac{0.667+1}{2} \approx 0.367$
面積 $A = 0.5 - B = 0.5 - 0.367 = 0.133$
$\;\;\Rightarrow\;\; G = 2A = 2\times0.133 \approx \mathbf{0.27}$
もし5人の所得が全員同じ(300万円ずつ)なら曲線は45度線と一致し、面積A=0 → $G=0$(完全平等)になります。