人口データで学ぶ代表値

今回は、e-Stat(政府統計の総合窓口)で公開されている 市町村別の人口データと作成したグラフから、全国の市町村の人口を表すデータとして、どの代表値が適切か考えていきます。

市町村は数が多いため、平均との差・外れ値・分布などがはっきり表れます。 そこで、代表値(平均・中央値)と ヒストグラムを使って、人口の分布の特徴を読み取ります。

学習の手順は次のとおりです。

手順

  • ① データの確認をする
  • ② データの尺度を確認する
  • ③ 代表値を求める
  • ④ グラフから読み取れることを考察する(次のスライド)

① データを確認するから始めていきましょう。

① データを確認する

データを確認して、今回の分析に必要なデータがあるか、不要なデータがないか確認します。

まず、指定したURLからCSVデータをダウンロードしてGoogleスプレッドシートで開いて確認します。

データ確認の手順

  • 1. 市町村人口データをダウンロードする
  • 2. CSVファイルをGoogleドライブにアップロードする
  • 3. スプレッドシートを使ってファイルを開く
  • 4. 必要なデータがあるか、不要なデータがないか確認する

1. 市町村人口データをダウンロードする

最初に今回利用するデータをダウンロードします。
次の市町村人口データファイル「ip0404data.csv」ファイルをダウンロードしましょう。

市町村人口データ


2. CSVファイルをGoogleドライブにアップロードする

ダウンロードしたファイル「ip0404data.csv」をGoogleドライブにドラッグしてアップロードします。


3. スプレッドシートを使ってファイルを開く。

アップロードしたファイルを右クリックし、メニューからスプレッドシートで開きます。

開くと次のようにデータが表示されます。


4. 必要なデータがあるか、不要なデータがないか確認する

データがたくさんありますね。 そのまま使っていいですか?

まず考えてみましょう。

今回の目的は何ですか?

今回の目的

市町村ごとの人口を分析すること

じゃあ、市町村じゃない行は必要ないですね。

考えるポイント

  • 「合計」の行は必要?
  • 市区町村名が「-」の行は?
  • 県全体の人口は今回使う?

目的に合わないデータは削除します。

フィルタを使って「ー」を抽出し、抽出したデータを選択して全て削除しましょう。

データの削除手順

  • 1. 「市区町村名」列を「ー」のデータでフィルタを設定する
  • 2. 抽出されたデータをすべて選択し削除する

削除後のデータ件数(最終行の行番号 - 1)を答えてください。
※先頭行には項目が入っているので、データ件数は行番号から1を引いて求めます。

参 考

データの確認ではこの他に欠損データはないかなどの確認を行います。

主な確認項目は次のとおりです。

確認すること

  • 人口は数値として認識されているか
  • 空白や「-」はないか
  • 計算(合計・平均)が正しくできるか

今回は、確認済みのデータなので上記の確認は不要です。

② データの尺度を確認する

次に、分析に使うデータがどんな種類(尺度)なのかを確認します。

尺度が分かると、できる計算や向いているグラフが分かります。

尺度確認の手順

  • 1. 今回使う列を確認する
  • 2. 人口データの尺度を考える

1. 今回使う列を確認する

今回は、市町村ごとの人口を分析します。

そのため、主に「市区町村名」と「総人口」を使います。

「男」「女」もありますが、今回は使わなくてもいいんですか?

はい。今回はまず総人口で分布を見ます。


2. 人口データの尺度を考える

人口って数なので、量的データですよね?

その通りです。

さらに、人口は「0人」が意味を持ち、 「2倍」などの比も意味があります。

だから人口は比例尺度です。

人口が比例尺度だといえる理由

  • 差が意味を持つ(100人多い、など)
  • 0が意味を持つ(0人=人がいない)
  • 比が意味を持つ(2000人は1000人の2倍)

人口が0の市町村がいくつあるか調べて答えてください。

③ 代表値を求める

次に、市町村の人口データから代表値を求めます。

代表値を求めると、データ全体の「だいたいの大きさ」をつかむことができます。

代表値には、「最頻値」、「中央値」、「平均値」がありましたが、人口の分布を調べるときに使えそうな代表値はどれですか?

うーん⋯平均値かな? 人口を全部足して割れば「ふつう」が分かりそう。

でも、市町村って大都市もあるし、人口が少ない町も多そう⋯。 平均でただしく分布がわかるかな?

いい視点です。

市町村の人口は、人口がとても多い一部の市があるので、 平均値は外れ値の影響を受けやすいです。

だからまずは、中央値を使うと「ふつうの市町村」に近い値がつかめます。

じゃあ最頻値はどうですか? いちばん多い人口の市町村って分かりそうです。

最頻値は「いちばんよく出てくる値」ですが、 人口のように数が細かく分かれるデータでは、 同じ値がたくさん出るとは限りません。

そのため、人口データでは最頻値は使いにくいことが多いです。

平均値と中央値をそれぞれ求めてどのような値が求まるか確認しましょう。

2. 平均値を求める(AVERAGE)

平均値は、データを全部足して件数で割った値です。

スプレッドシートでは、AVERAGE関数で求められます。

今回はセルG1に平均値を求めます。

平均値の求め方(例)

例:=AVERAGE(E2:E2227)

※範囲(E2:E2227)は自分のデータに合わせて変えます。

セルG1への入力例

=AVERAGE(E2:E2227)
AVERAGE関数で平均値を求める

平均値(整数部分のみ)の値を答えてください。

3. 中央値を求める(MEDIAN)

中央値は、データを小さい順に並べたときの真ん中の値です。

スプレッドシートでは、MEDIAN関数で求められます。

今回はセルG2に中央値を求めます。

中央値の求め方(例)

例:=MEDIAN(E2:E2227)

※範囲(E2:E2227)は自分のデータに合わせて変えます。

セルG2への入力例

=MEDIAN(E2:E2227)
MEDIAN関数で中央値を求める

中央値(整数部分のみ)の値を答えてください。

4. 平均値と中央値を比べる

平均と中央値、どっちを使えばいいんですか?

データの特徴によります。

外れ値のところでも説明しましたが、次の例を確認しましょう。

人口が10万人の都市が9都市、100万人の都市が1都市あったとします。

平均値

(10万 ✕ 9 + 100万 ✕ 1) ÷ 10 = 19万人

中央値

10万,10万,10万,10万,10万,10万,10万,10万,10万,100万

データ数が10個なので5番目の値と6番目の値の平均を計算します。

(10万 + 10万) ÷ 2 = 10万人

平均値と中央値で2倍くらい違ってますね。

はい、そうです。

それでは、平均値の19万人と中央値の10万人のうちどちらの値が、普通の都市の人口に近いですか?

あっ!ほとんどの都市が10万人なので、中央値の方が多くの都市の人口にマッチしてますね。

よく気づきましたね。

今回は、100万人という大きな値が、平均を強く引き上げています。

極端なデータ(外れ値)がある場合は、平均値より中央値のほうが実態を表しやすくなります。

あなたのデータでは、平均値と中央値はどちらが大きくなりましたか?

その理由を「外れ値」という言葉を使って説明してください。

考えるポイント

  • 平均値と中央値はどのくらい違う?
  • 大都市(外れ値)の影響はありそう?

最大 300 文字

人口の平均値と中央値が計算できました。日本の人口は約1億2400万人(2025年1月1日現在)います。

「ふつうの市町村の人口」を表すデータとして平均値と中央値のどちらが適切だと思いますか?

選んだ理由を記入してください。

最大 300 文字

次は、ヒストグラムで分布を見て「なぜ平均と中央値が違うのか」を確認します。

※この再現版では提出は行いません(送信先は未接続です)

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる