学習の手順は次のとおりです。
手順
- ① データの確認をする
- ② データの尺度を確認する
- ③ 代表値を求める
- ④ グラフから読み取れることを考察する(次のスライド)
① データを確認するから始めていきましょう。
情報活用編プラス
第5章「データの活用」
IP04-04
グラフからデータを読み解こう(データの可視化)
今回は、e-Stat(政府統計の総合窓口)で公開されている 市町村別の人口データと作成したグラフから、全国の市町村の人口を表すデータとして、どの代表値が適切か考えていきます。
市町村は数が多いため、平均との差・外れ値・分布などがはっきり表れます。 そこで、代表値(平均・中央値)と ヒストグラムを使って、人口の分布の特徴を読み取ります。
学習の手順は次のとおりです。
手順
① データを確認するから始めていきましょう。
データを確認して、今回の分析に必要なデータがあるか、不要なデータがないか確認します。
まず、指定したURLからCSVデータをダウンロードしてGoogleスプレッドシートで開いて確認します。
データ確認の手順
最初に今回利用するデータをダウンロードします。
次の市町村人口データファイル「ip0404data.csv」ファイルをダウンロードしましょう。
ダウンロードしたファイル「ip0404data.csv」をGoogleドライブにドラッグしてアップロードします。
3. スプレッドシートを使ってファイルを開く。
アップロードしたファイルを右クリックし、メニューからスプレッドシートで開きます。
開くと次のようにデータが表示されます。
データがたくさんありますね。 そのまま使っていいですか?
まず考えてみましょう。
今回の目的は何ですか?
今回の目的
市町村ごとの人口を分析すること
じゃあ、市町村じゃない行は必要ないですね。
考えるポイント
目的に合わないデータは削除します。
フィルタを使って「ー」を抽出し、抽出したデータを選択して全て削除しましょう。
データの削除手順
削除後のデータ件数(最終行の行番号 - 1)を答えてください。
※先頭行には項目が入っているので、データ件数は行番号から1を引いて求めます。
データの確認ではこの他に欠損データはないかなどの確認を行います。
主な確認項目は次のとおりです。
確認すること
今回は、確認済みのデータなので上記の確認は不要です。
次に、分析に使うデータがどんな種類(尺度)なのかを確認します。
尺度が分かると、できる計算や向いているグラフが分かります。
尺度確認の手順
今回は、市町村ごとの人口を分析します。
そのため、主に「市区町村名」と「総人口」を使います。
「男」「女」もありますが、今回は使わなくてもいいんですか?
はい。今回はまず総人口で分布を見ます。
人口って数なので、量的データですよね?
その通りです。
さらに、人口は「0人」が意味を持ち、 「2倍」などの比も意味があります。
だから人口は比例尺度です。
人口が比例尺度だといえる理由
人口が0の市町村がいくつあるか調べて答えてください。
次に、市町村の人口データから代表値を求めます。
代表値を求めると、データ全体の「だいたいの大きさ」をつかむことができます。
代表値には、「最頻値」、「中央値」、「平均値」がありましたが、人口の分布を調べるときに使えそうな代表値はどれですか?
うーん⋯平均値かな? 人口を全部足して割れば「ふつう」が分かりそう。
でも、市町村って大都市もあるし、人口が少ない町も多そう⋯。 平均でただしく分布がわかるかな?
いい視点です。
市町村の人口は、人口がとても多い一部の市があるので、 平均値は外れ値の影響を受けやすいです。
だからまずは、中央値を使うと「ふつうの市町村」に近い値がつかめます。
じゃあ最頻値はどうですか? いちばん多い人口の市町村って分かりそうです。
最頻値は「いちばんよく出てくる値」ですが、 人口のように数が細かく分かれるデータでは、 同じ値がたくさん出るとは限りません。
そのため、人口データでは最頻値は使いにくいことが多いです。
平均値と中央値をそれぞれ求めてどのような値が求まるか確認しましょう。
平均値は、データを全部足して件数で割った値です。
スプレッドシートでは、AVERAGE関数で求められます。
今回はセルG1に平均値を求めます。
平均値の求め方(例)
例:=AVERAGE(E2:E2227)
※範囲(E2:E2227)は自分のデータに合わせて変えます。
セルG1への入力例
=AVERAGE(E2:E2227)
平均値(整数部分のみ)の値を答えてください。
中央値は、データを小さい順に並べたときの真ん中の値です。
スプレッドシートでは、MEDIAN関数で求められます。
今回はセルG2に中央値を求めます。
中央値の求め方(例)
例:=MEDIAN(E2:E2227)
※範囲(E2:E2227)は自分のデータに合わせて変えます。
セルG2への入力例
=MEDIAN(E2:E2227)
中央値(整数部分のみ)の値を答えてください。
平均と中央値、どっちを使えばいいんですか?
データの特徴によります。
外れ値のところでも説明しましたが、次の例を確認しましょう。
人口が10万人の都市が9都市、100万人の都市が1都市あったとします。
平均値
(10万 ✕ 9 + 100万 ✕ 1) ÷ 10 = 19万人
中央値
10万,10万,10万,10万,10万,10万,10万,10万,10万,100万
データ数が10個なので5番目の値と6番目の値の平均を計算します。
(10万 + 10万) ÷ 2 = 10万人
平均値と中央値で2倍くらい違ってますね。
はい、そうです。
それでは、平均値の19万人と中央値の10万人のうちどちらの値が、普通の都市の人口に近いですか?
あっ!ほとんどの都市が10万人なので、中央値の方が多くの都市の人口にマッチしてますね。
よく気づきましたね。
今回は、100万人という大きな値が、平均を強く引き上げています。
極端なデータ(外れ値)がある場合は、平均値より中央値のほうが実態を表しやすくなります。
あなたのデータでは、平均値と中央値はどちらが大きくなりましたか?
その理由を「外れ値」という言葉を使って説明してください。
考えるポイント
最大 300 文字
人口の平均値と中央値が計算できました。日本の人口は約1億2400万人(2025年1月1日現在)います。
「ふつうの市町村の人口」を表すデータとして平均値と中央値のどちらが適切だと思いますか?
選んだ理由を記入してください。
最大 300 文字
次は、ヒストグラムで分布を見て「なぜ平均と中央値が違うのか」を確認します。
※この再現版では提出は行いません(送信先は未接続です)