データの散らばりを見る分散と標準偏差

このスライドの学習内容

  • 1. 分散とは何?
  • 2. 分散を計算しよう
  • 3. 標準偏差とは何?
  • 4. 標準偏差とデータの割合

箱ひげ図やヒストグラムで、データの散らばりは見えるようになったね。

グラフを使うと大まかには分かるけれど、「どちらの散らばりが大きいか」を数字で比べることはできないのかな?

良いところに気づきました。

散らばりの大きさを数値で表す方法があります。

それが 分散と 標準偏差 です。

1. 分散とは何?

分散とは、データ全体が平均からどれくらい散らばっているかを表す値です。

分散がどういうことなのか、具体的に次の2つのクラスのテストの得点例で確認しましょう。

例:テストの点数

クラスAの得点

48 49 50 51 52

平均 = 50

このデータは、ほとんどが平均の近くにありますね。

はい。

つまり散らばりは小さいと言えます。

クラスB

30 40 50 60 70

平均 = 50

クラスAと比べると平均から離れた得点があるね。

はい。

つまり散らばりは大きいと言えます。

続いて、箱ひげ図とヒストグラムを見てみましょう。

箱ひげ図とヒストグラム(クラスA / クラスB)

上:箱ひげ図(得点の散らばり) 下:ヒストグラム(階級ごとの人数) クラスA 0 20 40 60 80 得点 クラスB 0 20 40 60 80 得点 クラスA 0 1 2 3 30-39 40-49 50-59 60-69 70-79 人数 階級(点) クラスB 0 1 2 3 30-39 40-49 50-59 60-69 70-79 人数 階級(点)

グラフにすると、どっちのデータが散らばっているかがよく分かるな。

データだけだとなんとなくしかわからないけれど、グラフだとよりはっきり分かるね。

では、データとグラフを見て「クラスA」と「クラスB」はデータの散らばり方はどのぐらい違っているか説明できますか?

うーん⋯。クラスBのほうが散らばっているのは分かるけれど、どれくらい散らばりが違うのかはうまく説明できないな。

確かに。クラスAは点数が50の近くに集まっていて、クラスBはいろいろな点数があることはわかるけれど⋯。

でも「どれくらい散らばっているか」はどう表せばいいんだろう⋯。

そうですね。

グラフを見ると、どちらが散らばっているかは見た目では分かります。

しかし、 散らばりの大きさを正確に比べることは難しいことがあります。

じゃあ、散らばりを正確に表すにはどうすればいいんですか?

いい質問ですね。

実は、データの散らばりを表す値の一つに分散があります。

分散は計算で求めることができるので、計算方法について学習しましょう。

2. 分散を計算しよう

分散ってどうやって計算するんですか?

分散は次の式で計算します。

分散の公式

分散 = (平均からの差2 の平均)
         = { (データ − 平均)2 の合計 } ÷ データの数

つまり、 平均からどれくらい離れているか を計算して、その平均を求めたものです。

難しそうだな⋯。

順序よく計算すれば難しくはないですよ。

計算は次の順番で行います。

計算の手順

  • ① 平均を求める
  • ② それぞれのデータと平均の差を求める
  • ③ その差を2乗する
  • ④ 2乗した値の平均を求める

それでは、クラスAの分散を計算してみましょう。


クラスAの分散を計算しよう

クラスAのデータを使って分散を計算してみましょう。

クラスAのデータ

48, 49, 50, 51, 52

① 平均 = 50

得点 ② 平均との差 ③ (平均との差)2
48 -2 4
49 -1 1
50 0 0
51 1 1
52 2 4

表を見てみると、分散を求める手順の「③」まで終わっています。

あとは、④「2乗した値の平均を求める」を計算すれば分散が求められます。

差の2の合計

差2の合計 = 4 + 1 + 0 + 1 + 4 = 10

分散( (差の2の合計)の平均 )

分散 = 10 ÷ 5 = 2

クラスAの分散は「2」とわかりました。

クラスBの分散も同じように計算します。


クラスBの分散を計算しよう

クラスBのデータ

30, 40, 50, 60, 70

① 平均 = 50

得点 ② 平均との差 ③ (平均との差)2
30 -20 400
40 -10 100
50 0 0
60 10 100
70 20 400

差の2の合計

差2の合計 = 400 + 100 + 0 + 100 + 400 = 1000

分散( (差の2の合計)の平均 )

分散 = 1000 ÷ 5 = 200


クラスAは分散が2で、クラスBは200ですか。

100倍も違うんですね!

ただし、散らばりが100倍というわけではありません。

分散は 平均との差を2乗して計算 しているからです。

2乗しているから数字が大きくなるんですね。

そうです。

クラスAは平均から最大でも 2点 しか離れていません。

でもクラスBは平均から 最大20点 も離れています。

平均との差の大きさ

  • クラスA:最大 約2点
  • クラスB:最大 約20点

→ 約10倍の差がある

分散はこの差を 2乗して計算 しています。

そのため、

10倍 × 10倍 = 100倍

という大きな数字になるのです。

なるほど。

散らばりが大きいほど、 分散も大きくなるんですね。

その通りです。

分散を使うと、 グラフを見なくてもデータの散らばりを比較 できます。

でも、200っていう数字は ちょっと大きすぎて分かりにくい気がします。

いいところに気がつきましたね。

分散は差を 2乗 しているので、 少し分かりにくい値になることがあります。

そこで統計では、 分散をもとにして もっと分かりやすくした値 を使います。

もっと分かりやすい値があるんですか?

はい。

それが標準偏差です。標準偏差について学習しましょう。

3. 標準偏差とは何?

標準偏差とは、データが平均からどれくらい離れているか を表す値です。

分散をもとに計算される値で、分散の平方根をとって求めます。

分散はデータの散らばりを表す値ですが、差を2乗して計算しているため、数値が大きくなり、少し分かりにくいという特徴があります。

そこで使われるのが標準偏差です。

たしかに⋯。分散で100倍違っても実際は10倍の差でしたし⋯
数字だけ見てもイメージしにくいですね。

標準偏差は、 データが平均からどれくらい離れているかを、分かりやすく表した値です。

標準偏差を計算して確かめましょう。


標準偏差を計算してみよう

分散は「平均との差を2乗」して計算しているため、 数値が大きくなり、実際の散らばりをイメージしにくくなります。

そこで、分散の平方根をとって、 元のデータと同じ単位に戻したものが標準偏差です。

標準偏差の計算式

標準偏差 = √(分散)

先ほど求めたクラスAの分散を使って計算してみましょう。

クラスAの場合

分散 = 2

標準偏差 = √2 ≒ 1.41

この「1.41」が標準偏差ってことだけど、どういう意味があるのかな⋯。

クラスAの得点は、平均からだいたい「1.4」点くらい離れていることが多いということです。

クラスAの得点と平均点との差を求めてみます。

クラスAの得点と平均点の差

クラスAのそれぞれの得点は、1~2点離れています。

1~2点離れていることを数値化した値が標準偏差(1.4)です。
標準偏差から、クラスAの得点は、平均からだいたい「1.4」点くらい離れていることが多いことを表しています。

4. 標準偏差とデータの割合

標準偏差を使うと、 平均のまわりにどのくらいの割合のデータが入っているのか を知ることができます。

多くのデータは、平均の近くに集まり、 平均から離れるほど少なくなる形になります。

このような形の分布を 正規分布 といいます。

平均

あれ?このグラフ、見たことがある気がします。

私も見たことがあります。
テストの成績とかでよく出てくる形ですよね。

よく気が付きましたね。

このような形のグラフを 正規分布 といいます。

正規分布は、とてもよく使われる分布です。

テストの成績、身長、体重、測定データなど、 多くのデータがこのような形に近くなります。

真ん中が一番高くて、 左右にいくほど低くなっていますね。

しかも、左右が同じ形になっています。

その通りです。

正規分布には、次のような特徴があります。

正規分布の特徴

  • 平均の近くにデータが多い
  • 平均から離れるほどデータは少なくなる
  • グラフは左右対称の形になる

正規分布と標準偏差を組み合わせるとデータのうちどの範囲のどのくらいのデータが含まれているかがわかります。

えっ!標準偏差を使うと、データの個数がわかるの?

そうです。正規分布の場合、平均から標準偏差1つ分、2つ分と広げていくと、その範囲にどのくらいの割合のデータが入るかが分かります。

標準偏差(σ)とデータの割合

  • 平均 ± 標準偏差の範囲 → 約68% のデータ
  • 平均 ± 標準偏差の2倍の範囲 → 約95% のデータ
  • 平均 ± 標準偏差の3倍の範囲 → 約99.7% のデータ
平均 標準偏差 標準偏差 標準偏差 の2倍 標準偏差 の2倍 標準偏差 の3倍 標準偏差 の3倍 平均 ± 標準偏差(約68%) 平均 ± 標準偏差の2倍(95%) 平均 ± 標準偏差の3倍(99.7%)

正規分布では、平均から左右に標準偏差の分の範囲に約68%のデータが含まれることがわかっています。

半分以上のデータがその範囲に入っているのか!結構狭い範囲にたくさんのデータがあるんだな。

そうだよね。

正規分布の場合はどんな場合でも当てはまるんですか?

はい、そうです。ほとんどの場合であてはまり、

標準偏差の2倍の範囲にはデータ全体の約95%のデータが含まれます。

そして、標準偏差の3倍の範囲には、データ全体の約99.7%が含まれます。

正規分布のデータと標準偏差の範囲に含まれるデータの関係は次のようになります。

範囲 含まれる割合 意味 使われる場面
平均 ± 標準偏差(1σ) 約68% 多くの人がいる範囲 テストの平均的な成績
身長・体重などの平均付近
平均 ± 標準偏差の2倍(2σ) 約95% ほとんどの人がいる範囲 医療データの正常範囲
統計調査の分析
平均 ± 標準偏差の3倍(3σ) 約99.7% ほぼすべてのデータ 品質管理(異常値の発見)
データの異常検知
情 報 こ と ば キ ー ワ ー ド

分散

データが平均からどれくらい散らばっているかを表す値のこと。平均との差を2乗して求める。

標準偏差

データが平均からどれくらい離れているかを表す値のこと。分散の平方根をとって求める。

正規分布

平均の近くに多くのデータが集まり、左右対称の山形になるデータの分布のこと。


コラム:偏差値

偏差値とは

学校のテストや模試でよく見る 偏差値は、 平均と標準偏差 を使って計算されています。

偏差値は、 自分の点数が全体の中でどの位置にあるか を表す数値です。

偏差値 = 50 + 10 × (得点 − 平均) ÷ 標準偏差

えっ!偏差値って標準偏差を使っていたんですか!

そうなんです。

平均が50になるように計算して、 自分の位置を分かりやすく表しています。

偏差値の目安

偏差値 意味 おおよその位置
70 平均よりかなり高い 上位 約2〜3%
60 平均より高い 上位 約15%
50 平均 ちょうど真ん中
40 平均より低い 下位 約15%
30 平均よりかなり低い 下位 約2〜3%

偏差値70って、かなり上の方なんですね!

そうですね。偏差値は標準偏差をもとに計算されているので、平均からどれくらい離れているかが分かります。

例えば、偏差値60は平均より標準偏差1つ分上にあることを意味しています。

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる