分散とは、データ全体が平均からどれくらい散らばっているかを表す値です。
箱ひげ図やヒストグラムで、データの散らばりは見えるようになったね。
このスライドの学習内容
箱ひげ図やヒストグラムで、データの散らばりは見えるようになったね。
グラフを使うと大まかには分かるけれど、「どちらの散らばりが大きいか」を数字で比べることはできないのかな?
良いところに気づきました。
散らばりの大きさを数値で表す方法があります。
それが 分散と 標準偏差 です。
分散とは、データ全体が平均からどれくらい散らばっているかを表す値です。
分散がどういうことなのか、具体的に次の2つのクラスのテストの得点例で確認しましょう。
例:テストの点数
クラスAの得点
| 48 | 49 | 50 | 51 | 52 |
平均 = 50
このデータは、ほとんどが平均の近くにありますね。
はい。
つまり散らばりは小さいと言えます。
クラスB
| 30 | 40 | 50 | 60 | 70 |
平均 = 50
クラスAと比べると平均から離れた得点があるね。
はい。
つまり散らばりは大きいと言えます。
続いて、箱ひげ図とヒストグラムを見てみましょう。
箱ひげ図とヒストグラム(クラスA / クラスB)
グラフにすると、どっちのデータが散らばっているかがよく分かるな。
データだけだとなんとなくしかわからないけれど、グラフだとよりはっきり分かるね。
では、データとグラフを見て「クラスA」と「クラスB」はデータの散らばり方はどのぐらい違っているか説明できますか?
うーん⋯。クラスBのほうが散らばっているのは分かるけれど、どれくらい散らばりが違うのかはうまく説明できないな。
確かに。クラスAは点数が50の近くに集まっていて、クラスBはいろいろな点数があることはわかるけれど⋯。
でも「どれくらい散らばっているか」はどう表せばいいんだろう⋯。
そうですね。
グラフを見ると、どちらが散らばっているかは見た目では分かります。
しかし、 散らばりの大きさを正確に比べることは難しいことがあります。
じゃあ、散らばりを正確に表すにはどうすればいいんですか?
いい質問ですね。
実は、データの散らばりを表す値の一つに分散があります。
分散は計算で求めることができるので、計算方法について学習しましょう。
分散ってどうやって計算するんですか?
分散は次の式で計算します。
分散の公式
分散 = (平均からの差2 の平均)
= { (データ − 平均)2 の合計 } ÷ データの数
つまり、 平均からどれくらい離れているか を計算して、その平均を求めたものです。
難しそうだな⋯。
順序よく計算すれば難しくはないですよ。
計算は次の順番で行います。
計算の手順
それでは、クラスAの分散を計算してみましょう。
クラスAのデータを使って分散を計算してみましょう。
クラスAのデータ
48, 49, 50, 51, 52
① 平均 = 50
| 得点 | ② 平均との差 | ③ (平均との差)2 |
|---|---|---|
| 48 | -2 | 4 |
| 49 | -1 | 1 |
| 50 | 0 | 0 |
| 51 | 1 | 1 |
| 52 | 2 | 4 |
表を見てみると、分散を求める手順の「③」まで終わっています。
あとは、④「2乗した値の平均を求める」を計算すれば分散が求められます。
差の2の合計
差2の合計 = 4 + 1 + 0 + 1 + 4 = 10
分散( (差の2の合計)の平均 )
分散 = 10 ÷ 5 = 2
クラスAの分散は「2」とわかりました。
クラスBの分散も同じように計算します。
クラスBのデータ
30, 40, 50, 60, 70
① 平均 = 50
| 得点 | ② 平均との差 | ③ (平均との差)2 |
|---|---|---|
| 30 | -20 | 400 |
| 40 | -10 | 100 |
| 50 | 0 | 0 |
| 60 | 10 | 100 |
| 70 | 20 | 400 |
差の2の合計
差2の合計 = 400 + 100 + 0 + 100 + 400 = 1000
分散( (差の2の合計)の平均 )
分散 = 1000 ÷ 5 = 200
クラスAは分散が2で、クラスBは200ですか。
100倍も違うんですね!
ただし、散らばりが100倍というわけではありません。
分散は 平均との差を2乗して計算 しているからです。
2乗しているから数字が大きくなるんですね。
そうです。
クラスAは平均から最大でも 2点 しか離れていません。
でもクラスBは平均から 最大20点 も離れています。
平均との差の大きさ
→ 約10倍の差がある
分散はこの差を 2乗して計算 しています。
そのため、
10倍 × 10倍 = 100倍
という大きな数字になるのです。
なるほど。
散らばりが大きいほど、 分散も大きくなるんですね。
その通りです。
分散を使うと、 グラフを見なくてもデータの散らばりを比較 できます。
でも、200っていう数字は ちょっと大きすぎて分かりにくい気がします。
いいところに気がつきましたね。
分散は差を 2乗 しているので、 少し分かりにくい値になることがあります。
そこで統計では、 分散をもとにして もっと分かりやすくした値 を使います。
もっと分かりやすい値があるんですか?
はい。
それが標準偏差です。標準偏差について学習しましょう。
標準偏差とは、データが平均からどれくらい離れているか を表す値です。
分散をもとに計算される値で、分散の平方根をとって求めます。
分散はデータの散らばりを表す値ですが、差を2乗して計算しているため、数値が大きくなり、少し分かりにくいという特徴があります。
そこで使われるのが標準偏差です。
たしかに⋯。分散で100倍違っても実際は10倍の差でしたし⋯
数字だけ見てもイメージしにくいですね。
標準偏差は、 データが平均からどれくらい離れているかを、分かりやすく表した値です。
標準偏差を計算して確かめましょう。
分散は「平均との差を2乗」して計算しているため、 数値が大きくなり、実際の散らばりをイメージしにくくなります。
そこで、分散の平方根をとって、 元のデータと同じ単位に戻したものが標準偏差です。
標準偏差の計算式
標準偏差 = √(分散)
先ほど求めたクラスAの分散を使って計算してみましょう。
クラスAの場合
分散 = 2
標準偏差 = √2 ≒ 1.41
この「1.41」が標準偏差ってことだけど、どういう意味があるのかな⋯。
クラスAの得点は、平均からだいたい「1.4」点くらい離れていることが多いということです。
クラスAの得点と平均点との差を求めてみます。
クラスAの得点と平均点の差
クラスAのそれぞれの得点は、1~2点離れています。
1~2点離れていることを数値化した値が標準偏差(1.4)です。
標準偏差から、クラスAの得点は、平均からだいたい「1.4」点くらい離れていることが多いことを表しています。
標準偏差を使うと、 平均のまわりにどのくらいの割合のデータが入っているのか を知ることができます。
多くのデータは、平均の近くに集まり、 平均から離れるほど少なくなる形になります。
このような形の分布を 正規分布 といいます。
あれ?このグラフ、見たことがある気がします。
私も見たことがあります。
テストの成績とかでよく出てくる形ですよね。
よく気が付きましたね。
このような形のグラフを 正規分布 といいます。
正規分布は、とてもよく使われる分布です。
テストの成績、身長、体重、測定データなど、 多くのデータがこのような形に近くなります。
真ん中が一番高くて、 左右にいくほど低くなっていますね。
しかも、左右が同じ形になっています。
その通りです。
正規分布には、次のような特徴があります。
正規分布の特徴
正規分布と標準偏差を組み合わせるとデータのうちどの範囲のどのくらいのデータが含まれているかがわかります。
えっ!標準偏差を使うと、データの個数がわかるの?
そうです。正規分布の場合、平均から標準偏差1つ分、2つ分と広げていくと、その範囲にどのくらいの割合のデータが入るかが分かります。
標準偏差(σ)とデータの割合
正規分布では、平均から左右に標準偏差の分の範囲に約68%のデータが含まれることがわかっています。
半分以上のデータがその範囲に入っているのか!結構狭い範囲にたくさんのデータがあるんだな。
そうだよね。
正規分布の場合はどんな場合でも当てはまるんですか?
はい、そうです。ほとんどの場合であてはまり、
標準偏差の2倍の範囲にはデータ全体の約95%のデータが含まれます。
そして、標準偏差の3倍の範囲には、データ全体の約99.7%が含まれます。
正規分布のデータと標準偏差の範囲に含まれるデータの関係は次のようになります。
| 範囲 | 含まれる割合 | 意味 | 使われる場面 |
|---|---|---|---|
| 平均 ± 標準偏差(1σ) | 約68% | 多くの人がいる範囲 | テストの平均的な成績 身長・体重などの平均付近 |
| 平均 ± 標準偏差の2倍(2σ) | 約95% | ほとんどの人がいる範囲 | 医療データの正常範囲 統計調査の分析 |
| 平均 ± 標準偏差の3倍(3σ) | 約99.7% | ほぼすべてのデータ | 品質管理(異常値の発見) データの異常検知 |
|
分散 |
データが平均からどれくらい散らばっているかを表す値のこと。平均との差を2乗して求める。 |
|
標準偏差 |
データが平均からどれくらい離れているかを表す値のこと。分散の平方根をとって求める。 |
|
正規分布 |
平均の近くに多くのデータが集まり、左右対称の山形になるデータの分布のこと。 |
偏差値とは
学校のテストや模試でよく見る 偏差値は、 平均と標準偏差 を使って計算されています。
偏差値は、 自分の点数が全体の中でどの位置にあるか を表す数値です。
偏差値 = 50 + 10 × (得点 − 平均) ÷ 標準偏差
えっ!偏差値って標準偏差を使っていたんですか!
そうなんです。
平均が50になるように計算して、 自分の位置を分かりやすく表しています。
偏差値の目安
| 偏差値 | 意味 | おおよその位置 |
|---|---|---|
| 70 | 平均よりかなり高い | 上位 約2〜3% |
| 60 | 平均より高い | 上位 約15% |
| 50 | 平均 | ちょうど真ん中 |
| 40 | 平均より低い | 下位 約15% |
| 30 | 平均よりかなり低い | 下位 約2〜3% |
偏差値70って、かなり上の方なんですね!
そうですね。偏差値は標準偏差をもとに計算されているので、平均からどれくらい離れているかが分かります。
例えば、偏差値60は平均より標準偏差1つ分上にあることを意味しています。