仮説を立てて検証しよう

図書室の貸出に関するデータを確認して 新刊の予約数に関する仮説を立て その仮説を検証しましょう

図書室の新刊予約数を予測する

過去の新刊の予約に関するデータを確認しましょう。

図書室では毎月何冊かの書籍を入荷しています。書籍を入荷した際に記録されたデータ50件を、事前に整理したものを用いて分析を行います。

データには、事前予約数、前作貸出数、図書室だより、そして価格が記録されています。


データ 説明
事前予約数 その本が入荷されるまでに予約された件数です。
前作貸出数 その本と同一著者の前作の貸出数です。
図書室だより 図書室で発行している「図書室だより」で、その本が取り上げられたかどうかを、以下の4つの値で表しています。
・「紹介なし」:図書館だよりで紹介されていない。
・「名称のみ」:図書室だよりで書籍名だけ紹介された。
・「委員紹介」:図書委員の担当するコーナーで紹介された。
・「先生紹介」:図書室の先生が担当するコーナーで紹介された。
価格 その本の定価です。

今回予測したいのは「新刊の事前予約数」ですので、「事前予約数」が目的変数になります。

もし「事前予約数」を説明するための変数、すなわち「説明変数」を見つけられれば、予測はより正確になるでしょう。


データの外れ値や欠損値は アクティビティで前処理をしましたね

データの確認

過去の新刊の予約に関する記録を表にして確認しましょう。件数が多い為、ここでは10件だけを表示します。


新刊の事前予約数

事前予約数 前作貸出数 図書室だより 価格
1
57
紹介なし
2,200
12
143
名称のみ
700
11
109
委員紹介
1,800
3
42
先生紹介
1,900
10
115
紹介なし
1,300
9
187
紹介なし
1,000
4
179
名称のみ
2,400
13
78
先生紹介
1,400
8
125
紹介なし
2,800
9
110
先生紹介
2,100
以下略

「前作貸出数」「図書室だより」「価格」

これらが説明変数の候補になるね

データの整理

仮説を立てる前に、利用可能なデータを整理しましょう。特に、データの可視化は仮説を立てる上で大きなヒントとなります。

まずは、事前予約数と関連するデータを表で確認し、棒グラフで可視化しましょう。


新刊の事前予約数

本によって 事前予約数はだいぶ違いますね

その原因はなんなんでしょう?

仮説を立てる

事前予約数に影響しそうな要素は何でしょうか?いくつかの仮説を考えましょう。


  • 仮説①前作貸出数:前作の貸出数が多いと、新刊の予約数も増えるのではないか?
  • 仮説②図書室だより:図書室だよりで取り上げられると、新刊の予約数も増えるのではないか?
  • 仮説③価格:高価な書籍の場合は、自分で買わずに借りようとする人が増えるのではないか?

それでは、これらの仮説をデータとともに検証しましょう。

仮説を検証する

前作貸出数、図書室だより、価格と事前予約数の関係性を、グラフで可視化して探りましょう。


前作貸出数と新刊の事前予約数(散布図)


散布図を見ると 前作貸出数と事前予約数に関係はありそう

やっぱり人気の作家さんは新刊の事前予約数も多くなりそうだね


図書室だよりと新刊の事前予約数(散布図)


図書委員や図書の先生が図書室だよりで取り上げると 事前予約数も増えているような感じがします


価格と新刊の事前予約数(散布図)


高価な書籍は 購入するよりも借りにくる人が多いかと思ったけど これを見るとあまり関係なさそうだね


ポ イ ン ト

    仮説を掘り下げよう


    仮説が実際のデータと合致した場合、その仮説をさらに深く掘り下げ、その有効性をさらに検証することが重要です。仮説が本当に正しいか、確かめるステップに進みましょう。

今回設定した仮説には いくつか有効性があるものがありましたね

次のステップとして 機械学習を用いた予測を行いましょう

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる