須多先生

みなさん こんにちは
本日も一緒に人工知能について学びましょう

須多先生

前回は データの前処理に焦点を当てましたね

徳井 天

そうそう pandas(パンダス)の…あれ なんていう機能だったかな?

須多先生

DataFrame(データフレーム)のことですか?

徳井 天

あ そうです!DataFrameを使って前処理を行いました

深田 あい

欠損値や外れ値 そしてカテゴリデータの処理方法も学びましたよね

徳井 天

そうそう ワンホットエンコーディングだっけ?最初は慣れなくて戸惑いました

徳井 天

データの前処理が重要だということは分かるんだけど まだ慣れるまでは少し不安だな

須多先生

前処理は AIを活用したデータ分析では ほぼ必ず行う作業ですから 徐々に慣れていきましょう

深田 あい

そういえば 前のレッスンで徳井くんが言っていた図書室のデータだけど 手に入れることはできたの?

須多先生

図書室で入荷予定の新刊の予約件数をAIで予測するというのがご相談の内容でしたね
予測が可能になれば 人気の本は多めに入荷できますね

徳井 天

図書室の先生にも相談したんですが 実は 図書室からデータを持ち出すのが難しいんです

徳井 天

個人情報が含まれているし 仮に個人情報が含まれていなくてもデータ量が膨大らしくてすぐには渡せないんだって

深田 あい

そうなんだ
確かに個人情報の取り扱いは 特に注意が必要ですね

徳井 天

でも 図書室の先生に事情を話したところ 提供しても問題ないように個人情報を削除して データ量も多くならないように 過去に特に話題になった本を選んで 仮のデータを作ってくれました

須多先生

それは良いですね
実際のAI開発でも 実際のデータで取り組む前に 仮データで試すことがよくあります

深田 あい

そうなんですね

徳井 天

図書館の先生がコンピュータに詳しいので 予測に関連しそうなデータをCSVファイルで受け取ることができました

須多先生

素晴らしいですね
そのデータの中身をすでに確認しましたか?

徳井 天

はい
これです

徳井 天

「前作貸出数」というのは 同じ著者の前作がどれくらい借りられたのかだそうです

須多先生

「図書室だより」というのはどういうものですか?

徳井 天

それは毎月 図書室が発行している学内誌で その新刊が紹介されたかどうかですね

深田 あい

私も「図書室だより」は参考にしています
本の名前だけのっている場合もあれば 図書委員や図書室の先生が詳しく紹介している場合もあります

須多先生

なるほど それは興味深いですね

徳井 天

ただ 古いデータには欠損があったり 誤りが含まれている可能性があると図書室の先生が言っていました

深田 あい

それでは まずデータを確認し 必要なら前処理をする必要がありそうですね

須多先生

はい その通りです
前回のレッスンを思い出しながら 図書室のデータの前処理に挑戦しましょう

須多先生

それでは STAR Colabの演習を用意しました
次のアクティビティの指示に従って進めてください

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる