須多先生
解説動画では「データの前処理」について説明されていましたね
いかがでしたか?
須多先生
解説動画では「データの前処理」について説明されていましたね
いかがでしたか?
深田 あい
データをきれいに整えるのが前処理なんですね
徳井 天
ちゃんと前処理してあげないと予測の精度が下がるというのは意外だったよ
AIは賢そうだけど どんなデータでも理解できるわけじゃないんだな
須多先生
その通りです
前処理はデータを整理整頓する作業です
この手順を「データクレンジング」または「データクリーニング」と呼ぶこともあります
深田 あい
なんだか お掃除みたいですね
徳井 天
さっそくデータの前処理をやってみたいけど まだ図書室のデータは手に入れてないからな…
先生 どうしたらいいですか?
須多先生
それでは 徳井さんは次回のレッスンまでに図書室の新作の予約件数に関するデータを手配していただけますか?
徳井 天
分かりました
図書委員の友達と 図書館の先生に相談してみます
深田 あい
データが手に入るまでの間 私たちは何をすれば良いでしょうか
須多先生
それではサンプルデータを使って Pythonでデータの前処理に関する練習をしてみましょうか?
徳井 天
いいですね
まずは簡単なデータで試してみて 図書室のデータが手に入ったら本番というわけですね
深田 あい
まずは 動画で取り上げられていた「欠損値」や「外れ値」「カテゴリデータ」などの扱いを練習するのでしょうか
須多先生
いえ
その前に これから大量のデータを扱うことが多くなりますので それらを効率よく扱う技術から学びます
深田 あい
えっと 大量のデータを扱うために以前はPythonのリストを学びましたが 今回もリストを使うのでしょうか?
須多先生
いえ ここではリストよりも多機能なライブラリであるpandas(パンダス)やnumpy(ナンパイ)を紹介します
徳井 天
「ぱんだす」と「なんぱい」?また新しいライブラリの登場ですね
どんな機能があるのか楽しみだ
須多先生
これらのライブラリは リストにはない様々な機能を持っており データ分析作業を格段に効率化してくれます
須多先生
では ここからはみんなで【スライド】を見ながらPythonのリストとpandas(パンダス)やnumpy(ナンパイ)について学びましょう