須多先生

解説動画では「自然言語処理によるテキスト分析」について説明されていましたね
いかがでしたか?

深田 あい

正しくデータの前処理を行うことが 正確なテキスト分析につながることが分かりました

徳井 天

アンケートの自由記述以外にも ニュース記事やレポートの要約をしたり いろんなところでテキスト分析が活用されているんだな

須多先生

この技術を効果的に使いこなすことで 情報を迅速に把握して作業の効率を大きく向上させることができますよ

深田 あい

アンケートの自由記述のテキスト分析も まずはデータの前処理から始めるということですね

須多先生

はい その通りです
次のアクティビティでは 実際にみなさんに「データの前処理」を行なってもらいます

徳井 天

データの前処理については 解説動画で説明されていたよな
えっと 前処理で最初にやることは…

徳井 天

そうだ!特定の記号や 余分な空白とかの 分析に必要のない情報を取り除く 「ノイズの除去」を行うんだったよな

須多先生

はい その通りです
自由記述のアンケートデータは人の手で入力されているため どうしても誤字脱字など 不要な文字や記号が含まれていることがあります

須多先生

その不要な記号や文字を「ノイズの除去」で取り除き データをキレイにすることで AIによる正確な分析ができるようになります

深田 あい

AIによる分析のために 「ノイズの除去」は大事な工程なんですね
頑張ります!

須多先生

さらにレッスンの後半では Bag of Words(バッグ・オブ・ワーズ) という技術を使って アンケートのテキストデータを数値化します

深田 あい

バッグ…オブ…ワーズ?難しそうな用語ですね…テキストデータの数値化って 具体的にはどういう数値にするのでしょうか?

須多先生

Bag of Wordsは テキスト内に含まれる単語ごとに出現回数を数えて数値化する技術です 

須多先生

例えば「肉」「魚」などのキーワードが 文章の中にどれくらい含まれているかを数えます

徳井 天

なるほど キーワードの出現回数を調べれば どのキーワードがどれくらい重要かが分かるってことだな

須多先生

はい その通りです
難しそうな用語ですが 実はとてもシンプルで分かりやすい手法なので みんなで一緒に頑張りましょうね

須多先生

それでは STAR Colabの演習を用意しましたので 次のアクティビティの指示に従って進めてください

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる