須多先生

みなさん こんにちは
本日も一緒に人工知能について学びましょう

須多先生

前回は 「強化学習」によるAIの学習方法を詳しく学び 「三目並べ」をプレイするAIで理解を深めましたね

深田 あい

「強化学習」では AIが取る「行動」に対して 「良い行動」「悪い行動」を評価するために「報酬」を与えたんだよね

徳井 天

その「報酬」によって AIは試行錯誤を繰り返すことで どんどんかしこくなっていくんだったよな

須多先生

AIが目的を達成するための最適な学習をさせるためには 人間が適切な「報酬」を考えることが重要です
これを「報酬設計」と言いましたね

深田 あい

「三目並べ」では AIが勝ったら「プラスの報酬」 負けたら「マイナスの報酬」を与えて訓練させましたよね

徳井 天

そして報酬によって盤面の「評価値」が変化していって 評価値の高いマスに次の手を打つようになったな

深田 あい

三目並べと五目並べを比較して 強化学習のPythonプログラムはそこまで変わらなかったのが意外でした

須多先生

ルールベースでは 判定するマスの数だけ プログラムを書く必要がありましたが 強化学習ではAIが自ら学ぶため プログラムの量や内容に大きな違いはないんですよ

徳井 天

AIが自分で学ぶ「強化学習」って本当にすごいよな
自動運転とか 二足歩行ロボットとか いろんな場面で使われているんだもんな

深田 あい

「チャットボット」や「生成AI」などの LLMを使った「会話型AI」にも「強化学習」が使われてるって 前回のレッスンで学んだよね

徳井 天

えっと確か…その「会話型AI」ってのは 人間と話しているような 自然な会話をすることができたんだよな

深田 あい

「言語編」でのレッスンでは 「強化学習」に関する用語は使われていなかったと思いますが どのように使われているんですか?

須多先生

「会話型AI」が より人間らしい回答をするために 人間による評価を「報酬」として学んでいるんですよ

須多先生

それでは次のスライドで 「『強化学習』で進化する『会話型AI』」について学びましょう

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる