須多先生
みなさん こんにちは
本日も一緒に人工知能について学びましょう
須多先生
みなさん こんにちは
本日も一緒に人工知能について学びましょう
須多先生
前回は 「強化学習」によるAIの学習方法を詳しく学び 「三目並べ」をプレイするAIで理解を深めましたね
深田 あい
「強化学習」では AIが取る「行動」に対して 「良い行動」「悪い行動」を評価するために「報酬」を与えたんだよね
徳井 天
その「報酬」によって AIは試行錯誤を繰り返すことで どんどんかしこくなっていくんだったよな
須多先生
AIが目的を達成するための最適な学習をさせるためには 人間が適切な「報酬」を考えることが重要です
これを「報酬設計」と言いましたね
深田 あい
「三目並べ」では AIが勝ったら「プラスの報酬」 負けたら「マイナスの報酬」を与えて訓練させましたよね
徳井 天
そして報酬によって盤面の「評価値」が変化していって 評価値の高いマスに次の手を打つようになったな
深田 あい
三目並べと五目並べを比較して 強化学習のPythonプログラムはそこまで変わらなかったのが意外でした
須多先生
ルールベースでは 判定するマスの数だけ プログラムを書く必要がありましたが 強化学習ではAIが自ら学ぶため プログラムの量や内容に大きな違いはないんですよ
徳井 天
AIが自分で学ぶ「強化学習」って本当にすごいよな
自動運転とか 二足歩行ロボットとか いろんな場面で使われているんだもんな
深田 あい
「チャットボット」や「生成AI」などの LLMを使った「会話型AI」にも「強化学習」が使われてるって 前回のレッスンで学んだよね
徳井 天
えっと確か…その「会話型AI」ってのは 人間と話しているような 自然な会話をすることができたんだよな
深田 あい
「言語編」でのレッスンでは 「強化学習」に関する用語は使われていなかったと思いますが どのように使われているんですか?
須多先生
「会話型AI」が より人間らしい回答をするために 人間による評価を「報酬」として学んでいるんですよ
須多先生
それでは次のスライドで 「『強化学習』で進化する『会話型AI』」について学びましょう