須多先生
みなさん こんにちは
本日も一緒に人工知能について学びましょう
須多先生
みなさん こんにちは
本日も一緒に人工知能について学びましょう
須多先生
前回は「ボードゲームAIの歴史」について確認し 「三目並べ」で勝つためのコンピュータを作りましたね
徳井 天
世界チャンピオンに勝利していたり ボードゲームAIの強さは俺が思っていた以上だったよ
深田 あい
「三目並べ」で勝つためのコンピュータを作るには まずは勝つための戦略を考えて それをコンピュータに設定したんだよね
徳井 天
そうそう その結果 対戦相手としては十分なくらい強いコンピュータができたんだよな
深田 あい
Pythonプログラムも確認したけど プログラムの量が多くなっちゃって 複雑なルールに対応するのが難しいことがわかったよね
須多先生
あらかじめ決められたプログラムで動く仕組みを「ルールベース」と言いましたね
深田 あい
はい 「ルールベース」では 人間の限界があるって話でしたよね
須多先生
その通りです
「強化学習」を使えば AI自らが勝つための方法を学んでいきますよ
徳井 天
早速 「強化学習」を使ったAIを試してみたいな
深田 あい
えっと…私はもう少し 「強化学習」について理解してからにしたいかな
深田 あい
これまでのレッスンで 「強化学習」は「自ら進化するAI」だっていうのは分かったけど 仕組みについてはまだよく分かっていないんだよね…
徳井 天
言われてみれば確かにそうだな…
ボードゲームや自動運転で使われているってことは分かるけど 詳しいことについてはまだ学んでいなかったな
須多先生
「強化学習」の仕組みについて まだ詳しく解説していませんでしたね
須多先生
「強化学習」は AIが行うある「行動」に対して 「報酬」を与えることで より良い行動を選択できるよう学びを進めていきます
須多先生
例えば AIが「良い行動」を行ったら「プラスの報酬」を 「悪い行動」を行ったら「マイナスの報酬」を与えます
深田 あい
AIに与える「報酬」って 得点のようなイメージでしょうか…?
須多先生
はい その通りです
「良い評価」「悪い評価」を得点にしてAIに与えることで AIは自ら学んでかしこくなって行くんですよ
須多先生
「強化学習」をさらに理解するために 次の解説動画で学びを深めましょう
須多先生
解説動画を見終えた後は 「行動」と「報酬」に着目したクイズに挑戦して より学びを深めましょう