須多先生

みなさん こんにちは
本日も一緒に人工知能について学びましょう

須多先生

前回は「ボードゲームAIの歴史」について確認し 「三目並べ」で勝つためのコンピュータを作りましたね

徳井 天

世界チャンピオンに勝利していたり ボードゲームAIの強さは俺が思っていた以上だったよ

深田 あい

「三目並べ」で勝つためのコンピュータを作るには まずは勝つための戦略を考えて それをコンピュータに設定したんだよね

徳井 天

そうそう その結果 対戦相手としては十分なくらい強いコンピュータができたんだよな

深田 あい

Pythonプログラムも確認したけど プログラムの量が多くなっちゃって 複雑なルールに対応するのが難しいことがわかったよね

須多先生

あらかじめ決められたプログラムで動く仕組みを「ルールベース」と言いましたね

深田 あい

はい 「ルールベース」では 人間の限界があるって話でしたよね

須多先生

その通りです
「強化学習」を使えば AI自らが勝つための方法を学んでいきますよ

徳井 天

早速 「強化学習」を使ったAIを試してみたいな

深田 あい

えっと…私はもう少し 「強化学習」について理解してからにしたいかな

深田 あい

これまでのレッスンで 「強化学習」は「自ら進化するAI」だっていうのは分かったけど 仕組みについてはまだよく分かっていないんだよね…

徳井 天

言われてみれば確かにそうだな…
ボードゲームや自動運転で使われているってことは分かるけど 詳しいことについてはまだ学んでいなかったな

須多先生

「強化学習」の仕組みについて まだ詳しく解説していませんでしたね

須多先生

「強化学習」は AIが行うある「行動」に対して 「報酬」を与えることで より良い行動を選択できるよう学びを進めていきます

須多先生

例えば AIが「良い行動」を行ったら「プラスの報酬」を 「悪い行動」を行ったら「マイナスの報酬」を与えます

深田 あい

AIに与える「報酬」って 得点のようなイメージでしょうか…?

須多先生

はい その通りです
「良い評価」「悪い評価」を得点にしてAIに与えることで AIは自ら学んでかしこくなって行くんですよ

須多先生

「強化学習」をさらに理解するために 次の解説動画で学びを深めましょう

須多先生

解説動画を見終えた後は 「行動」と「報酬」に着目したクイズに挑戦して より学びを深めましょう

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる