須多先生

みなさん お疲れ様でした
アクティビティはいかがでしたか?

徳井 天

ランダムに手を打つ相手より 考えて手を打つ相手と対戦させた方が AIがもっと強くなっていったよな

深田 あい

強い相手と練習した方が上達が早くなるのは 人間と同じだよね

須多先生

アクティビティで学んだ「評価値」について 理解できましたか?

徳井 天

はい 評価値が高いマスに打つと有利になって 低いマスに打つと不利になるということですよね

深田 あい

何度も対戦して 有利だったマスの評価値は上がって 逆に不利だったマスの評価値は下がるんだよね

須多先生

その通りです
だからAIは「評価値が高い」マスに次の手を打つようになります

徳井 天

でもその方法だと 一度勝った戦略ばかり選ぶようになるんじゃないですか?

須多先生

よく気づきましたね
そうならないように AIが偏った戦略を取らないよう ランダムに手を打つ手法を取り入れています

深田 あい

新しい戦略を「探索」することで AIの幅が広がるんですね

須多先生

このような「強化学習」での学習中の行動を「探索」や「冒険」と呼びます

徳井 天

何も考えずに打った手で 運よく勝つこともあるもんな
こういうところも人間と似ているんだな

深田 あい

今までの学習結果だけじゃなく 新しい戦略を「探索」することで AIの行動の幅がもっと広がるんだね

徳井 天

さまざまな方法で訓練して 試行錯誤を繰り返すことで どんどん強くなる「強化学習」を使ったAIのすごさを改めて感じたよ

須多先生

それでは次に 「三目並べ」と「五目並べ」の「強化学習」を使ったPythonプログラムを確認してみましょう

深田 あい

えっと 「五目並べ」は「三目並べ」と何が違うんでしょうか?(ユーザー名)さんは知ってる?

徳井 天

俺はやったことあるから知ってるよ
基本のルールは「三目並べ」と同じだけど 盤面がもっと大きくなってマスが増えるんだよ

須多先生

それではみなさんに質問です
盤面が広がった時 「ルールベース」と「強化学習」の それぞれのPythonプログラムの量は どう変わると思いますか?

深田 あい

えっとまず「ルールベース」では 「三目並べ」と比べて「五目並べ」でのPythonプログラムの量はどうなるかな…
(ユーザー名)さんはどう思う?

徳井 天

俺は プログラムの量は増えると思うな
使うマスが増えるわけだからな

徳井 天

それじゃあ「強化学習」での 「三目並べ」と比べて「五目並べ」でのPythonプログラムの量はどうなるんだろうな?

深田 あい

私は プログラムが増える気がするな
マスの数が増えるから どんな方法だとしてもPythonプログラムは増えると思うんだよね

須多先生

それでは次のスライドで 「ルールベース」と「強化学習」のPythonプログラムを比較して確認してみましょう

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる