須多先生
みなさん お疲れ様でした
アクティビティはいかがでしたか?
須多先生
みなさん お疲れ様でした
アクティビティはいかがでしたか?
徳井 天
ランダムに手を打つ相手より 考えて手を打つ相手と対戦させた方が AIがもっと強くなっていったよな
深田 あい
強い相手と練習した方が上達が早くなるのは 人間と同じだよね
須多先生
アクティビティで学んだ「評価値」について 理解できましたか?
徳井 天
はい 評価値が高いマスに打つと有利になって 低いマスに打つと不利になるということですよね
深田 あい
何度も対戦して 有利だったマスの評価値は上がって 逆に不利だったマスの評価値は下がるんだよね
須多先生
その通りです
だからAIは「評価値が高い」マスに次の手を打つようになります
徳井 天
でもその方法だと 一度勝った戦略ばかり選ぶようになるんじゃないですか?
須多先生
よく気づきましたね
そうならないように AIが偏った戦略を取らないよう ランダムに手を打つ手法を取り入れています
深田 あい
新しい戦略を「探索」することで AIの幅が広がるんですね
須多先生
このような「強化学習」での学習中の行動を「探索」や「冒険」と呼びます
徳井 天
何も考えずに打った手で 運よく勝つこともあるもんな
こういうところも人間と似ているんだな
深田 あい
今までの学習結果だけじゃなく 新しい戦略を「探索」することで AIの行動の幅がもっと広がるんだね
徳井 天
さまざまな方法で訓練して 試行錯誤を繰り返すことで どんどん強くなる「強化学習」を使ったAIのすごさを改めて感じたよ
須多先生
それでは次に 「三目並べ」と「五目並べ」の「強化学習」を使ったPythonプログラムを確認してみましょう
深田 あい
えっと 「五目並べ」は「三目並べ」と何が違うんでしょうか?(ユーザー名)さんは知ってる?
徳井 天
俺はやったことあるから知ってるよ
基本のルールは「三目並べ」と同じだけど 盤面がもっと大きくなってマスが増えるんだよ
須多先生
それではみなさんに質問です
盤面が広がった時 「ルールベース」と「強化学習」の それぞれのPythonプログラムの量は どう変わると思いますか?
深田 あい
えっとまず「ルールベース」では 「三目並べ」と比べて「五目並べ」でのPythonプログラムの量はどうなるかな…
(ユーザー名)さんはどう思う?
徳井 天
俺は プログラムの量は増えると思うな
使うマスが増えるわけだからな
徳井 天
それじゃあ「強化学習」での 「三目並べ」と比べて「五目並べ」でのPythonプログラムの量はどうなるんだろうな?
深田 あい
私は プログラムが増える気がするな
マスの数が増えるから どんな方法だとしてもPythonプログラムは増えると思うんだよね
須多先生
それでは次のスライドで 「ルールベース」と「強化学習」のPythonプログラムを比較して確認してみましょう