「OpenAI社」による「強化学習」についての研究

LLMを使った「生成AI」の一つ「ChatGPT(チャットジーピーティー)」を開発した「OpenAI(オープンエーアイ)社」の 「強化学習」研究を紹介します

「OpenAI社」による「強化学習」研究の紹介

「OpenAI社」は、世界的に注目されているLLMを活用した生成AI「ChatGPT」を開発した企業です。

現在の「ChatGPT」が注目を浴びる以前は、「強化学習」の研究に力を注いでおり、「OpenAI Gym(オープンエーアイジム)」というサービスを提供していました。


「OpenAI Gym」では、「強化学習」を使ったシミュレーション環境を提供しており、主にゲームをプレイするAIを開発するために利用します。

具体的には、「バランスゲーム」「スペースインベーダー」などが題材となっており、楽しみながら「強化学習」を学べる仕組みが特徴です。

「OpenAI Gym」で公開されているゲームも含めて 「OpenAI社」の研究を ゲームの例を通じていくつか紹介していきます

「バランスゲーム」

「OpenAI Gym」の代表と言えるゲームが、この「Cart-Pole(カート・ポール)」と呼ばれる「バランスゲーム」です。

ルールはとってもシンプルで、黒い土台の上に乗っている棒が倒れないように、土台を左右に動かすだけのゲームです。

この土台の動きをAIが「強化学習」で試行錯誤して学び、棒を倒さないための動きを学んで行きます。

手のひらの上に「ほうき」や「傘」を立てて 倒れないようにする遊びをよくしたなあ 結構難しいんだよな

あの時にやった遊びを AIが上達するために学んでいくってことだよな

まずは、以下のプレイ動画をご覧ください。


AIによるバランスゲーム:学習回数「1回」

あれ?1秒もたたないうちに動画が終わってしまいました

実はこのバランスゲームは 「棒が倒れたり土台が画面外に出てしまったらゲーム終了」となる仕組みになっています

今見ていただいたAIは まだ学習回数が「1回」の 学び始めのAIのため 1秒もたたないうちに棒が倒れ ゲームが終了し 動画も終了してしまいました

今後 何度も試行錯誤を繰り返していくことで 棒を倒さない動きを学んでいきます 以下の動画で「100回」「200回」「300」回学習した結果を確認してみましょう

AIによるバランスゲーム:学習回数「100回」


AIによるバランスゲーム:学習回数「200回」


AIによるバランスゲーム:学習回数「300回」

学習回数「300回」になると 棒を倒さないように上手にバランスをとることができるようになっているな!

「スペースインベーダーゲーム」

次の動画では、「スペースインベーダー」ゲームを学習するAIの様子を見ることができます。こちらも、「OpenAI Gym」のゲームです。

スペースインベーダーゲームは、プレイヤーが画面下部の自機(緑)を左右に動かし、画面上部から徐々に降りてくるエイリアン(黄色)を撃ち落とす、簡単なシューティングゲームです。全ての敵を倒せば、ゲームクリアとなります。

AIがプレイヤーとなり、効率よくクリアするための方法を「機械学習」での試行錯誤を通じて学んで行きます。


以下の動画は、62秒ほどしか訓練していない「モデル1」です。

この段階では、AIはまだ効率的な動きを学習しておらず、ほとんど何もできずエイリアンに倒されてしまいます。


AIによるスペースインベーダーゲーム:モデル1

引用元:Nicholas Renotte「A.I. Learns to Play Space Invaders | Reinforcement Learning(2021年1月28日)」


以下の動画は、1時間44分ほど訓練を行った「モデル3」です。

AIは、エイリアンの攻撃を避けながら、自分も攻撃することを覚えました。ですがまだ完璧ではなく、早い段階でエイリアンに倒されてしまいます。


AIによるスペースインベーダーゲーム:モデル3

引用元:Nicholas Renotte「A.I. Learns to Play Space Invaders | Reinforcement Learning(2021年1月28日)」


以下の動画は、17時間22分ほど訓練を行った「モデル4」です。

学習を重ね、AIはエイリアンの攻撃を上手に避けることができるようになりました。また、効率よくエイリアンを倒すことができるようになっています。


AIによるスペースインベーダーゲーム:モデル4

引用元:Nicholas Renotte「A.I. Learns to Play Space Invaders | Reinforcement Learning(2021年1月28日)」


以下の動画は、55時間24分ほど訓練を行った「モデル6」です。

ここまで学習を重ねたAIは、人間と同様、またはそれ以上のゲームプレイを行うことができるようになっています。


AIによるスペースインベーダーゲーム:モデル6

引用元:Nicholas Renotte「A.I. Learns to Play Space Invaders | Reinforcement Learning(2021年1月28日)」

長い時間をかけて学習を重ねたおかげで上手になっていますね!

「モデル6」のAIは 私より上手だと思うな

「かくれんぼゲーム」

こちらは、以前のレッスン「AIの知的な機能を体験する(AI00-01)」の「アクティビティ④」で紹介した動画です。

このゲームは「OpenAI」が公開した「強化学習」を使ったAIによる「かくれんぼ」ゲームです。

AIが操作するキャラクターが、隠れる側(青色)と、探す側(赤色)に分かれて、かくれんぼを行います。

最初は簡単に見つかってしまいますが、「強化学習」により試行錯誤を重ねることで、次第に様々な工夫を考えて行動するようになります。


「Door Blocking」と字幕が表示される部分(0:41)では、隠れる側(青色)が見つからないよう、ドアをブロックでふさぐ様子が見られ、見つからない策を講じていることが分かります。

この行動に対して、探す側(赤色)は負けじと策を講じます。

「Box Surfing」と字幕が表示される部分(1:40)では、ブロックでふさいで隠れている隠れる側(青色)に対して、探す側(赤色)は、なんとボックスに乗りながら移動し、隠れる側がふさいだブロックを乗り越えて探し出しています。


AI同士のかくれんぼゲーム

引用元:OpenAI「Multi-Agent Hide and Seek(2019年9月18日)」

初めの頃のレッスンで学んだこの動画は 「強化学習」を使っていたんですね

「強化学習」を学んだ後で改めて見てみると AIが試行錯誤して 学習している様子が分かりますね

これ 本当は人間が操作しているんじゃないか?ってくらいかしこい行動をAIがしていて 驚いたな

「OpenAI社」の「強化学習」の研究について紹介しましたが いかがでしたか?

「バランスゲーム」や「スペースインベーダーゲーム」として例を挙げた「OpenAI Gym」というサービスは 残念ながら2022年で更新が終了してしまいました

ですが 当時の研究は今でも活かされており 現在の「第4次AIブーム」の発端となった革新的なサービスである「ChatGPT」にも その技術が受け継がれています

次回のレッスンでは LLMを使った「会話型AI」に 「強化学習」の技術がどのように活用されているのか注目してみていきます

さまざまな分野で活用される「進化するAI」の技術について 次回もしっかり学びを深めていきましょう

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる