須多先生

スライドでは「VLM(Vision-Language Model:ビジョンランゲージモデル)とは?」についてまとめられていましたね
いかがでしたか?

深田 あい

VLMは AIが画像とテキストを組み合わせて 正しく理解して活用する生成AIの一つだということが分かりました

徳井 天

事例を見て 画像やカメラに映る物体をしっかり認識して 思っていた以上に詳細にテキストを生成していて驚きました!

須多先生

VLMは 画像を理解する技術とLLM(大規模言語モデル)を組み合わせることで 「視覚情報」と「言語情報」を同時に処理することができる技術です

深田 あい

人間でいう 「目」と「口」の役割を組み合わせた技術なんですよね

須多先生

はい その通りです
VLMは「画像を分析する技術」とも言えます

須多先生

この技術が発展すれば その場の状況に応じて 人間のように自分で判断し 行動するAIがもっと身近な存在になるかもしれませんね

徳井 天

VLMって本当にすごいな!もっと詳しく知りたくなったよ

深田 あい

私もVLMをもっと知りたいな
実際に使ってみることができれば もっと理解が深まると思うんですが…

須多先生

それでは 次の演習で実際にVLMを体験してみましょう

須多先生

さまざまな種類の画像を使って VLMがどのように機能するかに注目してみましょう

徳井 天

やったあ!VLMはどんな風に機能するんだろう 楽しみだな!

須多先生

それでは STAR Colabの演習を用意しましたので 次のアクティビティの指示に従って進めてください

Well done!

次のステップに進みましょう!

次のステップに進む

← 前のステップにもどる