須多先生
スライドでは「VLM(Vision-Language Model:ビジョンランゲージモデル)とは?」についてまとめられていましたね
いかがでしたか?
須多先生
スライドでは「VLM(Vision-Language Model:ビジョンランゲージモデル)とは?」についてまとめられていましたね
いかがでしたか?
深田 あい
VLMは AIが画像とテキストを組み合わせて 正しく理解して活用する生成AIの一つだということが分かりました
徳井 天
事例を見て 画像やカメラに映る物体をしっかり認識して 思っていた以上に詳細にテキストを生成していて驚きました!
須多先生
VLMは 画像を理解する技術とLLM(大規模言語モデル)を組み合わせることで 「視覚情報」と「言語情報」を同時に処理することができる技術です
深田 あい
人間でいう 「目」と「口」の役割を組み合わせた技術なんですよね
須多先生
はい その通りです
VLMは「画像を分析する技術」とも言えます
須多先生
この技術が発展すれば その場の状況に応じて 人間のように自分で判断し 行動するAIがもっと身近な存在になるかもしれませんね
徳井 天
VLMって本当にすごいな!もっと詳しく知りたくなったよ
深田 あい
私もVLMをもっと知りたいな
実際に使ってみることができれば もっと理解が深まると思うんですが…
須多先生
それでは 次の演習で実際にVLMを体験してみましょう
須多先生
さまざまな種類の画像を使って VLMがどのように機能するかに注目してみましょう
徳井 天
やったあ!VLMはどんな風に機能するんだろう 楽しみだな!
須多先生
それでは STAR Colabの演習を用意しましたので 次のアクティビティの指示に従って進めてください