JA EN
用語集 › vlms

GLOSSARY

vlms

Vision-Language Models。画像も見る言語モデル

2本の論文題名に登場

定義

Vision-Language Models の略で、画像や動画とテキストを同じモデルで扱う系統。視覚エンコーダの出力を言語モデルの入力空間へ写す構成が典型で、画像への質疑応答、図表やスクリーンショットの読み取り、GUI操作に使われる。画像だけの vision model やテキストのみの LLM とは区別される。

論文題名での読み方

略語。視覚言語モデル

この語が出てくる解説

教科書で学ぶ