用語集 › vlms
GLOSSARY
vlms
Vision-Language Models。画像も見る言語モデル
2本の論文題名に登場
定義
Vision-Language Models の略で、画像や動画とテキストを同じモデルで扱う系統。視覚エンコーダの出力を言語モデルの入力空間へ写す構成が典型で、画像への質疑応答、図表やスクリーンショットの読み取り、GUI操作に使われる。画像だけの vision model やテキストのみの LLM とは区別される。
論文題名での読み方
略語。視覚言語モデル
この語が出てくる解説
- 論文解説: GST-Bench — VLMは動画から「空間の全体像」を掴めるかGST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
- 論文解説: DEFT-RLVR — 自動運転VLMに未来の軌跡を「先に見せる」と推論が捏造されるDeferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs