用語集 › vision-language
GLOSSARY
vision-language
画像と言語をまとめて扱う
1本の論文題名に登場
定義
画像と言語を同じ枠組みで扱うことを表す複合語。vision-language model(VLM)は画像を入力に取って文章で答えるモデルを指し、画像側の符号化器と言語モデルを接続する構成が一般的。片方だけを扱う vision-only / language-only との対比で使われる。
論文題名での読み方
VLM=視覚言語モデル
この語が出てくる解説
- 論文解説: Qwen-Drive-1.0 — VLMの形を変えずに、3D知覚と運転計画を「外付け」するQwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
- 論文解説: Beyond Data Scaling — ロボット基盤モデルは「データ量」より「表現」で決まる(VLAct)Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
- 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出すTurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM