用語集 › vision-language-action
GLOSSARY
vision-language-action
視覚と言語から行動を出す(ロボット向け)
2本の論文題名に登場
定義
画像と言語の入力から、ロボットの行動指令までを一つのモデルで出す方式(VLA)。視覚言語モデルの上に行動出力を載せた構成が多く、行動を離散トークン化して言語と同じ枠組みで予測する。指示を理解して言葉を返す視覚言語モデルと違い、出力が実世界を動かす制御信号である点が決定的に異なる。
論文題名での読み方
VLAモデル。ロボ制御
この語が出てくる解説
- 論文解説: Beyond Data Scaling — ロボット基盤モデルは「データ量」より「表現」で決まる(VLAct)Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
- 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出すTurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM