JA EN
用語集 › vision-language-action

GLOSSARY

vision-language-action

視覚と言語から行動を出す(ロボット向け)

2本の論文題名に登場

定義

画像と言語の入力から、ロボットの行動指令までを一つのモデルで出す方式(VLA)。視覚言語モデルの上に行動出力を載せた構成が多く、行動を離散トークン化して言語と同じ枠組みで予測する。指示を理解して言葉を返す視覚言語モデルと違い、出力が実世界を動かす制御信号である点が決定的に異なる。

論文題名での読み方

VLAモデル。ロボ制御

この語が出てくる解説