JA EN
用語集 › vision-language

GLOSSARY

vision-language

画像と言語をまとめて扱う

1本の論文題名に登場

定義

画像と言語を同じ枠組みで扱うことを表す複合語。vision-language model(VLM)は画像を入力に取って文章で答えるモデルを指し、画像側の符号化器と言語モデルを接続する構成が一般的。片方だけを扱う vision-only / language-only との対比で使われる。

論文題名での読み方

VLM=視覚言語モデル

この語が出てくる解説