用語集 › multimodal
GLOSSARY
multimodal
マルチモーダル。文・画像・音声を併せて扱う
5本の論文題名に登場
定義
テキスト・画像・音声・動画など、種類の異なる入力を一つのモデルで併せて扱うこと。それぞれを共通の表現空間に写してから統合するのが典型で、画像について質問に答える、動画を要約するといった応用につながる。単に複数の入力を受け取るだけでなく、モダリティをまたいだ対応づけを学ぶ点が肝。
論文題名での読み方
複数種類の入力を統合
この語が出てくる解説
- 論文解説: Puffin-World — 「上はどっちか」を覚えている世界モデルPuffin-World: Scaling a Unified Multimodal Model with Native 3D World States
- 論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェントVideo-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
- 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのかTowards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes