JA EN

#vision-generation

1 記事

01 ·★ 会員·論文·13分で読めます 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。