JA EN

#vision-language-action

1 記事

01 ·★ 会員·論文·14分で読めます 論文解説: Beyond Data Scaling — ロボット基盤モデルは「データ量」より「表現」で決まる(VLAct) Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models ロボットの軌跡データはWebのように集められない。ならば限られた軌跡から「使い回せる表現」を絞り出すべきだ、という主張の論文。VLM事前分布の保護・複数ヘッド同時監督・身体をまたいだ部分統一の3点で、16GPU・全部オープンデータのまま産業系VLAを上回った。