JA EN

#diffusion-transformer

3 記事

01 ·エージェント·★ 会員·論文·16分で読めます 論文解説: ZimaBlue — 12万時間の一人称動画でロボットを汎化させる ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training 行動ラベルのない一人称動画12万時間をロボット制御に変換する World Action Model の論文を1から解説。3段階カリキュラム・100次元の統一行動表現・Slow-Fast の非同期二系統で、実機ゼロショット36.1%→77.8%、制御周期33msに至るまで。 02 ·★ 会員·論文·19分で読めます 論文解説: DreamX-Creator — 音と映像を「同時に」作る7Bモデルと、2Kへの1ステップ仕上げ DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 音声と映像を1つの生成過程で同時に denoise する7Bモデルの論文を、前提知識ゼロから解説。ゲート付き交差注意・モダリティ別の強化学習・1ステップ2K仕上げの3点と、著者自身が置いている重い留保まで読む。 03 ·★ 会員·論文·17分で読めます 論文解説: GameWAM — ゲームの「次の景色」と「次の操作」を同時に生成する GameWAM: A World Action Model for Video Games 映像予測と操作生成を1つのモデルに担わせる World–Action Model の論文を1から解説。16手読んで8手だけ実行する block-cycle 制御と、乱数の低周波成分がカメラを勝手に回す LASI という失敗モードまで。