JA EN

#world-model

17 記事

01 ·★ 会員·論文·15分で読めます 論文解説: Puffin-World — 「上はどっちか」を覚えている世界モデル Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States 画像生成モデルに「重力の向き」を持たせると何が変わるのか。Puffin-World の Omni-Camera 表現と物理伝播を、前提知識ゼロから比喩・式・動く図で解説する。 02 ·★ 会員·論文·20分で読めます 論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models 10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。 03 ·エージェント·★ 会員·論文·16分で読めます 論文解説: ZimaBlue — 12万時間の一人称動画でロボットを汎化させる ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training 行動ラベルのない一人称動画12万時間をロボット制御に変換する World Action Model の論文を1から解説。3段階カリキュラム・100次元の統一行動表現・Slow-Fast の非同期二系統で、実機ゼロショット36.1%→77.8%、制御周期33msに至るまで。 04 ·時系列データ系·★ 会員·論文·18分で読めます 論文解説 H3-World — 言語理解を「世界の操作」に変える H3-World: Turning Language Understanding into World Control 33Bの動画生成モデルを、専用のアクション機構を足さずに「操作できる世界モデル」へ変える手法。行動を文に変換し、動画潜在の時間区間に結びつけ、注意のルーティングで混線を止める。動かすのは全パラメータの0.199%だけ。 05 ·エージェント·★ 会員·論文·19分で読めます 論文解説: Code World Model — コーディングエージェントを「世界の脳」にする Code World Model: Coding Agent as World Brain 世界の「進み方」をコードに、世界の「見え方」を動画モデルに分担させる枠組み Code World Model を、前提知識ゼロから解説。粗い条件映像=プロキシという接続部の設計と、その限界まで読み解く。 06 ·エージェント·★ 会員·論文·18分で読めます 論文解説: Code as Worlds — 世界を「実行できるコード」として書き起こすエージェント Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 物理世界を「実行できるコード」で表現し、提案→実行→描画→検証のループで観測に合う世界仮説を探すCode-as-Worldを、論文本文から解説。EWRの3成分、エージェント的発見ループ、QuantiPhyでの結果、論文が認める限界まで。 07 ·★ 会員·論文·17分で読めます 論文解説: GameWAM — ゲームの「次の景色」と「次の操作」を同時に生成する GameWAM: A World Action Model for Video Games 映像予測と操作生成を1つのモデルに担わせる World–Action Model の論文を1から解説。16手読んで8手だけ実行する block-cycle 制御と、乱数の低周波成分がカメラを勝手に回す LASI という失敗モードまで。 08 ·学習手法・アライメント·★ 会員·論文·12分で読めます 論文解説 PAWBench — 動画生成は「起こりうる未来の確率」まで当てられるのか PAWBench: How Far Are We from Probabilistically Aligned World Modeling? 動画生成モデルを世界モデルと呼ぶなら、もっともらしい1本ではなく、同じ初期状態から繰り返し生成したときの分布が正しくなければならない。PAWBench はその確率的整合を50シナリオ・11モデルで測り、どのモデルも要件を揃えられないことを示した論文です。 09 ·論文解説·★ 会員·論文·19分で読めます 論文解説: ゲーム開発を「検証できる軌跡データ工場」にする — RLHEV と AWoMo Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models 世界モデルに足りないのはデータでも計算でもなく「安い答え合わせ」だ、という主張の論文。ゲームエンジンの自動チェックと開発者の採否判断を組み合わせた後訓練 RLHEV を、前提知識ゼロから式・動く図・実験結果まで追う。 10 ·LLM — 大規模言語モデル·★ 会員·論文·12分で読めます スケーリング懐疑論 — 「大きくするだけ」批判の系譜 Training Compute-Optimal Large Language Models 「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。 11 ·★ 会員·論文·13分で読めます 論文解説: GigaBrain-0.7 — 3万7千時間の身体経験と「3つのシステム」で動くロボット基盤モデル GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture ロボット基盤モデルを「理解」「予測・評価」「行動」の3システムに分け、37,256.98時間の身体データで一段階事前学習する設計を、論文本文だけを根拠に1から解説する。未来画像と進捗値で方策を条件付ける仕組み、勾配を絞って流すSoft KI、実機での成功率まで。 12 ·★ 会員·論文·19分で読めます 論文解説: EchoWM — 音の鳴る「入れる世界」を、カメラの意図ひとつで動かす EchoWM: Open and Enterable Omnimodal World Models 参照画像と「どう動きたいか」を渡すと、720pの映像と環境音・音楽・セリフを同時に生成し続ける世界モデル EchoWM を論文本文から解説。一人称も三人称も『カメラの意図』という1つの入力に統一する設計、データセット全体で1つに揃えた並進スケール、長時間生成を支えるシンク+FIFOキャッシュまでを追う。 13 ·CNN・画像認識·★ 会員·論文·13分で読めます 論文解説: PhiZero — 映像を描く前に「物理の言葉」で考える世界モデル PhiZero: A World Model Built Around Physical Language ピクセルを直接予測する代わりに、動画から自己教師で学んだ離散的な「物理言語」で世界の変化を先に推論し、それから映像を描く PhiZero を論文本文から解説。トークナイザとリーズナーの二段構え、Physics-IQ Verified 首位の結果、ゼロショット動作転移、論文が認める限界まで。 14 ·エージェント·★ 会員·論文·12分で読めます 論文解説: Mental World Modeling — 物理だけでなく「心」まで遷移させるワールドモデル Mental World Modeling シーンの物理を完璧に追えても、人の次の行動は当てられない——信念・意図・感情・規範を状態変数として持ち、行動が物理と心を同時に更新する Mental World Modeling (MWM) の定式化と、訓練不要ベースライン Mentis による8モデル検証を、論文本文から数値つきで解説する。 15 ·エージェント·★ 会員·論文·15分で読めます 論文解説: ComBodied Agents — エージェントの「作用対象」を人そのものに置き直す ComBodied Agents: a New Paradigm of Human-Centric Agentic AI デジタルエージェントはソフトの状態を、身体エージェントは物理の状態を書き換える。では「人の状態」を第一の対象にするのは誰か。Combodied Agents は知覚・縦断記憶・Personal World Model・介入方針を1つの閉ループに束ね、成功の基準を課題達成から『主体性が保たれたか』へ移す枠組みを提案する。実験を持たない立場表明論文として、その骨格と限界を本文に沿って読む。 16 ·論文解説·★ 会員·論文·14分で読めます 論文解説: WorldClaw — テキスト1文から「歩ける・編集できる」3Dオープンワールドをエージェントが建設する WorldClaw: Agentic 3D Open-World Generation at Scale 「熱帯の海賊島」と一文入れると、歩き回れて個々の建物を後から動かせる大規模3Dワールドが出てくる——Tencent Hunyuanチームの WorldClaw を論文本文から解説。計画→地形→地域オブジェクトの3段階を専門エージェントが分担し、レンダリングして自分で検品するまでの全工程を追う。 17 ·エージェント·★ 会員·論文·11分で読めます 論文解説: EnvACE — 環境まで自分で演じる「world rehearsal」がエージェントRLの環境不足を解く EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning ツール実行環境を一切呼ばずに、LLM自身が「行動役」と「環境役」を交互に演じて強化学習する EnvACE を論文本文から解説。役割別GRPO、テスト時の脳内リハーサル、4ベンチマークでの結果と限界まで。