論文解説: WorldClaw — テキスト1文から「歩ける・編集できる」3Dオープンワールドをエージェントが建設する
「熱帯の海賊島」と一文入れると、歩き回れて個々の建物を後から動かせる大規模3Dワールドが出てくる——Tencent Hunyuanチームの WorldClaw を論文本文から解説。計画→地形→地域オブジェクトの3段階を専門エージェントが分担し、レンダリングして自分で検品するまでの全工程を追う。
WorldClaw: Agentic 3D Open-World Generation at Scale
一次資料 — この記事の根拠
論文の発表 2026-08-05→この解説の公開 2026-08-12同月
WorldClaw: Agentic 3D Open-World Generation at ScaleChunchao Guo, Jinpeng Li, Yang Li ほか · 2026-08-05 · v1arXiv:2608.05248論文ページ·PDF原文の要旨(Abstract)を読む
Generating large-scale, freely explorable 3D worlds from open-ended text remains challenging because a system must jointly maintain global spatial coherence, rich local content, and explicit assets suitable for downstream editing and reuse. We present WorldClaw, a fully agentic, coarse-to-fine framework for open-world 3D scene generation. Planning agents translate a text prompt into a structured specification of regions, terrain, assets, materials, and spatial relations. WorldClaw then builds a globally coherent terrain foundation from semantic layouts, reusable assets, generative or procedural materials, and a region-aware height field. For detail-demanding regions, it generates terrain-conditioned compositions, reconstructs editable textured meshes, and recovers their placement on the terrain; render-based agents further refine terrain, objects, appearance, and contacts. Across diverse open-world prompts, WorldClaw produces large-scale scenes with coherent spatial organization, visually compelling local content, and editable instance-level assets while preserving a consistent global terrain structure.
一文でいうと
WorldClaw(arXiv:2608.05248、Tencent Hunyuanチーム)は、「熱帯の海賊の根城」のような短いテキストから、自由に歩き回れて、個々のオブジェクトを後から編集できる大規模3Dワールドを自動建設するフレームワークです。1つの巨大なAIが一発で世界を吐き出すのではなく、計画・地形・オブジェクト配置を専門エージェントが分担し、レンダリング画像を見ながら自分で手直しまで行う「工事現場」方式を取ります(§1)。
なぜ「画像」ではなく「世界」なのか
ゲーム・映画・VR・ロボットのシミュレーションが必要としているのは、決まったカメラから見て綺麗な絵ではなく、中を歩ける・構造が崩れない・後から編集できる明示的な3D空間です(§1)。難しいのは、相反しがちな3つの要求の同時達成です。地形や区画の大域的な一貫性、村や港のような局所の豊かな作り込み、そして全体を1枚のメッシュの塊にせずオブジェクト1個1個を独立した部品として残すこと——この3つ巴が本論文の出発点です(Abstract, §1)。
比喩: テーマパークの建設
WorldClawの発想はテーマパーク建設に似ています。まずマスタープラン(どこに海賊エリア、どこに山岳エリア)、次に土地の造成、最後にエリアごとの建て込み。論文の中心的な洞察はまさにこれで、「一貫した世界を全部一度に生成する必要はない。共有の制約(意味・空間構成・地形)を先に大域で固め、各地域を特徴づけるオブジェクトは必要な場所で順次実体化すればよい」と述べています(§1)。
従来の4流派と、それぞれの弱点
論文は既存手法を4分類し、限界を指摘します(§1, §4)。
| 流派 | やり方 | 弱点(論文の指摘) |
|---|---|---|
| プロシージャル生成(PCG) | ルールとプログラムで組む(Infinigen等) | ルールに書けることしか作れない |
| 画像・動画リフティング | 画像/動画生成の出力を3D化(Marble等) | 大域一貫性と幾何の忠実さに欠け、非効率 |
| ネイティブ3D拡散 | 3D表現を直接学習 | 3Dシーンのデータ不足で多様性が出ない |
| MLLMエージェント | LLMが計画とツール操作 | 精密な3D空間制御が苦手(動かしすぎる等) |
WorldClawは4番目の系譜に立ちつつ、エージェントの弱点である精密な空間操作を、プロシージャル地形・セグメンテーション・カメラ幾何という「手堅い道具」に肩代わりさせる構成です。
全体像: 計画 → 地形 → 地域の3段パイプライン
プロンプト から世界 までを、論文は3つの関数の合成として書きます(§2)。
言い換えると、①プロンプトを構造化された仕様書 に翻訳し、②仕様書から地形の土台 を造成し、③両方を見ながら地域ごとのオブジェクト群 を生成・配置して合成する、という流れです。各段階を専門エージェントが担い、構造化された中間表現を受け渡すことで、後工程が先に決めた大域構造を壊さないようにします。
ここで「地形」の実体はハイトフィールド(高さ場)、つまり2D座標を入れると高さが返る関数です。次の図で「2D座標ごとにスカラー値が決まる場」の感覚を先に掴んでおくと、後の式がすっと読めます。
ステージ1: 意図分析と計画 — 一文を仕様書に育てる(§2.1)
ユーザーは「雪山の谷に未来的な施設」程度しか書きませんが、建設には地形・区画・オブジェクト・素材・空間関係の詳細指定が要ります。生のプロンプトを下流に渡すと、足りない属性だらけになり、曖昧な表現が工程ごとに違う解釈をされます(§2.1)。そこで2つのエージェントを直列に置きます。意図分析エージェントはプロンプトに明示された制約の抽出・正規化だけを行い、新しい内容の追加や欠損の補完はしない——ユーザーの意図を汚さないための分離です。続くシーン計画エージェントが曖昧さを解消し、定義済みスキーマに沿って不足を補完して、仕様書 を作ります。 が地域と空間関係、 が各地域の地形要件、 がオブジェクトのカテゴリ・密度などです。
コメント
コメントにはログインが必要です