JA EN

#video-generation

10 記事

01 ·★ 会員·論文·20分で読めます 論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models 10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。 02 ·時系列データ系·★ 会員·論文·18分で読めます 論文解説 H3-World — 言語理解を「世界の操作」に変える H3-World: Turning Language Understanding into World Control 33Bの動画生成モデルを、専用のアクション機構を足さずに「操作できる世界モデル」へ変える手法。行動を文に変換し、動画潜在の時間区間に結びつけ、注意のルーティングで混線を止める。動かすのは全パラメータの0.199%だけ。 03 ·エージェント·★ 会員·論文·19分で読めます 論文解説: Code World Model — コーディングエージェントを「世界の脳」にする Code World Model: Coding Agent as World Brain 世界の「進み方」をコードに、世界の「見え方」を動画モデルに分担させる枠組み Code World Model を、前提知識ゼロから解説。粗い条件映像=プロキシという接続部の設計と、その限界まで読み解く。 04 ·学習手法・アライメント·★ 会員·論文·12分で読めます 論文解説 PAWBench — 動画生成は「起こりうる未来の確率」まで当てられるのか PAWBench: How Far Are We from Probabilistically Aligned World Modeling? 動画生成モデルを世界モデルと呼ぶなら、もっともらしい1本ではなく、同じ初期状態から繰り返し生成したときの分布が正しくなければならない。PAWBench はその確率的整合を50シナリオ・11モデルで測り、どのモデルも要件を揃えられないことを示した論文です。 05 ·★ 会員·論文·11分で読めます 論文解説: VGI-Bench — 動画生成モデルは「途中経過」まで正しく描けるのか VGI-Bench: Probing Visual Intelligence in Video Generation Models 動画生成モデルを「視覚で考える機械」として測るベンチマーク VGI-Bench の設計と結果を、前提知識ゼロから解説。最強の Seedance 2.0 でも 51.0 にとどまり、デノイズ途中の自己修正はほぼ起きないという測定結果までを追う。 06 ·★ 会員·論文·21分で読めます 論文解説: VBVR-Pro — 「絵で考える」AIを、訓練でき・採点でき・比較できるようにした実験場 VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 画像や動画の生成そのものを「思考の場」として扱うネイティブ視覚推論。VBVR-Proは300個の手続き生成タスクと、VLM審判に頼らない決定論的な採点器を用意し、画像・動画・インターリーブ生成を同じ土俵で比較した。前提知識ゼロから読める解説。 07 ·★ 会員·論文·19分で読めます 論文解説: EchoWM — 音の鳴る「入れる世界」を、カメラの意図ひとつで動かす EchoWM: Open and Enterable Omnimodal World Models 参照画像と「どう動きたいか」を渡すと、720pの映像と環境音・音楽・セリフを同時に生成し続ける世界モデル EchoWM を論文本文から解説。一人称も三人称も『カメラの意図』という1つの入力に統一する設計、データセット全体で1つに揃えた並進スケール、長時間生成を支えるシンク+FIFOキャッシュまでを追う。 08 ·★ 会員·論文·15分で読めます 論文解説 SemComp-Bench — 動画生成に「で、結局できたのか」を突きつける SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 動画生成の評価を「きれいか」から「指示した結果に到達したか」へ移した SemComp-Bench を、タスク定義・データ構築の4段パイプライン・ANDで束ねる採点式・実測値まで、論文本文に沿って読み解きます。 09 ·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます 論文解説: 危機映像のAI捏造は見抜けるか — RA-Benchが暴いた検出器の実力 Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination 実在の災害・戦争映像の1コマ目から作らせたAI動画1万6千本で、検出器7種・ゼロショットのマルチモーダルモデル10種・専用ファインチューン2種を測ったら、どれも生成元をまたいで汎化しなかった。映像ではなくタイムスタンプを読んでいたモデル、SNS加工で検出率が1.4%まで落ちる話まで、論文本文から解説。 10 ·CNN・画像認識·★ 会員·論文·13分で読めます 論文解説: PhiZero — 映像を描く前に「物理の言葉」で考える世界モデル PhiZero: A World Model Built Around Physical Language ピクセルを直接予測する代わりに、動画から自己教師で学んだ離散的な「物理言語」で世界の変化を先に推論し、それから映像を描く PhiZero を論文本文から解説。トークナイザとリーズナーの二段構え、Physics-IQ Verified 首位の結果、ゼロショット動作転移、論文が認める限界まで。