JA EN

#generation

41 記事

01 ·★ 会員·論文·14分で読めます 論文解説 Beyond Retrieval — 取り出した映像を「潜在メモリ」に取り込むLatentStream Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 流れ続ける動画に対し、過去の証拠を外部コンテキストとして足すのではなく、固定長の潜在メモリトークンへ内面化する枠組みLatentStream。階層メモリ・潜在メモリ進化・自信ベースのテスト時最適化を、論文本文に沿って1から解説する。 02 ·★ 会員·論文·12分で読めます 論文解説: ピクセル文字表現学習の設計原則 — 文書を「読まずに見る」エンコーダは何で決まるか On the Design Fundamentals of Pixel Text Representation Learning 文字をコードに変換せず、画像のまま意味を掴むエンコーダ。その性能を決めるのはデータ量ではなく4つの設計原則だと示した EMNLP 2026 の論文を、前提知識ゼロから解説する。 03 ·★ 会員·論文·21分で読めます 論文解説 The Missing Temporal Link — 台本の「時刻」を映像と音声の時間軸に載せるTemporal Context Routing The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 映像と音声は互いに同期しているのに、台本の指定時刻からは2人そろってずれる — この見落とされた3本目の時間軸を、クロスアテンションのロジットに足す1本の式だけで埋めたTCRを、原論文の式と実験値に沿って1から解説する。 04 ·★ 会員·論文·15分で読めます 論文解説: Puffin-World — 「上はどっちか」を覚えている世界モデル Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States 画像生成モデルに「重力の向き」を持たせると何が変わるのか。Puffin-World の Omni-Camera 表現と物理伝播を、前提知識ゼロから比喩・式・動く図で解説する。 05 ·★ 会員·論文·12分で読めます 論文解説: LLaDA-Image — 画像だけで土台を作り、2〜4ステップまで蒸留する完全公開レシピ LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes 画像とテキストの対データに頼らず、まず「画像だけ」で生成の土台を作る学習レシピ。6BのDiTをゼロから訓練し2〜4ステップ推論まで蒸留した LLaDA-Image を、論文本文の設計判断に沿って1から解説する。 06 ·★ 会員·論文·20分で読めます 論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models 10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。 07 ·★ 会員·論文·20分で読めます 論文解説: 直近12フレームだけを見る超長尺3D復元 — Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction 1万フレームを超える動画からカメラ軌跡と3D形状をその場で作り続ける課題に対し、長距離メモリを一切持たず「直近12フレーム」だけで戦う ABot-Recon を、前提知識ゼロから解説する。 08 ·★ 会員·論文·17分で読めます 論文解説: Qwen-Drive-1.0 — VLMの形を変えずに、3D知覚と運転計画を「外付け」する Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving 事前学習済みVLMの構造を変えず、BEV知覚ヘッドとPlanning Expertを外付けするだけで3D検出・オキュパンシー・地図・軌跡生成を統合。汎用能力をほぼ落とさずNAVSIM PDMS 90.7を出した設計を、論文本文に沿って解説する。 09 ·★ 会員·論文·29分で読めます 論文解説 Lucida — 部屋の動画を「動かせる部品」に戻す。精度を最後に回すという発想 Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling 実際の部屋を撮った動画から、個別に動かせる3Dアセットの集まりとして部屋を復元する研究。「解析→生成→配置」の順序は保ったまま、各段階に要求する精度を組み替え、最後の配置をVLMのGUI操作エージェントに閉ループで解かせる。 10 ·★ 会員·論文·14分で読めます 論文解説 GenFirst: 生成を先に、再構成を後に — 潜在生成モデルを端から端まで壊さず学習する GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling 画像生成の定番である「VAEで潜在空間を作ってから生成モデルを載せる」2段構えを、1段で同時に学習する方法。潜在崩壊を防ぐ鍵はKLのエントロピー項で、学習の順番を「生成が先・再構成が後」にすると安定する、という論文を1から解説します。 11 ·★ 会員·論文·19分で読めます 論文解説: DreamX-Creator — 音と映像を「同時に」作る7Bモデルと、2Kへの1ステップ仕上げ DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 音声と映像を1つの生成過程で同時に denoise する7Bモデルの論文を、前提知識ゼロから解説。ゲート付き交差注意・モダリティ別の強化学習・1ステップ2K仕上げの3点と、著者自身が置いている重い留保まで読む。 12 ·★ 会員·論文·17分で読めます 論文解説: GameWAM — ゲームの「次の景色」と「次の操作」を同時に生成する GameWAM: A World Action Model for Video Games 映像予測と操作生成を1つのモデルに担わせる World–Action Model の論文を1から解説。16手読んで8手だけ実行する block-cycle 制御と、乱数の低周波成分がカメラを勝手に回す LASI という失敗モードまで。 13 ·★ 会員·論文·14分で読めます 論文解説: Beyond Data Scaling — ロボット基盤モデルは「データ量」より「表現」で決まる(VLAct) Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models ロボットの軌跡データはWebのように集められない。ならば限られた軌跡から「使い回せる表現」を絞り出すべきだ、という主張の論文。VLM事前分布の保護・複数ヘッド同時監督・身体をまたいだ部分統一の3点で、16GPU・全部オープンデータのまま産業系VLAを上回った。 14 ·★ 会員·論文·12分で読めます 論文解説: On-Policy Self-Distillation in Diffusion Models — 報酬を「途中の的」に翻訳する On-Policy Self-Distillation in Diffusion Models 画像生成モデルを報酬で鍛えるとき、完成画像への点数は「途中のデノイズをどう直すか」を教えてくれない。DiffusionOPSD は報酬の勾配から中間予測の具体的な的を作り、自分自身のEMA版を教師にして当てはめる。要旨に書かれた範囲で、その仕組みと限界を1から解説する。 15 ·★ 会員·論文·11分で読めます 論文解説: VGI-Bench — 動画生成モデルは「途中経過」まで正しく描けるのか VGI-Bench: Probing Visual Intelligence in Video Generation Models 動画生成モデルを「視覚で考える機械」として測るベンチマーク VGI-Bench の設計と結果を、前提知識ゼロから解説。最強の Seedance 2.0 でも 51.0 にとどまり、デノイズ途中の自己修正はほぼ起きないという測定結果までを追う。 16 ·★ 会員·論文·21分で読めます 論文解説: VBVR-Pro — 「絵で考える」AIを、訓練でき・採点でき・比較できるようにした実験場 VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 画像や動画の生成そのものを「思考の場」として扱うネイティブ視覚推論。VBVR-Proは300個の手続き生成タスクと、VLM審判に頼らない決定論的な採点器を用意し、画像・動画・インターリーブ生成を同じ土俵で比較した。前提知識ゼロから読める解説。 17 ·★ 会員·論文·14分で読めます 論文解説: TLive-Omni — ライブ配信を「見て・聞いて・何分何秒かまで答える」オムニモーダルモデル TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming ECライブ配信に特化したオムニモーダル理解モデルTLive-Omniを、前提知識ゼロから解説。時刻つきで映像と音を隣に置くPer-vGrid、3段階SFT、思考の跡ではなく答えの忠実さに報酬を出すFaithful-RFTまでを、論文の数値だけを根拠に読み解く。 18 ·生成モデル·★ 会員·論文·13分で読めます 3D生成のいま — NeRFからGaussian Splattingまで NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis 3Dは「彫る」ものから「最適化で合わせる」ものになりました。メッシュからNeRF、Gaussian Splattingへの表現の変遷と、2D拡散モデルを審査員に仕立てるSDS蒸留の仕組みを前提知識ゼロから解説。ゲーム・映像の制作現場に持ち込むときの落とし穴まで。 19 ·生成モデル·★ 会員·論文·15分で読めます 拡散モデルの数学 — スコアとSDEで見る生成 Generative Modeling by Estimating Gradients of the Data Distribution 拡散モデルを「ノイズを足して引く」の一段下、スコア(対数確率の勾配)の言葉で捉え直す。なぜノイズ除去がスコア推定と同じことなのか、前向き・逆向きSDEと確率フローODEが何を言っているのか、そしてその式が推論設定のつまみにどう化けるかまで。 20 ·生成モデル·無料·論文·16分で読めます 画像生成の実務地図 — SD・ControlNet・LoRA適用 LoRA: Low-Rank Adaptation of Large Language Models 画像生成をこれから触る人のための一枚地図。潜在拡散の4つの箱、プロンプトが効く場所、ControlNetによる構図の固定、LoRAでの微調整、そして見落とすと事故になるライセンスまでを、前提知識ゼロから順に繋ぎます。 21 ·★ 会員·論文·13分で読めます 論文解説: GigaBrain-0.7 — 3万7千時間の身体経験と「3つのシステム」で動くロボット基盤モデル GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture ロボット基盤モデルを「理解」「予測・評価」「行動」の3システムに分け、37,256.98時間の身体データで一段階事前学習する設計を、論文本文だけを根拠に1から解説する。未来画像と進捗値で方策を条件付ける仕組み、勾配を絞って流すSoft KI、実機での成功率まで。 22 ·★ 会員·論文·19分で読めます 論文解説: EchoWM — 音の鳴る「入れる世界」を、カメラの意図ひとつで動かす EchoWM: Open and Enterable Omnimodal World Models 参照画像と「どう動きたいか」を渡すと、720pの映像と環境音・音楽・セリフを同時に生成し続ける世界モデル EchoWM を論文本文から解説。一人称も三人称も『カメラの意図』という1つの入力に統一する設計、データセット全体で1つに揃えた並進スケール、長時間生成を支えるシンク+FIFOキャッシュまでを追う。 23 ·生成モデル·★ 会員·論文·15分で読めます 【実装】拡散モデルを自作する — MNISTからはじめる Denoising Diffusion Probabilistic Models 28×28の手書き数字で拡散モデルを最小構成から組み上げます。ノイズスケジュールが満たすべき2条件、UNetにステップ番号を注入する方法、サンプリングの最後にノイズを足し直す理由まで、自分で書いて初めて詰まる場所を順に潰していきます。 24 ·生成モデル·★ 会員·論文·11分で読めます 音楽・音声生成を1から — トークン化された音 Simple and Controllable Music Generation 3分の曲は1500万個以上の数値でできています。音楽生成の技術史は、この途方もない数列をどう畳むかの歴史でした。コーデックトークン、自己回帰と拡散の分かれ道、テキスト条件づけ、そしてSuno系サービスの構造を公開された部品から組み立て直すところまで、前提知識ゼロで解説します。 25 ·★ 会員·論文·15分で読めます 論文解説: Annotations as Rollouts — 正解データを「9本目の答案」として強化学習に混ぜる Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs 動画MLLMの強化学習では、モデルが引いた答案の中に正解がほとんど現れず学習信号が痩せる。OraRLは注釈データ自体を答案の1本として束に加え、そのとき壊れる『advantageの反転』を分解して直した手法。 26 ·★ 会員·論文·17分で読めます 論文解説 4DAnyone — 手持ちの動画1本から「誰でも」4Dにする 4DAnyone: Create Anyone in 4D from a Casual Monocular Video スマホで正面から撮った動画1本から、自由視点で見られる4D人物を作る手法 4DAnyone を前提知識ゼロから解説。鍵は「注意の器に入りきらない」問題を解く RCP と TCR の2つの工夫。 27 ·生成モデル·無料·13分で読めます VAEを1から — 「圧縮して戻す」に確率を混ぜると生成になる 圧縮して元に戻すだけのオートエンコーダは、なぜ新しいデータを作れないのか。そこに確率を一滴混ぜると生成モデルに変わる理屈を、ELBO・再パラメータ化・潜在空間の補間まで前提知識ゼロから解説します。 28 ·★ 会員·論文·15分で読めます 論文解説 SemComp-Bench — 動画生成に「で、結局できたのか」を突きつける SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 動画生成の評価を「きれいか」から「指示した結果に到達したか」へ移した SemComp-Bench を、タスク定義・データ構築の4段パイプライン・ANDで束ねる採点式・実測値まで、論文本文に沿って読み解きます。 29 ·★ 会員·論文·15分で読めます 論文解説: S²VOPD — 教師を強くする代わりに、生徒の目を曇らせる Self-Supervised Visual On-Policy Distillation 正解ラベルも報酬も強い教師も使わずに視覚VLMを伸ばす S²VOPD を、論文本文に沿って解説。生徒側の画像だけを劣化させて「情報の非対称性」を作る反転の発想と、効く拡張・効かない拡張の切り分けを扱う。 30 ·生成モデル·★ 会員·論文·12分で読めます CFGとサンプラー — 生成AIの「強さ」パラメータの正体 Classifier-Free Diffusion Guidance 画像生成ツールの「CFG Scale」と「Sampling steps / method」が内部で何をしているのかを、前提知識ゼロから解く。CFGは条件あり/なしの予測の差への外挿、サンプラーはODEの数値解法。忠実さ・多様性・時間の取引が、この2つのつまみでどう決まるか。 31 ·生成モデル·★ 会員·論文·14分で読めます GANの栄枯盛衰 — 敵対で学ぶ発明と、拡散に負けた理由 Generative Adversarial Networks 2014年に「本物らしさの物差しごと学習させる」という発想で画像生成を一変させたGANが、なぜモード崩壊と学習の不安定さに悩み、WGANで立て直し、それでも拡散モデルに主役を譲ったのか。10年の流れを式と動く図でたどります。 32 ·生成モデル·★ 会員·論文·12分で読めます Flow Matchingを1から — 拡散の次に来た「まっすぐ運ぶ」生成 Flow Matching for Generative Modeling Stable Diffusion 3 や FLUX の土台になった Flow Matching を前提知識ゼロから。速度場・常微分方程式・rectified flow を比喩と動く図で辿り、なぜ「まっすぐ運ぶ」と少ないステップで生成できるのか、現場で触るスケジューラ設定までを繋ぐ。 33 ·CNN・画像認識·★ 会員·論文·10分で読めます 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM 「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。 34 ·★ 会員·論文·13分で読めます 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。 35 ·CNN・画像認識·★ 会員·論文·13分で読めます 論文解説: PhiZero — 映像を描く前に「物理の言葉」で考える世界モデル PhiZero: A World Model Built Around Physical Language ピクセルを直接予測する代わりに、動画から自己教師で学んだ離散的な「物理言語」で世界の変化を先に推論し、それから映像を描く PhiZero を論文本文から解説。トークナイザとリーズナーの二段構え、Physics-IQ Verified 首位の結果、ゼロショット動作転移、論文が認める限界まで。 36 ·★ 会員·論文·12分で読めます 論文解説: JoyAI-Video-Edit — 未来のフレームを待たずに、720p・約30FPSで動画を編集し続ける自己回帰拡散 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion 「背景を雪山に変えて」と指示すると、流れ込むライブ映像がその場で編集されて返ってくる——JDのJoyAI-Video-Editを論文本文から解説。チャンク自己回帰化・ソース錨付き蒸留(SA-DMD)・長時間ロールアウト蒸留の3段構えで、16Bモデルが720pを約30FPSで編集し続ける仕組みを追う。 37 ·★ 会員·論文·11分で読めます 論文解説: Hunyuan3D-Buffalo 1.0 — 理解・生成・編集を1つの脳に束ねる3D統合マルチモーダルモデル Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing 3D形状を言葉で説明する・テキストから作る・指示で編集する・部品を切り出す——4つの仕事を1つのモデルで行うTencent HunyuanのHunyuan3D-Buffalo 1.0を論文本文から解説。87Mサンプルのデータ工場Nano3D-v2と、「生成力を鍛えると編集が上手くなる」という相乗効果の発見まで追う。 38 ·★ 会員·論文·10分で読めます 論文解説: GST-Bench — VLMは動画から「空間の全体像」を掴めるか GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? 部屋を一周した動画を見せたあと「いま君がいる場所から、さっきのソファはどっち?」と聞くと、最強のVLMでも人間の半分ほどしか答えられない——ByteDance SeedらのGST-Benchを論文本文から解説。ズルを封じるベンチマーク設計、22モデルの結果、そして訓練データで27点伸びた話まで。 39 ·★ 会員·論文·12分で読めます 論文解説: DEFT-RLVR — 自動運転VLMに未来の軌跡を「先に見せる」と推論が捏造される Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs 自動運転VLMのCoT教師データ作成で正解軌跡を先に見せると、教師は理由を後付けし幻覚が29%→50%に倍増する——この「軌跡アンカリングバイアス」を実証し、走行計画を選択問題化(AD-MCQ)して軌跡の開示を決断の後に遅延させる強化学習 DEFT-RLVR (arXiv:2608.01755) を論文本文だけを根拠に解説する。 40 ·★ 会員·論文·12分で読めます 論文解説: AURORA-LM — テキストを連続潜在空間で生成する拡散言語モデル、「圧縮せずに学び切る」という選択 AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling テキストを離散トークンではなく連続潜在空間で生成する拡散言語モデルAURORA-LMを論文本文から解説。潜在を圧縮して拡散を楽にする従来路線を捨て、幅1024の復元可能な潜在をそのまま、低ランク入力・高ノイズ校正・自己軌道一貫性で学び切る設計を追う。 41 ·生成モデル·★ 会員·論文·14分で読めます 拡散モデルを1から理解する — ノイズを足して、引く Denoising Diffusion Probabilistic Models DDPM原論文(Ho et al., 2020)を本文だけを根拠に読む。ノイズを足す前向き過程と引く逆過程、なぜ目的関数が「ノイズを当てる」形に落ち着くのか、単純化した損失が尤度を悪化させながら品質を上げた理由、そしてステップ数と品質の関係。