JA EN

#diffusion

20 記事

01 ·★ 会員·論文·21分で読めます 論文解説 The Missing Temporal Link — 台本の「時刻」を映像と音声の時間軸に載せるTemporal Context Routing The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 映像と音声は互いに同期しているのに、台本の指定時刻からは2人そろってずれる — この見落とされた3本目の時間軸を、クロスアテンションのロジットに足す1本の式だけで埋めたTCRを、原論文の式と実験値に沿って1から解説する。 02 ·★ 会員·論文·15分で読めます 論文解説: Puffin-World — 「上はどっちか」を覚えている世界モデル Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States 画像生成モデルに「重力の向き」を持たせると何が変わるのか。Puffin-World の Omni-Camera 表現と物理伝播を、前提知識ゼロから比喩・式・動く図で解説する。 03 ·★ 会員·論文·12分で読めます 論文解説: LLaDA-Image — 画像だけで土台を作り、2〜4ステップまで蒸留する完全公開レシピ LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes 画像とテキストの対データに頼らず、まず「画像だけ」で生成の土台を作る学習レシピ。6BのDiTをゼロから訓練し2〜4ステップ推論まで蒸留した LLaDA-Image を、論文本文の設計判断に沿って1から解説する。 04 ·★ 会員·論文·20分で読めます 論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models 10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。 05 ·★ 会員·論文·14分で読めます 論文解説 GenFirst: 生成を先に、再構成を後に — 潜在生成モデルを端から端まで壊さず学習する GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling 画像生成の定番である「VAEで潜在空間を作ってから生成モデルを載せる」2段構えを、1段で同時に学習する方法。潜在崩壊を防ぐ鍵はKLのエントロピー項で、学習の順番を「生成が先・再構成が後」にすると安定する、という論文を1から解説します。 06 ·★ 会員·論文·12分で読めます 論文解説: On-Policy Self-Distillation in Diffusion Models — 報酬を「途中の的」に翻訳する On-Policy Self-Distillation in Diffusion Models 画像生成モデルを報酬で鍛えるとき、完成画像への点数は「途中のデノイズをどう直すか」を教えてくれない。DiffusionOPSD は報酬の勾配から中間予測の具体的な的を作り、自分自身のEMA版を教師にして当てはめる。要旨に書かれた範囲で、その仕組みと限界を1から解説する。 07 ·★ 会員·論文·11分で読めます 論文解説: VGI-Bench — 動画生成モデルは「途中経過」まで正しく描けるのか VGI-Bench: Probing Visual Intelligence in Video Generation Models 動画生成モデルを「視覚で考える機械」として測るベンチマーク VGI-Bench の設計と結果を、前提知識ゼロから解説。最強の Seedance 2.0 でも 51.0 にとどまり、デノイズ途中の自己修正はほぼ起きないという測定結果までを追う。 08 ·生成モデル·★ 会員·論文·13分で読めます 3D生成のいま — NeRFからGaussian Splattingまで NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis 3Dは「彫る」ものから「最適化で合わせる」ものになりました。メッシュからNeRF、Gaussian Splattingへの表現の変遷と、2D拡散モデルを審査員に仕立てるSDS蒸留の仕組みを前提知識ゼロから解説。ゲーム・映像の制作現場に持ち込むときの落とし穴まで。 09 ·生成モデル·★ 会員·論文·15分で読めます 拡散モデルの数学 — スコアとSDEで見る生成 Generative Modeling by Estimating Gradients of the Data Distribution 拡散モデルを「ノイズを足して引く」の一段下、スコア(対数確率の勾配)の言葉で捉え直す。なぜノイズ除去がスコア推定と同じことなのか、前向き・逆向きSDEと確率フローODEが何を言っているのか、そしてその式が推論設定のつまみにどう化けるかまで。 10 ·生成モデル·無料·論文·16分で読めます 画像生成の実務地図 — SD・ControlNet・LoRA適用 LoRA: Low-Rank Adaptation of Large Language Models 画像生成をこれから触る人のための一枚地図。潜在拡散の4つの箱、プロンプトが効く場所、ControlNetによる構図の固定、LoRAでの微調整、そして見落とすと事故になるライセンスまでを、前提知識ゼロから順に繋ぎます。 11 ·★ 会員·論文·19分で読めます 論文解説: EchoWM — 音の鳴る「入れる世界」を、カメラの意図ひとつで動かす EchoWM: Open and Enterable Omnimodal World Models 参照画像と「どう動きたいか」を渡すと、720pの映像と環境音・音楽・セリフを同時に生成し続ける世界モデル EchoWM を論文本文から解説。一人称も三人称も『カメラの意図』という1つの入力に統一する設計、データセット全体で1つに揃えた並進スケール、長時間生成を支えるシンク+FIFOキャッシュまでを追う。 12 ·生成モデル·★ 会員·論文·15分で読めます 【実装】拡散モデルを自作する — MNISTからはじめる Denoising Diffusion Probabilistic Models 28×28の手書き数字で拡散モデルを最小構成から組み上げます。ノイズスケジュールが満たすべき2条件、UNetにステップ番号を注入する方法、サンプリングの最後にノイズを足し直す理由まで、自分で書いて初めて詰まる場所を順に潰していきます。 13 ·生成モデル·★ 会員·論文·12分で読めます CFGとサンプラー — 生成AIの「強さ」パラメータの正体 Classifier-Free Diffusion Guidance 画像生成ツールの「CFG Scale」と「Sampling steps / method」が内部で何をしているのかを、前提知識ゼロから解く。CFGは条件あり/なしの予測の差への外挿、サンプラーはODEの数値解法。忠実さ・多様性・時間の取引が、この2つのつまみでどう決まるか。 14 ·生成モデル·★ 会員·論文·14分で読めます GANの栄枯盛衰 — 敵対で学ぶ発明と、拡散に負けた理由 Generative Adversarial Networks 2014年に「本物らしさの物差しごと学習させる」という発想で画像生成を一変させたGANが、なぜモード崩壊と学習の不安定さに悩み、WGANで立て直し、それでも拡散モデルに主役を譲ったのか。10年の流れを式と動く図でたどります。 15 ·生成モデル·★ 会員·論文·12分で読めます Flow Matchingを1から — 拡散の次に来た「まっすぐ運ぶ」生成 Flow Matching for Generative Modeling Stable Diffusion 3 や FLUX の土台になった Flow Matching を前提知識ゼロから。速度場・常微分方程式・rectified flow を比喩と動く図で辿り、なぜ「まっすぐ運ぶ」と少ないステップで生成できるのか、現場で触るスケジューラ設定までを繋ぐ。 16 ·CNN・画像認識·★ 会員·論文·13分で読めます 論文解説: PhiZero — 映像を描く前に「物理の言葉」で考える世界モデル PhiZero: A World Model Built Around Physical Language ピクセルを直接予測する代わりに、動画から自己教師で学んだ離散的な「物理言語」で世界の変化を先に推論し、それから映像を描く PhiZero を論文本文から解説。トークナイザとリーズナーの二段構え、Physics-IQ Verified 首位の結果、ゼロショット動作転移、論文が認める限界まで。 17 ·★ 会員·論文·12分で読めます 論文解説: JoyAI-Video-Edit — 未来のフレームを待たずに、720p・約30FPSで動画を編集し続ける自己回帰拡散 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion 「背景を雪山に変えて」と指示すると、流れ込むライブ映像がその場で編集されて返ってくる——JDのJoyAI-Video-Editを論文本文から解説。チャンク自己回帰化・ソース錨付き蒸留(SA-DMD)・長時間ロールアウト蒸留の3段構えで、16Bモデルが720pを約30FPSで編集し続ける仕組みを追う。 18 ·★ 会員·論文·11分で読めます 論文解説: Hunyuan3D-Buffalo 1.0 — 理解・生成・編集を1つの脳に束ねる3D統合マルチモーダルモデル Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing 3D形状を言葉で説明する・テキストから作る・指示で編集する・部品を切り出す——4つの仕事を1つのモデルで行うTencent HunyuanのHunyuan3D-Buffalo 1.0を論文本文から解説。87Mサンプルのデータ工場Nano3D-v2と、「生成力を鍛えると編集が上手くなる」という相乗効果の発見まで追う。 19 ·★ 会員·論文·12分で読めます 論文解説: AURORA-LM — テキストを連続潜在空間で生成する拡散言語モデル、「圧縮せずに学び切る」という選択 AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling テキストを離散トークンではなく連続潜在空間で生成する拡散言語モデルAURORA-LMを論文本文から解説。潜在を圧縮して拡散を楽にする従来路線を捨て、幅1024の復元可能な潜在をそのまま、低ランク入力・高ノイズ校正・自己軌道一貫性で学び切る設計を追う。 20 ·生成モデル·★ 会員·論文·14分で読めます 拡散モデルを1から理解する — ノイズを足して、引く Denoising Diffusion Probabilistic Models DDPM原論文(Ho et al., 2020)を本文だけを根拠に読む。ノイズを足す前向き過程と引く逆過程、なぜ目的関数が「ノイズを当てる」形に落ち着くのか、単純化した損失が尤度を悪化させながら品質を上げた理由、そしてステップ数と品質の関係。