論文解説 GenFirst: 生成を先に、再構成を後に — 潜在生成モデルを端から端まで壊さず学習する
画像生成の定番である「VAEで潜在空間を作ってから生成モデルを載せる」2段構えを、1段で同時に学習する方法。潜在崩壊を防ぐ鍵はKLのエントロピー項で、学習の順番を「生成が先・再構成が後」にすると安定する、という論文を1から解説します。
GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling
一次資料 — この記事の根拠
論文の発表 2026-08-29→この解説の公開 2026-09-02同月
GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative ModelingGuangting Zheng, Yiyuan Zhang, Tao Yang ほか · 2026-08-29 · v1arXiv:2608.29335論文ページ·PDF原文の要旨(Abstract)を読む
Latent generative models typically follow a two-stage pipeline, training a variational autoencoder for reconstruction and then a generative model on the frozen latent space. Since reconstruction-optimized latents are not necessarily generation-friendly, jointly training both models is an appealing alternative. However, direct end-to-end training remains challenging, as it is prone to latent collapse and faces a generation-reconstruction conflict. We revisit this problem by analyzing how different objectives shape the latent space and identify two key insights. First, the entropy term in the Kullback-Leibler divergence objective is essential for preventing collapse: reconstruction and prior fitting tend to shrink the posterior, while entropy preserves non-degenerate latent uncertainty. Second, reconstruction and generation exhibit asymmetric learning dynamics: reconstruction is fast and strongly supervised, whereas generation is slower and harder to optimize. Based on these insights, we achieve the first direct end-to-end training without latent collapse and propose GenFirst, a simple generation-before-reconstruction strategy. The generative objective first shapes the latent space under weak reconstruction pressure, after which reconstruction is progressively strengthened to recover visual details. We validate GenFirst with continuous autoregressive priors with exact likelihoods and SiT priors with implicit likelihoods. With our end-to-end objective and GenFirst, SiT achieves a gFID of 0.97 with CFG and 1.45 without CFG on ImageNet-256, while MMDiT reaches a GenEval score of 0.90 on text-to-image generation. Beyond image generation, we extend the framework to shared visual latents for generation and representation learning, and to continuous unified text-image generation. These results demonstrate the generality of stable end-to-end latent learning across generative priors and modalities.
この論文が言っていること
原題は "GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling"(arXiv:2608.29335、Zheng ら、2026年8月29日)です。
論文の要旨(Abstract)を日本語で要約すると、こうなります。潜在生成モデルは普通、まず再構成のためにVAE(変分オートエンコーダ)を訓練し、その凍結した潜在空間の上で生成モデルを訓練する、という2段階のパイプラインを取ります。しかし再構成に最適化された潜在表現が、生成にとって都合の良い潜在表現とは限りません。だから両者を同時に訓練したいのですが、素直に端から端まで(end-to-end)訓練すると潜在崩壊を起こしやすく、また生成と再構成の対立にぶつかります。著者らは、目的関数が潜在空間をどう形づくるかを分析して2つの知見を得ました。第一に、KLダイバージェンスの目的関数に含まれるエントロピー項が崩壊を防ぐのに本質的である。再構成と事前分布へのフィッティングはどちらも事後分布を縮めようとするが、エントロピー項が潜在の不確実性を退化させずに保つ。第二に、再構成と生成の学習ダイナミクスは非対称である。再構成は速く強く教師付けされているのに対し、生成は遅く最適化が難しい。この2点にもとづき、著者らは潜在崩壊なしの直接的なend-to-end訓練を初めて達成し、「生成を先に、再構成を後に」という単純な戦略 GenFirst を提案しました。
比喩: 型を先に決めるか、彫り込みを先に始めるか
粘土で像を作る工房を想像してください。職人が2人います。
一人はそっくりさん職人(再構成)。目の前のモデルと寸分たがわぬ像を作るのが仕事で、正解が手元にあるぶんフィードバックが速く確実です。もう一人は創作職人(生成)。「この工房らしい像を、モデルなしで新しく作れるようになる」のが仕事で、正解が存在せず上達も遅い。
2人が同じ粘土(潜在空間)を共有して同時に働くとどうなるか。そっくりさん職人のほうが圧倒的に速いので、粘土は「複製に都合のいい形」に先に固まってしまいます。創作職人が「もっとこうしてくれたら作りやすいのに」と思ったときには手遅れです。GenFirstの主張はシンプルで、創作職人に先に粘土の形を決めさせて、そっくりさん職人は後から細部を彫り込め、というものです。
前提: なぜ「潜在」で生成するのか
前提知識を先に埋めておきます。512×512のカラー画像はそのままだと数十万次元の数値の並びです。この上で直接、拡散モデルのような生成モデルを回すのは計算量的に苦しい。そこで現代の画像生成は2段構えを取ります。
- エンコーダで画像を小さな潜在ベクトル に圧縮し、デコーダで画像に戻せるようにする(=再構成の学習)
- その小さな の世界の上で、生成モデル(拡散モデルや自己回帰モデル)に「ありえる の分布」を学ばせる
このとき1段目に使われるのがVAEです。VAEはエンコーダが1点の ではなく分布 を出すのが特徴で、この仕組みはVAEを1から作るで扱っています。2段目の代表格が拡散モデルで、こちらは拡散モデル入門にまとめてあります。
問題は、1段目が2段目のことを何も知らずに訓練される点です。1段目は「元の絵に戻せるか」だけを見て潜在空間を作るので、できあがるのは細かいテクスチャまで詰め込まれた、生成モデルから見ると入り組んで学びにくい空間かもしれません。論文が出発点に置くのはまさにここで、「再構成に最適化された潜在は、必ずしも生成に優しくない」(Abstract)という一文です。
なぜ同時に学習すると壊れるのか
では1段目と2段目を最初から一緒に訓練すればいい、と思うのが自然です。ところがこれが素直にはいきません。起きるのが潜在崩壊(latent collapse)です。
崩壊とは何か。ここでの主役はエンコーダが出す事後分布 の「広がり」です。この分布が幅を失って一点に潰れてしまうと、潜在空間は情報を運ぶ媒体として機能しなくなります。極端な例では、どんな入力を入れても同じ が出てくる。損失の値だけは下がっているのに、中身が空洞になっている状態です。
直感的に言えば、分布の尖り具合の話です。次の図で、分布が平らな状態から一点に尖る状態までを動かしてみてください。温度を下げていくと棒が1本だけ立ち上がり、他が消えます。潜在崩壊は、事後分布にこれと同じことが起きている状況だと思ってください(softmaxの温度そのものの話ではなく、「広がりが失われる」という挙動のアナロジーです)。
論文が指摘するのは、この潰れを引き起こす力が2つあることです(Abstract)。再構成の目的関数と、事前分布へのフィッティングです。どちらも事後分布を縮める方向に働きます。
コメント
コメントにはログインが必要です