JA EN

#mixture-of-experts

3 記事

01 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。 02 ·音声系·★ 会員·論文·13分で読めます 論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成 SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。 03 ·論文解説·★ 会員·論文·13分で読めます Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity 巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。