PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#mixture-of-experts
3 記事
01
2026-09-03
·
推論・高速化
·
★ 会員
·
論文
·
16分で読めます
論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。
02
2026-08-13
·
音声系
·
★ 会員
·
論文
·
13分で読めます
論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。
03
2026-08-12
·
論文解説
·
★ 会員
·
論文
·
13分で読めます
Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。