PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#moe
8 記事
01
2026-09-03
·
推論・高速化
·
★ 会員
·
論文
·
16分で読めます
論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。
02
2026-09-03
·
Transformerの仕組み
·
★ 会員
·
論文
·
18分で読めます
論文解説: Qwen3.8-Next の設計 — 精度・効率・学習安定性を1つの問題として解く
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
Qwen3.8-Flash-Next の設計報告を1から読み解く。GDNハイブリッド、QSA、Gated Residual、N-gram埋め込みの4部品を、論文が使った「損失・コスト・安定性」の3軸で追う。
03
2026-08-27
·
モデル系統図鑑
·
★ 会員
·
13分で読めます
Mistral系を1から — 小型高性能の欧州勢
パリ発のMistral AIはなぜ「小さいのに強い」を実現できたのか。Mistral 7Bのスライディングウィンドウ注意、Mixtralの疎なMoE、Codestralなどコード系の派生、そしてApache 2.0から始まって揺れ動いたライセンス方針までを、前提知識ゼロから通しで解説する。
04
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
18分で読めます
論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。
05
2026-08-25
·
モデル系統図鑑
·
無料
·
12分で読めます
DeepSeek系を1から — MoEと蒸留で殴り込んだ系譜
MoE・MLA・GRPO・蒸留という4つの道具でオープンLLMの勢力図を塗り替えたDeepSeekの系譜を、V2/V3/R1の設計判断に沿って前提知識ゼロから解説。話題になった学習コストの数字の読み方と、蒸留モデルの正しい使いどころまで。
06
2026-08-13
·
★ 会員
·
論文
·
13分で読めます
論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。
07
2026-08-13
·
モデル系統図鑑
·
★ 会員
·
10分で読めます
Qwen系を1から解説 — HuggingFace DL数トップ勢の実力
Hugging Faceのダウンロード数上位の常連、Alibaba CloudのQwen。Qwen2.5の「全サイズ×用途別」カタログ戦略からQwen3の思考モードとMoEまで、系譜・多言語とコードに強い理由・実務の落とし穴を前提知識ゼロから解説する。
08
2026-08-12
·
論文解説
·
★ 会員
·
論文
·
13分で読めます
Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。