JA EN

#moe

8 記事

01 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。 02 ·Transformerの仕組み·★ 会員·論文·18分で読めます 論文解説: Qwen3.8-Next の設計 — 精度・効率・学習安定性を1つの問題として解く On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Qwen3.8-Flash-Next の設計報告を1から読み解く。GDNハイブリッド、QSA、Gated Residual、N-gram埋め込みの4部品を、論文が使った「損失・コスト・安定性」の3軸で追う。 03 ·モデル系統図鑑·★ 会員·13分で読めます Mistral系を1から — 小型高性能の欧州勢 パリ発のMistral AIはなぜ「小さいのに強い」を実現できたのか。Mistral 7Bのスライディングウィンドウ注意、Mixtralの疎なMoE、Codestralなどコード系の派生、そしてApache 2.0から始まって揺れ動いたライセンス方針までを、前提知識ゼロから通しで解説する。 04 ·エージェント·★ 会員·論文·18分で読めます 論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution 公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。 05 ·モデル系統図鑑·無料·12分で読めます DeepSeek系を1から — MoEと蒸留で殴り込んだ系譜 MoE・MLA・GRPO・蒸留という4つの道具でオープンLLMの勢力図を塗り替えたDeepSeekの系譜を、V2/V3/R1の設計判断に沿って前提知識ゼロから解説。話題になった学習コストの数字の読み方と、蒸留モデルの正しい使いどころまで。 06 ·★ 会員·論文·13分で読めます 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。 07 ·モデル系統図鑑·★ 会員·10分で読めます Qwen系を1から解説 — HuggingFace DL数トップ勢の実力 Hugging Faceのダウンロード数上位の常連、Alibaba CloudのQwen。Qwen2.5の「全サイズ×用途別」カタログ戦略からQwen3の思考モードとMoEまで、系譜・多言語とコードに強い理由・実務の落とし穴を前提知識ゼロから解説する。 08 ·論文解説·★ 会員·論文·13分で読めます Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity 巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。