#text
295 記事
01
·無料·論文·11分で読めます
Chain-of-Thought を1から — 「考えを書かせる」と何が変わるのか
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
「ステップごとに考えて」と一言足すだけで解ける問題が増えるのはなぜか。few-shot CoT・zero-shot CoT・self-consistency を前提知識ゼロから解説し、計算の直列化という理屈、効かない条件、推論モデルとの関係まで踏み込む。
02
·エージェント·★ 会員·論文·17分で読めます
論文解説: Terminal-Universe — エージェントの作業ログを、何度でも使える実行環境に戻す
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
エージェントの作業ログ(軌跡)に残ったファイル操作をリプレイし、欠けた部分を補完エージェントに埋めさせて実行可能なワークスペースを復元する枠組み。37.3kの環境を作り、Qwen3.5-27BのSFTでTerminal-Bench 2.1を+11.9ポイント改善した。
03
·推論・高速化·★ 会員·論文·16分で読めます
論文解説: 訓練データが1問でも、オンポリシー蒸留は数百ステップ伸び続ける
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
訓練クエリを1問に絞ってもオンポリシー蒸留は数百ステップ改善し続け、フルデータの伸びの大半を回収する。論文はその理由を「状態カバレッジ」と「吸収率」の2つで説明し、OPDはデータ過多・アルゴリズム不足だと結論づける。
04
·推論・高速化·★ 会員·論文·15分で読めます
論文解説: Random Attention — KVキャッシュの追い出しは「ランダムで十分」だった
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
KVキャッシュから何を捨てるかを決める「重要度スコア」は、ほとんど効いていなかった。プロンプトだけ守って残りをヘッドごとに一様ランダムで捨てるだけで最強手法と同等の精度、しかもvLLMで32〜43%速い。4モデル×6タスクの実測と、なぜそうなるかの2つの対照実験を読み解きます。
05
·LLM — 大規模言語モデル·無料·論文·16分で読めます
Mamba と状態空間モデル(SSM) — 注意機構なしで系列を扱う
Efficiently Modeling Long Sequences with Structured State Spaces
注意機構は「全部を覚えて毎回見返す」方式で、その代償が文長の2乗の計算量です。状態空間モデルは逆に「固定サイズのメモを更新し続ける」方式で、系列長に対して線形に伸びます。連続時間の線形システムから出発し、S4がなぜ畳み込みに化けるのか、Mambaが何を「選択的」にして畳み込みを捨てたのか、そしてどこで注意機構に負けるのかまでを前提知識ゼロから追います。
06
·エージェント·★ 会員·論文·12分で読めます
論文解説: CogEvol — 報酬が測れないものを、強化学習は静かに壊す
CogEvol: Towards Efficient and Reliable Learning Environment Generation
教材をワンパスで生成するモデル群 CogEvol の技術報告。中心にあるのは「スクリーンショットだけを見る報酬でRLを回すと、見た目は立派で遊べないゲームが量産される」という実際に起きた事故と、その修正の記録。
07
·Transformerの仕組み·★ 会員·論文·15分で読めます
論文解説: Gated DeltaNet はなぜ4bit量子化に耐えるのか — ハイブリッド27BのNVFP4 W4A4
Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM
ハイブリッドLLMの再帰層(Gated DeltaNet)は4bit量子化に弱い、という通説を実測で否定した論文の解説。ゲートの対数パラメータ化とdelta則の上書きが、なぜ量子化ノイズを消してしまうのかを1から追う。
08
·Transformerの仕組み·★ 会員·論文·15分で読めます
論文解説: 最初の1枚を基準にするのをやめる — Scal3R の複数参照・相対姿勢クエリ
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
長い動画で3D復元モデルが崩壊する原因を「最初のフレームを基準にした外挿」に特定し、凍結したバックボーンへ約1%の学習トークンを足すだけで直した論文を、前提知識ゼロから解説する。
09
·RAG・検索拡張·無料·10分で読めます
RAG vs ファインチューニング — どちらを、いつ選ぶか
LLMを賢くする二大手法を、知識の鮮度・コスト・幻覚・データ量の4軸で比べる。比喩→仕組み(式)→動く図→判断表→現場の落とし穴まで、前提知識ゼロから。
10
·推論・高速化·★ 会員·論文·13分で読めます
論文解説: Language Models Can Control Their Own Attention — モデルに「どこを見るか」を宣言させる
Language Models Can Control Their Own Attention
長文脈のデコードでは、モデルは毎ステップKVキャッシュを丸ごと読み直している。Declarative Attention は、モデル自身に思考の中で「次はどこを見る」と宣言させ、推論エンジンがその宣言からアテンションマスクを作る。既製モデルにゼロショットで適用して注意トークンを52.0%/31.1%削減した論文を解説する。
11
·RAG・検索拡張·★ 会員·論文·18分で読めます
論文解説: Hi-Q — 質問を「検索できる粒度」まで、証拠を見ながら割っていく
Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering
多段推論QAの本当のボトルネックは「質問の粒度」と「検索できる粒度」のズレにある。Hi-Qは、まず答えてみて答えられなかったノードだけを依存順に二分割していく。しきい値としての制御、木の育て方、そして実測値を前提知識ゼロから解説する。
12
·推論・高速化·★ 会員·論文·14分で読めます
論文解説: Compile by Training — 自然言語の仕様を「手元で動く関数」にコンパイルする
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
「メールを緊急か後回しかに分けて」——そんな曖昧な仕様を、約1分の学習でローカル実行できる小さな関数に変える手法。論文 Compile by Training を、比喩→仕組み→式→実測値の順で1から解説します。
13
·学習手法・アライメント·★ 会員·論文·19分で読めます
論文解説: It Takes Two to Match — 検索の「両側」をRLで共進化させるCoGR
It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
検索の一段目を、クエリ側とアイテム側の2つのLLMに「キーワードを書かせる」ことで作り直す論文。両者を強化学習で交互に鍛えて語彙を歩み寄らせるCoGRを、前提知識ゼロから解説する。
14
·エージェント·★ 会員·論文·17分で読めます
論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。
15
·エージェント·★ 会員·論文·16分で読めます
論文解説: EarlyEval — エージェント評価を「途中で打ち切って」安くする
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
エージェントの評価は1回数百ドルかかる。EarlyEvalは「結末は途中の振る舞いから読める」という発見を使い、実行を途中で止めて費用を13〜26%削る。仕組み・実験値・限界を論文本文から解説。
16
·エージェント·★ 会員·論文·20分で読めます
論文解説: Aspire — モデルは「曖昧な目標」から自己進化できるか
Aspire: Can Models Self-Evolve from Vague Goals?
「もっと数学が得意になれ」だけを渡されたエージェントは、自分で学ぶ内容と検証方法を決めて本当に強くなれるのか。隠された520問で測るベンチマーク Aspire を前提知識ゼロから解説し、学習ループは回るのに能力が伸びないという結果を数字で追う。
17
·エージェント·★ 会員·論文·15分で読めます
論文解説: 良いエージェント学習データとは何か — ACE(正確さ・複雑さ・多様性)という見方
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
エージェント用の学習データを (環境, タスク, 対話, 検証器) の4点セットとして捉え直し、生成を「正確さで通し、複雑さで置き、多様さで広げる」制約付き分布設計として整理したサーベイ論文の解説。
18
·エージェント·★ 会員·論文·22分で読めます
論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。
19
·学習手法・アライメント·★ 会員·論文·18分で読めます
論文解説: StudentSim — 「その生徒そのもの」を訓練で作る学習者シミュレータ
StudentSim: Training LLM-based Student Simulators
AI家庭教師を鍛えるための『練習台になる生徒』を、実際の学習記録から訓練して作る枠組み。行動忠実度(F)と指導反応性(R)という2軸の定義から、プール学習→生徒別特化の2段パイプライン、報酬モデルとしての応用までを1から解説する。
20
·エージェント·★ 会員·論文·21分で読めます
論文解説: StarHarness — モデルを凍結したまま「ハーネス」を進化させる
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
モデルの重みを一切変えず、エージェントを取り巻く「ハーネス」(プロンプト・ツール定義・スキル・MCP・サブエージェント・実行ループ)だけを探索で書き換える。企業向け3ベンチマークで20〜35ポイント改善し、進化に使わなかったタスクにも、別のモデルにも効いた。
21
·推論・高速化·★ 会員·論文·16分で読めます
論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。
22
·評価と審判·★ 会員·論文·16分で読めます
自己改善するAI — 共進化・自己対戦・カリキュラム生成の系譜
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
外から教師データを足さずにモデルが強くなる、という現象がどういう条件で成立するのかを1から分解する。AlphaZeroの自己対戦が成立した三つの条件を取り出し、それが言語モデルでどこから壊れるか、共進化とカリキュラム生成がその穴をどう埋めようとしているか、そして自己改善の主張をどう評価すべきかまでを扱う。
23
·評価と審判·★ 会員·論文·12分で読めます
報酬ハッキング — 測り方を決めると、そこが壊れる
Concrete Problems in AI Safety
指標を決めた瞬間から、その指標は壊れ始める。Goodhartの法則がなぜ統計的に避けられないのかを代理報酬のずれから説明し、ボートレースの周回からRLHFの冗長化・おべっか・テストのハードコードまで実例で追い、最適化圧と真の性能の乖離を検出する方法とKL正則化などの現実的な対策を扱う。
24
·エージェント·★ 会員·論文·16分で読めます
論文解説: Repo-To-Skill — GitHubリポジトリを「AIのためのスキル」に蒸留する
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
モデルでもハーネスでもない第三の層「運用知識」を、1000本のGitHubリポジトリから5,353個の検証済みスキルへ蒸留する DisCo と AREX-Skill ライブラリ。MLE-bench 31.11%→72.89% という結果と、その内訳・効かなかった場合を一次資料から読み解く。
25
·LLM — 大規模言語モデル·★ 会員·論文·15分で読めます
論文解説: Puro-2B — コンシューマGPUで2Bモデルを$6.9Kからゼロ事前学習する
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
ゲーミング向けGPUのRTX 5090で1.4兆トークンの事前学習を回し、Qwen2-1.5B級の性能に約$4.4Kで届いたという報告を、コスト構造・FP8・実効学習率・カリキュラム平均の順に1から解説する。
26
·エージェント·★ 会員·論文·22分で読めます
論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。
27
·Transformerの仕組み·★ 会員·論文·18分で読めます
論文解説: Qwen3.8-Next の設計 — 精度・効率・学習安定性を1つの問題として解く
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
Qwen3.8-Flash-Next の設計報告を1から読み解く。GDNハイブリッド、QSA、Gated Residual、N-gram埋め込みの4部品を、論文が使った「損失・コスト・安定性」の3軸で追う。
28
·推論・高速化·★ 会員·論文·15分で読めます
論文解説: Normalized Low-Rank Adaptation — LoRAの「入口行列」を正規化するだけで効く理由
Normalized Low-Rank Adaptation
LoRAのダウン射影行列Aを「ランク方向に単位長へそろえる」だけで、収束・安定性・忘却耐性が改善する。原題 Normalized Low-Rank Adaptation (NoRA) を、隠れた前処理行列という視点から1から解説する。
29
·エージェント·★ 会員·論文·17分で読めます
論文解説: LoopArena — コーディングエージェントを「操縦する側」を測る
LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
コーディングエージェントに指示を出し続ける『外側のループ』の良し悪しを、エージェント本体を固定したまま測るベンチマーク LoopArena を、前提知識ゼロから解説する。最良でも完全タスク成功率24.69%という結果の読み方まで。
30
·評価と審判·無料·論文·12分で読めます
LLM-as-a-Judge を1から — AIがAIを採点する仕組みと限界
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
モデルの出力をモデルに採点させる「LLM-as-a-Judge」を、前提知識ゼロから解説。判定を確率分布として読む方法、位置バイアス・冗長性バイアス・自己選好という三つの偏り、比較回数が2乗で増える構造、そして審査員自身を人手と突き合わせて検証する手順までを扱います。
31
·推論・高速化·★ 会員·論文·18分で読めます
論文解説: 本番トラフィックから事後学習へ — 社内200アプリを1つの自前LLMに寄せる
From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
データ所在地の制約で自前ホストせざるを得ない企業が、増え続けるモデル群を1つに畳む方法。本番の失敗を人手で分類し、弱い3軸それぞれにGRPO専門家を作り、SLERPで重みを混ぜる。3種類の報酬ハッキングの実例つき。
32
·評価と審判·★ 会員·論文·12分で読めます
ベンチマーク汚染 — 「高スコア」を疑う技術
Rethinking Benchmark and Contamination for Language Models with Rephrased Samples
ベンチマークの高スコアが実力なのか暗記なのかを見分けるための記事。汚染の3つの型、n-gram重なり・埋め込み近傍・メンバーシップ推論という検出手段とその限界、カナリア文字列と時系列分割の仕組みを1から解説し、論文を読むときの警戒点をチェックリストにまとめる。
33
·推論・高速化·★ 会員·論文·15分で読めます
論文解説: On-Policy Distillationは本当に蒸留しているのか — ノイズまみれの教師から自己改善へ
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
教師モデルの採点は3〜5割が誤っているのに、生徒はなぜか同じだけ伸びる。On-Policy Distillationの改善が「教師の真似」ではなく「低確率トークンの抑制」から来ていることを突き止め、教師を捨てた手法OPSAに至った論文を、前提知識ゼロから解説する。
34
·エージェント·★ 会員·論文·16分で読めます
論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。
35
·評価と審判·無料·論文·15分で読めます
エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るか
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェント評価の代表3本(SWE-bench・GAIA・OSWorld)が実際に何を測っているかを、採点方式の違いから解きほぐす。汚染とリークの4類型、そして発表されたスコアを自分の用途向けに読み替える手順まで。
36
·学習手法・アライメント·★ 会員·論文·15分で読めます
論文解説: PaperGym — 論文1本を「採点基準つきの練習場」に変えて研究計画を学習させる
PaperGym: Rubric-Centered Evolution for Research-Plan Generation
研究計画には正解がないので強化学習の「環境」が作れない。論文を4つの引き出しに分解し、問いと採点基準を別々の引き出しから作ることで、言い換えでは点が取れない練習場を20,000本ぶん自動生成した研究を、前提知識ゼロから解説する。
37
·推論・高速化·★ 会員·論文·17分で読めます
論文解説: DART-SD — ツール呼び出しエージェントの「ダイヤ型の解空間」を壊さずに学習する
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
順不同のサブゴールを含む多ターンのツール呼び出しでは、正解の集合が『ダイヤ格子』状に広がる。軌跡まるごとの模倣がなぜそれを潰すのか、状態グラフで『最初に転んだ地点』を特定してそこから先だけを直す学習で何が変わるのかを、前提知識ゼロから解説する。
38
·論文解説·★ 会員·論文·16分で読めます
論文解説 J-Zero: 出題者・解答者・審判を同時に育てる「データゼロ」自己進化
J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
外部データも人手のラベルも使わず、モデルが自分で問題を作り、解き、採点して成長する枠組み。J-Zero は採点役(Judge)も一緒に育てることで、従来手法が2反復で頭打ちになる壁を越えた。
39
·推論・高速化·★ 会員·論文·15分で読めます
論文解説: CyberFactory — 野生のCVEを「実行できる訓練問題」に変える
CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
実世界のCVEを実行・検証できるタスクへ変換し、再利用可能な「脆弱性解析スキル」で教師の軌跡を合成してモデルに内面化させるオープンソース基盤。CyberGymで Pass@1 58.1%。
40
·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます
論文解説: Agentic Artifact Creation — 「生成」と「納品物を組み立てる」はどう違うのか
Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities
259件の文献を「納品される成果物」という一点から整理したサーベイ。状態・編集・検証という3つの役でエージェント的創出を定義し、6ファミリー・評価の3対象・4原則・6つの未解決問題まで、前提知識ゼロから読み解きます。
41
·推論・高速化·★ 会員·論文·15分で読めます
論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える
TTPO: Test-Time Policy Optimization
多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。
42
·推論・高速化·★ 会員·論文·19分で読めます
論文解説: Self-OPD — 教師モデルなしで、画像生成モデルが自分を蒸留する
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
教師モデルを使わず、生成の各ステップで自分の分身をK本つくって採点し、良い枝に引き寄せ悪い枝から遠ざける。フローマッチング系画像生成のアライメント手法 Self-OPD を、前提知識ゼロから解説します。
43
·論文解説·無料·20分で読めます
代理指標では、もう守れない — 自動運転 2026年8月新着8本を束ねて読む
2026年8月下旬の自動運転系arXiv新着8本を横断して読む。安全を期待値で測るのをやめる動き、自車の履歴の外側に観測経路を足す動き、そして無理に束ねられない独立した2本を、関係が見える形で整理する。
44
·エージェント·★ 会員·論文·23分で読めます
論文解説: JIT-Agent — エージェントの「ハーネス」をその場で書き起こすモデル
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
エージェントの性能はモデルだけで決まらない。記憶・計画・行動・道具の4モジュールからなる「ハーネス」をタスクごとに生成する専用モデル JIT-Agent を、前提知識なしで解説する。
45
·推論・高速化·★ 会員·論文·12分で読めます
論文解説 WarpSAC: 強化学習の「安定化装置」は、データが潤沢になると足枷に変わる
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
GPU並列シミュレータで経験データが桁違いに増えると、SACの正規化やclipped double-Qといった「安定化装置」は助けから足枷に変わる。論文は3本の軸を切り分け、データ状況に応じて安定化装置を外すという処方箋(WarpSAC)を示した。
46
·開発プロセス·無料·10分で読めます
上流工程を1から — 要件定義で勝負がつく理由
要件定義→基本設計→詳細設計という流れは、なぜこの順番なのか。間違いを見つけるのが遅れるほど直す費用が指数的に膨らむ「分岐の掛け算」の構造を、比喩・式・動く図・コードで前提知識ゼロから解きほぐします。
47
·サプライチェーン·無料·10分で読めます
半導体サプライチェーン全体地図 — 砂からチップまで誰が何を握るか
1個のチップが世界を何周もして生まれるまでを、設計(EDA/IP)→製造装置→材料→ファウンドリ→OSATの順に1本で通す。なぜ各段階が数社の寡占になるのかを、チェーン可用性とHHIという2つの式で読み解く。
48
·サプライチェーン·★ 会員·15分で読めます
半導体材料の上流 — ウェハ・フォトレジスト・特殊ガス
砂だったシリコンが「9が11個」の純度になり、1本の巨大な単結晶として引き上げられ、光で溶ける化学膜を塗られるまで。CZ法の偏析から化学増幅レジストの酸のにじみまでを前提知識ゼロで追い、なぜこの上流に日本企業が居座り続けているのかを構造から読み解く。
49
·サプライチェーン·★ 会員·11分で読めます
製造装置メーカーの世界 — ASML・AMAT・TEL・Lamは何を作っているか
チップ製造は「積む・写す・削る・洗う」の反復で、その1動作ずつに専用の機械と専門メーカーがいる。工程と装置の対応を整理したうえで、必要台数の式と開発費の式から「なぜ装置産業は数社に固まるのか」を導き、ASMLのEUV独占が単独ではなく部品メーカーの束として成立している構造まで解説する。
50
·開発プロセス·★ 会員·14分で読めます
要件定義の技術 — 「言われた通り」が失敗する理由
依頼者の言葉をそのまま実装すると、なぜ動くのに使われないものができるのか。顕在要求と潜在要求、ユースケース、非機能要件の数値化、そして曖昧さをその場で炙り出す質問の型を、前提知識ゼロから解説します。
51
·蒸留と圧縮·★ 会員·論文·13分で読めます
オンポリシー蒸留 — 生徒自身の出力で教わる
On-Policy Self-Distillation without Any Supervision
教師の書いた文を写経するのが従来の蒸留、生徒が書いた文に教師が赤を入れるのがオンポリシー蒸留です。違いは損失の式のたった1か所。その1か所が露出バイアスを消し、蒸留を強化学習の一種に変え、u-OPSD や AgentOPSD のような自己蒸留への入口になります。
52
·サプライチェーン·★ 会員·15分で読めます
IPコアとファブレス — Armが1円も製造せず世界を握る仕組み
設計図だけを売る会社が、なぜチップ産業の中心に座れるのか。ライセンス料とロイヤリティの構造、自社開発との損益分岐出荷量、ソフトIP/ハードIP/アーキテクチャライセンスの粒度、そしてRISC-Vが「無料にしたもの」と「無料にしなかったもの」を式と実務の両面から追う。
53
·エージェント·★ 会員·論文·11分で読めます
論文解説: FrontierChallenge — 科学の仕事を「最後まで納品できたか」で測る
FrontierChallenge: Evaluating Scientific Workflow Completion
科学ワークフローを最後まで完遂できるかを測るベンチマーク FrontierChallenge の解説。平均点87.9でも完全達成は20.6%、電気化学では平均94.9でPass Rate 0%。未達の軌跡の75.5%が「完了しました」と述べて終わっていた。
54
·開発プロセス·★ 会員·11分で読めます
見積もりとスコープ — 不確実性コーンと握り方
「いつ終わりますか」に点で答えるから外れる。不確実性コーン、三点見積もり、バッファが足し算にならない理由、参照クラス予測、そしてスコープを交渉可能な形に組み替える言い方までを、前提知識ゼロから解説します。
55
·サプライチェーン·★ 会員·14分で読めます
EDAツールを1から — チップは「ソフトウェアで書かれている」
最先端チップの数百億個のトランジスタは、誰も手で並べていない。設計者が書くのは図形ではなく文章(RTL)で、それを論理合成・配置配線・検証というソフトウェアが物理的な図形へコンパイルする。この流れと、SynopsysとCadenceがなぜ抜けられない存在になったのかを前提知識ゼロから解説する。
56
·蒸留と圧縮·★ 会員·論文·13分で読めます
蒸留・量子化・枝刈りの使い分け — 小さくする3つの道
Distilling the Knowledge in a Neural Network
モデルを小さくする道は3本あります。数値の目盛りを粗くする量子化、重みそのものを間引く枝刈り、小さいモデルに作り直す蒸留。圧縮率・精度・実装コストの三軸で正面から比べ、「訓練を伴うものを先に、量子化を最後に」という組み合わせ順序の理由まで、前提知識ゼロから。
57
·蒸留と圧縮·★ 会員·論文·12分で読めます
蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか
Distilling the Knowledge in a Neural Network
蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。
58
·蒸留と圧縮·無料·論文·11分で読めます
蒸留の数学 — なぜ「柔らかい答え」から学べるのか
Distilling the Knowledge in a Neural Network
蒸留の損失はなぜ KL(教師||生徒) なのか、温度Tは何をしているのか、そして実装で必ず出てくる T² 倍は何の補正なのか。ソフトラベルが正解ラベルより多くを語る理由を、式の導出と動く図で1から追います。
59
·蒸留と圧縮·★ 会員·論文·14分で読めます
エージェントを蒸留する — 長い軌跡をどう圧縮するか
ReAct: Synergizing Reasoning and Acting in Language Models
エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。
60
·蒸留と圧縮·★ 会員·論文·10分で読めます
蒸留が失敗するとき — 容量ギャップと過信の伝染
DAPD: Dual-Anchored Policy Distillation
強い教師を使えば強い生徒ができる、とは限りません。器が小さいと平均だけが伝わる容量ギャップ、教師の自信ごと写す過信の伝染、教師が一度も通らない道を生徒が歩く分布シフト — 蒸留が壊れる3つの型を、前提知識ゼロから解きほぐします。
61
·蒸留と圧縮·★ 会員·論文·12分で読めます
蒸留モデルの評価 — 「教師に近い」は良い指標か
The False Promise of Imitating Proprietary LLMs
蒸留した生徒モデルを「教師との一致率」で採点すると、教師の誤りを忠実に写した生徒ほど高得点になります。一致率が数学的に何を保証して何を保証しないのか、分布の外で何が崩れるのか、合成データ経由のベンチマーク汚染をどう検査するのか — 蒸留モデルの評価設計を前提知識ゼロから組み立てます。
62
·蒸留と圧縮·★ 会員·論文·11分で読めます
蒸留データの設計 — 教師に何を答えさせるか
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
蒸留で生徒の性能を決めるのは、教師の賢さより「教師に何を問うたか」です。合成データの作り方、カバレッジの設計、難問へ偏らせる理由、正しさのフィルタ、そしてDeepSeek-R1の蒸留がなぜ効いたのかを、前提知識ゼロから解説します。
63
·サプライチェーン·★ 会員·10分で読めます
半導体の地政学 — 輸出規制とサプライチェーン再編を技術から読む
チョークポイントはなぜそこにできるのかを、物理・固定費・暗黙知の3条件から説明する。規制が数値のしきい値で書かれる技術的理由、二重化が効かなくなる共通原因の式、置き換えの速さを決める学習曲線までを一本で通す。
64
·蒸留と圧縮·★ 会員·論文·15分で読めます
【実装】蒸留を自作する — 100行で小さなモデルを育てる
Distilling the Knowledge in a Neural Network
蒸留の損失は20行で書けます。にもかかわらず自作するとほぼ全員が同じ場所で転ぶ — KLの向き、reductionの選び方、T²の付け忘れ。教師の凍結から損失、訓練ループ、教師なしベースラインとの比較、温度スイープ、そして「実装が壊れていないこと」を確かめる4つの検算までを、100行のコードで通します。
65
·開発プロセス·★ 会員·11分で読めます
アーキテクチャ設計 — 後から変えられないものを見分ける
設計判断のうち、後から安く取り消せるものと二度と戻せないものをどう見分けるか。可逆性の測り方、ADR(設計決定記録)の書き方、トレードオフを言葉にする型を、前提知識ゼロから解説します。
66
·開発プロセス·★ 会員·11分で読めます
AI時代の上流工程 — コードが安くなると何が価値になるか
実装コストが下がると、費用の内訳のどこが残り、何が相対的に高くなるのか。決める費用と手戻り費用の関係を式で押さえたうえで、AIに投げる仕様を『意図の非可逆圧縮』として設計する方法を、前提知識ゼロから解説します。
67
·VLM・マルチモーダル·★ 会員·論文·10分で読めます
動画理解を1から — フレームの束から時間の理解へ
Is Space-Time Attention All You Need for Video Understanding? (TimeSformer)
動画は「画像がたくさん」ではない。何枚をどう選ぶか(サンプリング)、フレーム同士をどう混ぜるか(時間注意)、長い動画をどう縮めるか(圧縮)の3つの問いに分けて、前提知識ゼロから式・動く図・コードで解説する。
68
·学習手法・アライメント·無料·論文·14分で読めます
学習が壊れた時の診断学 — loss発散・NaN・停滞の切り分け
On the difficulty of training Recurrent Neural Networks
学習が壊れる形は「発散」「NaN」「停滞」の3つしかありません。損失曲線の形から原因を絞り込む対応表を軸に、なぜ発散するのかを式と動く図で押さえ、NaNの発生地点を特定するコード、停滞の切り分け手順までを前提知識ゼロから解説します。
69
·生成モデル·★ 会員·論文·13分で読めます
3D生成のいま — NeRFからGaussian Splattingまで
NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis
3Dは「彫る」ものから「最適化で合わせる」ものになりました。メッシュからNeRF、Gaussian Splattingへの表現の変遷と、2D拡散モデルを審査員に仕立てるSDS蒸留の仕組みを前提知識ゼロから解説。ゲーム・映像の制作現場に持ち込むときの落とし穴まで。
70
·LLM — 大規模言語モデル·★ 会員·論文·17分で読めます
推論時スケーリング — 「長く考える」モデルの原理
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。
71
·論文解説·★ 会員·15分で読めます
記号主義vs接続主義 — 60年論争の現在地
AIには「規則を書き下す派」と「例から重みを学ぶ派」という二つの部族があり、60年ずっと争ってきました。パーセプトロン本・エキスパートシステムの崩壊・誤差逆伝播の逆転劇をたどり、なぜ今のLLMが電卓を呼び文法に縛られているのか、その必然を1から解説します。
72
·エージェント·★ 会員·論文·14分で読めます
論文解説: SWE-bench Science — コーディングエージェントは「科学のコード」を直せるか
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
科学ソフトウェアの修理をコーディングエージェントに解かせるベンチマーク SWE-bench Science(119タスク・98リポジトリ・20分野)の解説。最良のエージェントでも pass@1 は50%未満で、4つの失敗機構と「科学知識は必ずしも効かない」というアブレーション結果を読み解く。
73
·推論・高速化·★ 会員·論文·15分で読めます
構造化出力と制約デコーディング — JSONを壊さない仕組み
Efficient Guided Generation for Large Language Models
「JSONで返して」とお願いする代わりに、文法的に許されないトークンを出す前に確率ゼロへ落とす — 制約デコーディングの仕組みを、logitマスクから語彙のインデックス化、function callingの裏側、そして「構文は守れても中身は守れない」限界まで1から解説する。
74
·確率・統計·★ 会員·論文·16分で読めます
統計学習理論 — なぜ学習は汎化するのか
Understanding Deep Learning Requires Rethinking Generalization
有限個の例しか見ていないのに、なぜ未知のデータに答えられるのか。Hoeffdingの不等式からVC次元・PAC学習まで汎化の保証を1から組み立て、それが深層学習の前で破れた経緯と、評価設計での使いどころまでを解説する。
75
·機械学習の基礎·★ 会員·論文·14分で読めます
自己教師あり学習 — ラベルなしデータが宝になった日
A Simple Framework for Contrastive Learning of Visual Representations
人がラベルを貼らなくても、データは自分で問題を作れる。マスク予測と対照学習という2つの流派を、比喩→InfoNCEの式→動く図→PyTorchコードの順に前提知識ゼロから解説し、LLMの事前学習がなぜ「最大の自己教師あり学習」なのかまでつなげます。
76
·生成モデル·★ 会員·論文·15分で読めます
拡散モデルの数学 — スコアとSDEで見る生成
Generative Modeling by Estimating Gradients of the Data Distribution
拡散モデルを「ノイズを足して引く」の一段下、スコア(対数確率の勾配)の言葉で捉え直す。なぜノイズ除去がスコア推定と同じことなのか、前向き・逆向きSDEと確率フローODEが何を言っているのか、そしてその式が推論設定のつまみにどう化けるかまで。
77
·LLM — 大規模言語モデル·★ 会員·論文·12分で読めます
スケーリング懐疑論 — 「大きくするだけ」批判の系譜
Training Compute-Optimal Large Language Models
「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。
78
·RAG・検索拡張·★ 会員·論文·16分で読めます
RAG評価の実務 — 「なんとなく良い」を数字にする
RAGAS: Automated Evaluation of Retrieval Augmented Generation
RAGの改善が迷子になるのは、良し悪しを一つの感覚で見ているからだ。検索と生成を切り離して測る指標、忠実性と関連性の定義、合成QAで評価セットを作る手順とその落とし穴、そして何問あれば数字を信じてよいのかまでを1から積み上げる。
79
·推論・高速化·★ 会員·14分で読めます
プロンプトキャッシュとコンテキスト設計 — 前方一致という一本の制約が、請求額を桁で変える
同じシステムプロンプトを毎回読み直させて、毎回その分を払っていませんか。プロンプトキャッシュは前方一致でしか効かない——この一点だけで、コンテキストに何をどの順で置くべきかが決まります。先頭に現在時刻を1つ入れただけで全滅する理由と、TTLを読み違えて逆に25%高くなる事故まで。
80
·確率・統計·★ 会員·論文·15分で読めます
最適輸送 — 分布を運ぶ数学
Sinkhorn Distances: Lightspeed Computation of Optimal Transport
2つの確率分布の距離を「砂を運ぶ最小コスト」として測るのが最適輸送。Wasserstein距離の定義から、実用の主役であるSinkhornアルゴリズム、WGAN・FID・Flow Matchingへの接続、そして現場で踏む落とし穴までを比喩とnumpyコードで積み上げる。
81
·モデル系統図鑑·★ 会員·13分で読めます
オープンvsクローズド — 重み公開の経済学と安全論争
なぜ企業は巨費をかけて訓練した重みを無料で配るのか。オープンウェイトとオープンソースの決定的な違い、実際に事故になるライセンス条項、そして「公開すべきか」を巡る両陣営の言い分と意外な収束点を、前提知識ゼロから解説する。
82
·デバイス物理·★ 会員·13分で読めます
NANDフラッシュの物理 — 電子を閉じ込めて記憶する
電源を切っても消えないのはなぜか。絶縁体の島に電子を閉じ込めてしきい値電圧をずらす、というたった1つの原理から、トンネル書き込み・多値化・3D積層・摩耗までを前提知識ゼロで積み上げ、SSDの仕様書とSMARTの数字が読めるところまで持っていきます。
83
·エージェント·★ 会員·論文·12分で読めます
マルチエージェント設計パターン — 分担・討論・検証
Improving Factuality and Reasoning in Language Models through Multiagent Debate
エージェントを何体並べても、全員が同じ間違い方をするなら1体と変わりません。多数決が効く条件を式で押さえたうえで、分担・討論・敵対的検証の3つの型を、いつ使い、いつ1体で済ませるべきかまで整理します。
84
·確率・統計·★ 会員·12分で読めます
モンテカルロ法を1から — 積分をサイコロで解く
解けない積分は、乱数を降らせて平均を取れば近似できます。大数の法則がなぜ 1/√N の遅さを生むのか、重点サンプリングで何が救えるのか、そして正規化定数が分からない分布をMCMCがどう扱うのかを、前提知識ゼロから積み上げます。
85
·機械学習の基礎·★ 会員·11分で読めます
MLシステム設計 — モデルの外側の9割
ノートブックで出た精度は、本番では約束になりません。特徴量の定義、学習と推論のズレ(スキュー)、劣化に気づく監視、そして再学習の輪。モデルの外側にある「9割」を、前提知識ゼロから設計の順番に並べ直します。
86
·モデル系統図鑑·★ 会員·13分で読めます
Mistral系を1から — 小型高性能の欧州勢
パリ発のMistral AIはなぜ「小さいのに強い」を実現できたのか。Mistral 7Bのスライディングウィンドウ注意、Mixtralの疎なMoE、Codestralなどコード系の派生、そしてApache 2.0から始まって揺れ動いたライセンス方針までを、前提知識ゼロから通しで解説する。
87
·エージェント·無料·15分で読めます
MCPとツールプロトコル — エージェントの手をつなぐ規格
LLMがカレンダーやデータベースを触るとき、その「手」はどう繋がっているのか。ツール呼び出しの正体から、MCPが解いたN×M問題、tool定義の設計、そして避けて通れないセキュリティ境界までを前提知識ゼロから解説します。
88
·Transformerの仕組み·★ 会員·論文·13分で読めます
長文脈LLMの技術 — RoPE補間からリング注意まで
Extending Context Window of Large Language Models via Positional Interpolation
「コンテキスト長128K」の中身は、性格の違う二つの壁を別々に越えた結果です。位置の壁を越える位置補間・NTK・YaRN、計算の壁を越える窓とリング注意、そして越えられたかを測るneedle試験の読み方を、前提知識ゼロから順に追います。
89
·推論・高速化·無料·論文·13分で読めます
LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない
Efficient Memory Management for Large Language Model Serving with PagedAttention
モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。
90
·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます
LLM評価を1から — ベンチマークの読み方と汚染問題
Measuring Massive Multitask Language Understanding
モデル発表資料に並ぶベンチマークの棒グラフを、正しく疑いながら読むための記事。採点方式がMMLUのスコアを動かす仕組み、問題数から来る誤差の幅、公開ベンチマークが構造的に汚染される理由、Chatbot ArenaのBradley-Terryモデルとその弱点、LLM-as-a-judgeの三つの偏りまでを1から扱う。
91
·符号化の理論·★ 会員·13分で読めます
LDPCとTurbo符号 — 5Gと宇宙探査を支える誤り訂正
シャノンが1948年に「存在する」と証明し、45年間だれも作れなかった符号。軟判定・対数尤度比・信念伝播という3つの道具で、なぜ理論限界の目前まで届いたのかを前提知識ゼロから解き、5G NRと深宇宙通信で実際に何が動いているかまでつなげます。
92
·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます
知識蒸留を1から — 大きなモデルを小さく写す
Distilling the Knowledge in a Neural Network
正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。
93
·確率・統計·★ 会員·論文·15分で読めます
カーネル法とガウス過程 — NN以前の王者
Practical Bayesian Optimization of Machine Learning Algorithms
深層学習が来る前、分類の王座に座っていたのはSVMとカーネル法だった。高次元へ持ち上げるコストをタダにする「カーネルトリック」から、関数そのものに確率を置くガウス過程、そして不確実性を武器にするベイズ最適化までを、前提知識ゼロで組み立てる。
94
·微分と最適化の数学·★ 会員·15分で読めます
ヤコビアンとヘッセ行列 — 多変数の微分を図で
ヤコビアンは「その場の拡大鏡」、ヘッセ行列は「その場の曲がり具合」。局所線形化から、固有値による地形の分類、ニュートン法が理論上は速いのに使われない理由、そして10億次元でも計算できるヘッセ行列ベクトル積までを一本につなぎます。
95
·数値計算·★ 会員·16分で読めます
連立方程式の解き方 — 直接法と反復法
橋のたわみも部屋の温度もガウス過程回帰も、計算機にやらせる段では Ax=b という同じ形に化けます。消していく直接法(LU)と近づいていく反復法(共役勾配法)を、なぜ100万元の方程式が消去法で解けないのかから始めて、条件数・前処理・matrix-free まで前提知識ゼロでつなぎます。
96
·計算機アーキテクチャ·★ 会員·11分で読めます
インターコネクト — NVLink・PCIe・光が決めるスケール
GPUを増やしても速くならない理由は、たいてい配線の側にあります。HBMからNVLink、PCIe、ノード間ネットワークまでの帯域の階層を桁で押さえ、集合通信の時間を「段数×遅延+バイト数÷帯域」に分解し、なぜall-to-allがきついのか、なぜ距離が光を要求するのかを前提知識ゼロから追います。
97
·推論・高速化·★ 会員·13分で読めます
推論コスト削減の実務 — 何から手を付けるか
量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。
98
·機械学習の基礎·★ 会員·14分で読めます
不均衡データの実務 — 99%が正常のとき何を最適化するか
陽性が1%しかないデータでは正解率が嘘をつく。混同行列からPR曲線、重み付け・サンプリング・確率の較正、そして期待コストから閾値を逆算するところまでを、前提知識なしで積み上げる。
99
·CNN・画像認識·無料·論文·12分で読めます
ImageNetの瞬間 — 深層学習が勝った日
ImageNet Large Scale Visual Recognition Challenge
2012年、画像認識のコンテストで誤り26%の壁が15%まで一気に落ちた。ニューラルネットは30年前からあったのに、なぜその年だったのか。データ・計算・手法という3条件が揃った瞬間を、技術の中身まで下りて解き直します。
100
·生成モデル·無料·論文·16分で読めます
画像生成の実務地図 — SD・ControlNet・LoRA適用
LoRA: Low-Rank Adaptation of Large Language Models
画像生成をこれから触る人のための一枚地図。潜在拡散の4つの箱、プロンプトが効く場所、ControlNetによる構図の固定、LoRAでの微調整、そして見落とすと事故になるライセンスまでを、前提知識ゼロから順に繋ぎます。
101
·深層学習の基礎·★ 会員·論文·17分で読めます
ハイパーパラメータ探索 — 勘・グリッド・ベイズ最適化
Random Search for Hyper-Parameter Optimization
学習率やバッチサイズは勾配が教えてくれないので、探すしかありません。なぜグリッドサーチが弱いのか、探索空間を対数で切る理由、ベイズ最適化の獲得関数が何を数えているのか、早期打ち切りが探索アルゴリズムより効く理由を、Optunaのコードと現場の落とし穴まで含めて前提知識ゼロから解説します。
102
·LLM — 大規模言語モデル·無料·論文·11分で読めます
ハルシネーションはなぜ起きる — 仕組みと現実的な対策
Survey of Hallucination in Natural Language Generation
LLMが平然と嘘をつくのはバグではなく、次トークン予測という学習目的の素直な帰結。損失関数に真偽の項がないこと、圧縮された知識が端から崩れること、サンプリングが裾を引くこと、採点方法が当てずっぽうに報酬を与えることを1から分解し、RAG・引用照合・不確実性推定という現場で実際に効く順に対策を並べる。
103
·推論・高速化·★ 会員·論文·15分で読めます
GPUメモリ不足サバイバル — OOMの原因と対処の全パターン
Training Deep Nets with Sublinear Memory Cost
`CUDA out of memory` は、最後に失敗した確保だけを報告する不親切なエラーです。犯人はたいてい、すでに載っている側にいます。何がVRAMを食うのかを5つの箱に分けて数え、パラメータ1個あたり16バイトという学習の固定費を出し、そこから勾配チェックポイント・オプティマイザ圧縮・オフロード・KVキャッシュ管理・断片化まで、打ち手を副作用の小さい順に。
104
·深層学習の基礎·★ 会員·論文·15分で読めます
GNNを1から — つながりを学ぶネットワーク
Semi-Supervised Classification with Graph Convolutional Networks
SNSも分子も道路網も「点と線」でできています。隣の情報を集めて自分を書き換えるメッセージパッシングを前提知識ゼロから組み立て、層を深くすると全ノードが同じ顔になるオーバースムージング、そして推薦と創薬での実際の使われ方までを一本の道でつなぎます。
105
·エージェント·★ 会員·論文·18分で読めます
論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。
106
·Transformerの仕組み·★ 会員·論文·13分で読めます
FlashAttentionを1から — 計算を増やして速くする逆説
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。
107
·OSと実行環境·★ 会員·12分で読めます
ファイルシステムを1から — 「保存した」は何を保証するか
エディタが「保存しました」と言った直後に電源が落ちたら、そのファイルは残るのか。図書館の目録という比喩から出発して、ブロック・inode・ディレクトリ・ジャーナリング・fsyncまでを前提知識ゼロで積み上げ、なぜデータベースがファイルシステムを信用しないのか、現場で何を触ると事故になるのかまで降ろします。
108
·線形代数·★ 会員·論文·12分で読めます
対称性と等変性 — 群論がネットワーク設計に効く
Group Equivariant Convolutional Networks
「ずらしても猫は猫」をネットワークの構造そのものに焼き込む考え方を、群の4条件から等変性の定義式、CNNのパラメータ共有、AlphaFoldのフレームまで一本につなぎます。対称性を課すのが逆効果になる場面も含めて。
109
·学習手法・アライメント·★ 会員·論文·18分で読めます
DPOとその後 — RLHFを単純化する系譜
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
報酬モデルを別に建てずに選好から直接学ぶDPOの導出を、KL制約付き最大化の閉形式解から一段ずつ追う。さらにDPOの過学習を数式で説明したIPO、ペアを要求しないKTO、価値モデルを捨ててオンラインへ戻ったGRPOまでを「何を消したか」で整理し、手元のデータの形から選ぶ基準をまとめる。
110
·データベース·★ 会員·論文·12分で読めます
分散データベース — CAP・レプリケーション・合意
In Search of an Understandable Consensus Algorithm (Raft) — Diego Ongaro
データベースを2台に増やした瞬間、「どちらが正しいのか」という新しい問いが生まれます。レプリケーション・クォーラム・CAP定理・2相コミット・Raft・結果整合性を、前提知識ゼロから、PostgreSQLやCassandraで実際に触るパラメータ名まで降ろして解説します。
111
·学習手法・アライメント·★ 会員·15分で読めます
データとモデルのバージョン管理 — 再現できない実験は存在しない
「精度92%出ました」を半年後に再現できないなら、それは実験ではなく逸話です。中身からidを作るコンテンツアドレス、入力から出力への系譜(リネージ)、そして「どこまで固定すると割に合うか」の3段階を、ハッシュの式・マニフェストのコード・現場の落とし穴まで前提知識ゼロから解説します。
112
·機械学習の基礎·★ 会員·14分で読めます
データリークと実験管理 — 精度が高すぎたら疑うこと
モデルの数字が思ったより良いとき、喜ぶ前に疑うべきものがあります。予測時点では手に入らない情報が学習や選択に混ざる「リーク」を、結果由来の列・前処理・時間・重複・テストの擦り切れの5種類に分けて解説し、ラベルシャッフルなどの検知手順と、原因を後から特定できる実験記録の作り方までを前提知識ゼロから積み上げます。
113
·並列・分散·★ 会員·12分で読めます
並行処理を1から — ロック・アトミック・メモリモデル
データ競合はなぜ起きるのか、なぜテストで再現しないのかを前提知識ゼロから解説。ロック・アトミック操作・CAS・メモリモデルまで、比喩と式とコードで順に積み上げます。
114
·情報理論·★ 会員·論文·14分で読めます
圧縮=予測=知能 — 情報理論から見るLLM
Language Modeling Is Compression
次のトークンを当てる訓練は、そのままファイルを縮める訓練でもあります。算術符号化を経由すると「確率モデル」と「符号」が同じものだと分かり、交差エントロピー損失が圧縮後のバイト数そのものになる。Hutter Prizeが圧縮率を知能の指標に据えた理由まで、1から積み上げます。
115
·機械学習の基礎·★ 会員·論文·14分で読めます
教師なし学習を1から — クラスタリングと次元削減
UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction
正解ラベルが1つも無いデータから構造を取り出す方法を、前提知識ゼロから。k-means・階層・DBSCANの向き不向き、PCAが何を最大化しているのか、そしてt-SNE/UMAPの図でやってはいけない3つの誤読までを、比喩→式→動く図→コードの順で解説する。
116
·学習手法・アライメント·★ 会員·論文·11分で読めます
継続学習と破滅的忘却 — 学び続けるモデルの難しさ
Overcoming catastrophic forgetting in neural networks
追加学習させると前にできていたことが崩れる「破滅的忘却」を、重みが共有資源であるという一点から説明する。EWC・リプレイ・LoRA差し替えという3つの処方を式と動く図で追い、それでも実務が「昔のデータを混ぜて学習し直す」に落ち着く理由までを前提知識なしで解説。
117
·微分と最適化の数学·★ 会員·17分で読めます
変分法 — 「関数を微分する」とはどういうことか
探しているのが「数」ではなく「形」のとき、微分はどう姿を変えるのか。汎関数と第一変分、オイラー=ラグランジュ方程式、最速降下線がサイクロイドになる理由、そして機械学習でいちばん使われる変分問題であるELBOまでを一本につなぎます。
118
·RAG・検索拡張·★ 会員·論文·18分で読めます
【実装】ベクトルDBを自作する — 線形走査からHNSWへ
Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs
ベクトル検索の中身を、20行の線形走査から段階的に組み立てる。次元の呪い、IVFによる空間分割、HNSWのグラフ探索、量子化までを「再現率と速度の取引」という一本の軸で解説する。
119
·Transformerの仕組み·★ 会員·論文·15分で読めます
【実装】BPEトークナイザを自作する — マージ規則を学習し、日本語で殴られる
Neural Machine Translation of Rare Words with Subword Units
BPEの学習器とエンコーダを自分で書く。マージ規則が「順序付きの手順書」であること、素朴な数え直しをどう捨てるか、日本語では語彙の先頭数千枠が「文字を組み立てる」ことに消える理由、語彙サイズを振る実験の正しい測り方までを実装の手触りで追う。
120
·Transformerの仕組み·★ 会員·論文·19分で読めます
【実装】ミニGPTを自作する — 300行の言語モデル
Attention Is All You Need
PyTorchで文字単位のミニGPTを最初から組む。トークナイザ・因果マスク付き自己注意・学習ループ・温度サンプリングまでを1本のコードとして通し、シェイクスピアの文体が立ち上がるまでを追う。
121
·生成モデル·★ 会員·論文·15分で読めます
【実装】拡散モデルを自作する — MNISTからはじめる
Denoising Diffusion Probabilistic Models
28×28の手書き数字で拡散モデルを最小構成から組み上げます。ノイズスケジュールが満たすべき2条件、UNetにステップ番号を注入する方法、サンプリングの最後にノイズを足し直す理由まで、自分で書いて初めて詰まる場所を順に潰していきます。
122
·数値計算·★ 会員·18分で読めます
【実装】自動微分を自作する — 100行のミニPyTorch
Valueクラス1つから始めて、演算子オーバーロード・トポロジカル順序・勾配の加算までを組み上げ、その上にニューラルネットを載せて学習させます。設計の理由を辿ると、zero_grad() や retain_graph が仕様の暗記ではなく必然に変わります。
123
·エージェント·★ 会員·論文·12分で読めます
【実装】エージェントループを自作する — ツール呼び出しの最小形
ReAct: Synergizing Reasoning and Acting in Language Models
「AIエージェント」の中心はwhile文ひとつです。JSON関数呼び出しの形、ReActが残した設計、そして事故のほとんどが集まる停止条件までを、フレームワークを使わない40行のコードとして1から組み上げます。
124
·Transformerの仕組み·★ 会員·論文·12分で読めます
エンコーダとデコーダ — BERTとGPTの分岐点
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
同じTransformerから生まれたBERTとGPTを分けたのは、注意の表を隠すマスク1枚だった。双方向と自己回帰の違いを式と動く図で確かめ、なぜ生成側が主流になり、それでもエンコーダが検索と分類の現場で使われ続けるのかを解く。
125
·音声系·★ 会員·論文·17分で読めます
音の表現 — メルスペクトログラムとトークン化
Robust Speech Recognition via Large-Scale Weak Supervision
音声モデルが波形をそのまま食べない理由から出発し、短時間フーリエ変換 → メル目盛り → 対数 → 離散トークンという変換の連鎖を前提知識ゼロで解説。窓長のトレードオフ、MFCCがDCTを捨てた事情、音響トークンと意味トークンの違い、そして設定を1つ間違えるだけで音が壊れる現場の落とし穴まで。
126
·生成モデル·★ 会員·論文·11分で読めます
音楽・音声生成を1から — トークン化された音
Simple and Controllable Music Generation
3分の曲は1500万個以上の数値でできています。音楽生成の技術史は、この途方もない数列をどう畳むかの歴史でした。コーデックトークン、自己回帰と拡散の分かれ道、テキスト条件づけ、そしてSuno系サービスの構造を公開された部品から組み立て直すところまで、前提知識ゼロで解説します。
127
·エージェント·★ 会員·論文·13分で読めます
論文解説: ASI-Bench — 手引きを1枚ずつ剥がして、AIの「自力」を測る
ASI-Bench: At the Dawn of Artificial Superintelligence
同じ研究課題から人間の方法論的な手引きだけを段階的に剥がし、AIエージェントがどこまで自力で進めるかを測るベンチマーク ASI-Bench を、一次資料である論文本文から解説する。平均スコアは50.91→29.10→26.62へ落ち、崩れる場所は「手法選び」ではなかった。
128
·論文解説·★ 会員·論文·14分で読めます
論文解説: Apodex 1.1 — 「完了した仕事」を単位にエージェントをスケールさせる
Apodex 1.1: Scaling Agentic Intelligence for Complex Work
モデルを大きくするのでも推論時間を伸ばすのでもなく、「環境」と「協調」の2面をスケールさせる——Apodexチームの技術報告を、タスク契約の式からAgentOSの納品ゲート、数字と限界まで1から解説する。
129
·エージェント·★ 会員·論文·11分で読めます
AlphaGoを1から — 探索と学習の結婚
Mastering the game of Go with deep neural networks and tree search (Silver et al.
囲碁が長く「解けない」とされた理由から始め、方策ネットワーク・価値ネットワーク・モンテカルロ木探索・自己対戦が互いの弱点をどう埋め合うかを式とコードで解きほぐす。最後に、この設計がLLMの推論時計算にどう受け継がれたかを整理する。
130
·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます
アライメント概説 — RLHFからConstitutional AIまで
Training language models to follow instructions with human feedback
アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。
131
·エージェント·★ 会員·論文·14分で読めます
エージェントの記憶設計 — 短期・長期・エピソード
MemGPT: Towards LLMs as Operating Systems
LLMは何も覚えていません。会話が続いて見えるのは毎ターン全履歴を読み直させているからです。短期・エピソード・長期の3層に分ける設計、想起を決める式、そして最も設計されていない「忘れる」まで、前提知識ゼロから組み立てます。
132
·エージェント·★ 会員·論文·15分で読めます
エージェント評価 — ベンチとハーネスの作法
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。
133
·確率・統計·★ 会員·13分で読めます
統計的検定とABテスト — p値の使い方と誤用
同じ画面を2つ並べても数字は必ずずれます。そのズレを「偶然のブレ何個分か」に換算するのが検定であり、p値です。帰無仮説の作法から、検出力・逐次検定・多重比較という3つの事故まで、前提知識ゼロから積み上げます。
134
·音声系·★ 会員·論文·14分で読めます
音声合成を1から — テキストから声まで
WaveNet: A Generative Model for Raw Audio
数文字のテキストから、その数万倍の長さの波形をでっちあげる——それが音声合成です。素直な回帰がなぜ破綻するのか(一対多と位相)、なぜテキスト→メルスペクトログラム→波形の二段構えが定番になったのか、そして数秒の参照音声で声色が移る仕組みまでを前提知識ゼロから解説します。
135
·Transformerの仕組み·無料·論文·13分で読めます
Transformer完全解剖 — 埋め込みから出力まで一気通貫
Attention Is All You Need
「今日は」と打ってから「いい天気」が返るまで、たった1つのトークンが何を持たされ、どこで書き換えられ、最後にどうやって言葉に戻るのか。分かち書き・埋め込み・位置・注意・フィードフォワード・残差・出力ヘッドまで、部品を並べるのではなく1本の旅として通しで歩く地図。
136
·データベース·★ 会員·12分で読めます
トランザクションとACID — 同時実行の地獄と分離レベル
送金の途中で電源が落ちても残高が消えないのはなぜか、なぜ「テストは通るのに本番でだけ数字が合わない」バグが生まれるのかを前提知識ゼロから。原子性・分離レベル・MVCC・デッドロックを、実際のSQLとPostgreSQL/MySQLのパラメータ名まで降ろして解説します。
137
·セキュリティ·★ 会員·14分で読めます
TLSを1から — 鍵交換と証明書の仕組み
HTTPSの鍵アイコンの裏側では、初対面の相手と、盗聴されている経路の上で秘密を作るという離れ業が起きています。鍵交換・証明書・ハンドシェイクを前提知識ゼロから積み上げ、なぜ中間者攻撃を防げるのかを一続きで追います。
138
·線形代数·無料·14分で読めます
テンソルと形状操作 — einsumが読めれば論文が読める
論文の Σ_j A_ij B_jk と、コードの x.transpose(1,2) は同じことを言っています。その橋渡しをするのが einsum 記法です。軸・ブロードキャスト・縮約という3つの道具だけで、Attentionの実装が1行で書けるところまで。
139
·ネットワーク·無料·15分で読めます
TCPからQUICへ — 信頼できる通信の再発明
インターネットの土台は「届かないかもしれない」仕組みです。TCPが順番・再送・輻輳制御でどう信頼性を作り出したか、なぜHTTP/2で行き詰まったか、そしてQUICがあえてUDPの上に全部を作り直した理由を、前提知識ゼロから積み上げます。
140
·クラウドと運用·無料·13分で読めます
サーバーレスとコスト設計 — 破産しないクラウド
「使った分だけ払う」は「使われた分だけ請求される」でもあります。スケールゼロの仕組み、GB-秒という課金単位、請求が指数で伸びる事故のパターンを前提知識ゼロから積み上げ、最後は自分のプロジェクトにキルスイッチを設計できるところまで持っていきます。
141
·言語処理系·★ 会員·15分で読めます
Pythonはなぜ遅いのか、をちゃんと言う
「Pythonは遅い」の中には、1演算あたりの手間・メモリの並び方・並列に回らないという別々の3つの話が混ざっています。オブジェクトと評価ループ、NumPyが速い本当の理由、GILが何を守っているのか、そしてPEP 703以降のfree-threadedビルドがどこまで解決するのかを、前提知識ゼロから積み上げます。
142
·データ構造·★ 会員·論文·16分で読めます
確率的データ構造 — 数えずに数える
Space/Time Trade-offs in Hash Coding with Allowable Errors (Bloom
ブルームフィルタ・HyperLogLog・Count-Minスケッチを前提知識ゼロから解説。「少しだけ間違える権利」と引き換えにメモリを数KBに固定する仕組みと、巨大サービスの裏でどう運用されているかまで。
143
·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます
事前学習データの作り方 — Webから教科書品質へ
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。
144
·OSと実行環境·無料·16分で読めます
プロセスとメモリを1から — OSは何を守っているのか
アプリが1つ落ちてもパソコン全体は落ちない。その当たり前を支えているのが、プロセスの隔離と仮想メモリです。私書箱の比喩から出発して、ページング・アドレス変換・TLB・ページフォルト・スワップ・OOM killer までを前提知識ゼロで積み上げ、最後は free や dmesg を自分で読めるところまで持っていきます。
145
·クラウドと運用·★ 会員·12分で読めます
可観測性 — ログ・メトリクス・トレースの実務
深夜に鳴った電話に、本番へ入り直さずに答えられるか。構造化ログ・メトリクスのカーディナリティ・分散トレースの伝播・SLOとエラーバジェットを前提知識ゼロから積み上げ、「気づく→絞る→確定させる」という一本の線に並べ直します。
146
·セキュリティ·★ 会員·論文·13分で読めます
LLMセキュリティ — プロンプトインジェクションと防御
Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
LLMは「上司の指示」と「書類に書かれた文字」を区別できない。この一点から生まれる直接注入・間接注入・ツール境界の問題を前提知識ゼロから解き、プロンプトで守ろうとする誤りと、実行層に境界を置く多層防御の組み方までを扱う。
147
·言語処理系·★ 会員·13分で読めます
JITとGC — 実行しながら速くする・掃除する
実行時コンパイラ(JIT)とガベージコレクタ(GC)は、どちらもアプリを止めずに裏で働く仕事です。ホットスポット検出・段階コンパイル・インライン化・投機と脱最適化・世代別GC・三色マーキング・ライトバリアを前提知識ゼロから積み上げ、最後はGCログとJITログを自分で読めるところまで。
148
·ネットワーク·★ 会員·10分で読めます
HTTP/1.1→2→3 — 多重化への道
HTTPの30年は「1本の接続で何件同時に喋れるか」を巡る改良の歴史です。1.1の一問一答がなぜ渋滞を生んだか、2がフレームとストリームで何を解き、その詰まりがなぜ下の階へ移っただけだったか、3がQUICで何を分離したか。そして自分の環境でどう測って選ぶかまでを、前提知識ゼロから積み上げます。
149
·RAG・検索拡張·★ 会員·論文·14分で読めます
GraphRAGを1から — 知識グラフと検索の融合
From Local to Global: A Graph RAG Approach to Query-Focused Summarization
文書をエンティティと関係の網に組み替えると、普通のRAGでは原理的に答えられない「全体としてどうなのか」に届く。抽出・名寄せ・コミュニティ要約・local/global検索を1から積み上げ、最後に「どこで過剰か」を正直に見積もる。
150
·クラウドと運用·★ 会員·13分で読めます
GPUクラウドの経済学 — 借りるか・買うか・予約するか
同じGPUには4つの値段が同時についている。オンデマンド・予約・スポット・自前を1本の式で比べ、損益分岐の稼働率、中断込みのスポット実効単価、コミットの消化率、そして請求書に隠れる項目までを掛け算と割り算だけで追う。
151
·モデル系統図鑑·★ 会員·13分で読めます
GPT系譜 — GPT-1から現在までの設計思想
GPT-1からGPT-4o・推論モデルまで、各世代で「何を変え、何を変えなかったのか」を追う。設計の中心にあるのは一貫して『次の一語を当てる』だけの機械で、変わったのは規模・学習の順序・出力の躾け方だった。
152
·VLM・マルチモーダル·★ 会員·論文·11分で読めます
文書理解とOCRのいま — 帳票をLLMが読むまで
LayoutLM: Pre-training of Text and Layout for Document Image Understanding
請求書やスキャンPDFを機械が読むまでを1から。テキスト検出とCTC、誤りの測り方(CER)から、レイアウトを座標ごと埋め込むLayoutLM系、OCRを丸ごと捨てるDonut系、そして画像をそのままLLMに渡す現在までを、表・手書き・幻覚という実務の壁とあわせて解説する。
153
·ネットワーク·★ 会員·14分で読めます
DNSとCDN — URLを打ってから画面が出るまで
アドレスバーにEnterを押してから画面が出るまでの1秒足らずの間に、名前解決の旅とキャッシュ階層とエッジ配信が順番に走っています。DNSが木構造をどう辿るか、TTLが何を約束していないか、CDNが距離という物理をどう誤魔化すかを、前提知識ゼロから積み上げます。
154
·確率・統計·無料·16分で読めます
確率分布図鑑 — 正規・ポアソン・指数族はどこから来るか
正規分布もポアソン分布も、暗記すべき公式ではなく「ある状況から必然的に出てくる形」です。足し算・希少な出来事・最大エントロピーという3つの物語をたどると、教科書に並ぶ分布たちが指数族という1本の川に合流し、sigmoidとsoftmaxがなぜあの形をしているのかまで見えてきます。
155
·データベース·無料·12分で読めます
データベース内部構造 — SQLの1行の裏側
SELECT文を投げてから結果が返るまでに、データベースの中ではパーサ・リライタ・プランナ・実行器・ストレージの5工程が動いています。なぜ同じ結果を返すのに速いプランと遅いプランがあるのか、なぜ統計が古いと突然遅くなるのかを、前提知識ゼロから実務のパラメータ名まで。
156
·学習手法・アライメント·★ 会員·論文·12分で読めます
データセット構築の実務 — 集める・洗う・混ぜる
Self-Instruct: Aligning Language Models with Self-Generated Instructions
モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。
157
·セキュリティ·無料·16分で読めます
暗号を1から — 共通鍵・公開鍵・ハッシュ
暗号は「読めない文字を作る技術」ではなく「元に戻す手間に極端な差を作る技術」です。共通鍵・公開鍵・ハッシュという3つの道具を前提知識ゼロから積み上げ、なぜ素因数分解が使われるのか、署名は何を保証するのか、そして過去の暗号がどう壊れてきたかまでを一続きで追います。
158
·OSと実行環境·★ 会員·15分で読めます
コンテナを1から — namespaceとcgroupの正体
コンテナは軽い仮想マシンではなく、見えるものを制限されたただのプロセスです。namespace(見え方の隔離)・cgroup(使用量の上限)・イメージ(層の積み重ね)の3つに分解し、比喩から overlayfs・cpu.max・exit 137 の読み方まで、前提知識ゼロで積み上げます。
159
·言語処理系·無料·13分で読めます
コンパイラを1から — ソースが機械語になるまで
たった1行の式が、字句解析・構文解析・意味解析・中間表現・最適化・コード生成の6工程を通って1命令の機械語になるまでを、前提知識ゼロから追い切ります。なぜ -O2 でバグが表に出るのか、なぜベンチマークのループが消えるのかも、この道筋の上で説明できます。
160
·セキュリティ·★ 会員·19分で読めます
認証と認可 — パスワードからOAuth・パスキーまで
「あなたは誰か」と「あなたは何をしてよいか」は別の問題です。パスワードの保存、セッションとトークン、OAuthの4人の登場人物、そしてパスキーがなぜフィッシングに強いのかまでを、前提知識ゼロから一続きで積み上げます。
161
·計算量と評価·★ 会員·16分で読めます
近似アルゴリズム — 厳密を諦めて保証を取る
最適解を諦める代わりに「最悪でも◯倍以内」という値札を付ける技術。近似比の定義から、貪欲アルゴリズムの保証を最後まで証明する手つき、巡回セールスマンで三角不等式の有無が結論をひっくり返す理由までを前提知識ゼロで積み上げます。
162
·製造とパッケージ·★ 会員·13分で読めます
歩留まりと設計 — DFMという妥協の技術
シミュレーションで正しく動く回路が、量産では良品にならないことがある。欠陥密度モデルとクラスタ係数、描いてよい形を制限する設計ルール、壊れる前提の冗長化、そして同じダイを別製品に切り分けるビニングまで、「性能を差し出して良品率を買う」設計の技術を前提知識ゼロから解説する。
163
·深層学習の基礎·★ 会員·論文·20分で読めます
重みの初期化と正則化 — 学習が始まる条件・続く条件
Understanding the Difficulty of Training Deep Feedforward Neural Networks
同じ設計図でも、重みに入れた乱数の大きさひとつで学習は始まりも止まりもします。分散の伝播からXavier・He初期化を導き、続いてweight decayとdropoutが「学習が続く条件」をどう作るかを、動く図とPyTorch実装、現場の落とし穴まで含めて前提知識なしで解説します。
164
·時系列データ系·★ 会員·論文·13分で読めます
時系列異常検知 — 監視の現場で動いている数学
Bayesian Online Changepoint Detection
監視のアラートは、値の大きさではなく「その時刻に期待される値とのずれ」で鳴らすべきです。ロバストな統計量・予測残差・部分列の近傍距離・変化点検出という4つの物差しを比喩から式まで積み上げ、実務で最も事故が多い閾値の決め方と評価の罠まで扱います。
165
·スケーリングと電力·★ 会員·13分で読めます
熱設計を1から — 3D積層の壁は熱
チップに入った電力はほぼ全部が熱になって出てくる。温度を決めるのは熱抵抗の直列スタックで、ダイを縦に積むと最も遠い層の温度上昇は層数の2乗で効く。熱流束とホットスポット、熱容量による時間遅れ、液冷が実際に潰している項までを、電力バジェットの続きとして1から追います。
166
·計算機アーキテクチャ·★ 会員·論文·12分で読めます
シストリックアレイ — TPUの心臓部を1から
In-Datacenter Performance Analysis of a Tensor Processing Unit
掛け算器を並べるだけでは速くならないのは、データを運ぶ手間が演算より重いからです。TPUの中心にある格子=シストリックアレイが、行列積の三重ループを縦・横・時間にどう割り当てているのかを、2×2の手計算からサイクル単位のコード、バッチと次元の実務まで前提知識ゼロで解きほぐします。
167
·現場のメディア実務·無料·14分で読めます
HLSとDASH — 動画が届くまでのプロトコル
配信されている動画は「流れて」いるのではなく、数秒ぶんの小さなファイルを順番にダウンロードしているだけです。セグメントとマニフェストの正体、プレイヤーが段を選ぶ仕組み、遅延がどこから生まれるか、低遅延化の手口、そしてCDNの役割までを1から解説します。
168
·音声圧縮·★ 会員·論文·14分で読めます
Opusはなぜ最強か — 現代音声コーデックの設計
Definition of the Opus Audio Codec
話し声用と音楽用に分かれていた音声コーデックを、SILKとCELTという2つのエンジンを1本のビットストリームに束ねて統合したのがOpusです。線形予測とMDCTの役割分担、帯域エネルギーを守るgain-shape量子化、遅延の内訳、そしてWebRTCの必須コーデックになった技術的・制度的な理由を前提知識ゼロから解説します。
169
·計算量と評価·無料·12分で読めます
NP完全を1から — 「解けない」ではなく「検証は速い」
NPはNon-Polynomialの略ではありません。「答えを見せられたら速く確認できる」というクラスの話です。P vs NP・還元・NP完全を前提知識ゼロから積み上げ、シフト表や配送計画といった現場の問題にそれがどう現れるかまで見ます。
170
·動画圧縮·★ 会員·論文·13分で読めます
ニューラル圧縮 — 学習するコーデック
End-to-end Optimized Image Compression
JPEGの量子化テーブルもH.264の予測モードも、人間が実験して手で決めた表でした。ニューラル圧縮はその設計自体をデータから学習させます。オートエンコーダとエントロピーモデルという2本柱、量子化が微分できない問題の回避策、ハイパープライア、そしてJPEG AIに至る標準化の焦点と現場の落とし穴までを1から解説します。
171
·音声圧縮·★ 会員·論文·17分で読めます
ニューラル音声コーデック — EnCodecとLLM音声の土台
High Fidelity Neural Audio Compression
MP3やOpusが人手で「捨て方」を設計したのに対し、ニューラル音声コーデックは符号化そのものを学習し、音を有限個の整数トークンに変えます。ベクトル量子化から残差量子化(RVQ)、EnCodecのビットレート計算、そしてVALL-EやAudioLMのような音声LLMがなぜこの上に建つのかまでを、前提知識ゼロから解説します。
172
·情報理論·★ 会員·論文·14分で読めます
相互情報量 — 「知っている」を測る
Representation Learning with Contrastive Predictive Coding
片方を知ると、もう片方の迷いがどれだけ減るか。それを1つの数字にしたのが相互情報量です。エントロピーの引き算という定義から、条件付き相互情報量・データ処理不等式・推定の難しさを経て、対照学習のInfoNCEがなぜ「相互情報量の下限」と呼ばれるのかまでをつなげます。
173
·画像圧縮·★ 会員·14分で読めます
WebP・AVIF・JPEG XL — 画像コーデック世代交代
JPEGより明らかに効率の良い後継が3つも出たのに、Webの画像はいまだJPEGだらけです。新顔3つの出自、なぜ静止画コーデックが動画コーデックから生まれるのか、そして「性能で勝っても共通語は死なない」という構造を、比較の作法と配信の実装まで含めて追います。
174
·探索と最適化·★ 会員·13分で読めます
焼きなましと遺伝的アルゴリズム — 厳密に解けない時の実務
最適解を保証しない探索法が、なぜ現場の配送計画やスケジューリングを支えているのか。局所探索の3点セットから、焼きなましの温度、遺伝的アルゴリズムの集団、そして「これを使ってはいけない場面」の見分け方までを積み上げます。
175
·微分と最適化の数学·★ 会員·16分で読めます
行列微分を1から — 逆伝播の数式を自分で導く
∂L/∂W = XᵀG の Xᵀ はどこから来たのか。行列微分は公式集の暗記ではなく、「トレースの中で dX を右端に回す」という1つの型です。分母レイアウトの形合わせから、線形層とsoftmax+交差エントロピーの勾配導出、倍精度での数値勾配チェックまで。
176
·探索と最適化·★ 会員·13分で読めます
線形計画を1から — 最適化の王道
限られた在庫・予算・時間の中で最善を選ぶ、いちばん古くていちばん使われている最適化の道具。定式化の3点セットから、答えが必ず「角」にある理由、シンプレックス法の歩き方、双対が教える「材料1kgの値打ち」まで、前提知識ゼロで積み上げます。
177
·アクセラレータ·★ 会員·10分で読めます
推論チップ戦国時代 — Groq・Cerebras・LPUの設計思想
推論専用チップが乱立するのは、デコードが計算ではなく読み出しで律速されるからです。SRAM全載せ(Groq/LPU)とウェハスケール(Cerebras)という2つの答え、ソフト側の反撃、そしてベンチマーク数値を鵜呑みにせず市場を読むための式を、前提知識ゼロから解説します。
178
·デバイス物理·★ 会員·12分で読めます
FinFETからGAAへ — トランジスタ立体化の必然
平らだったトランジスタが、なぜヒレになり、板の重ね合わせになったのか。短チャネル効果・DIBL・自然長という3つの道具で、FinFETとGAA(ナノシート)が設計者の趣味ではなく物理に追い詰められた必然だったことを、前提知識ゼロから解きます。
179
·モデル系統図鑑·無料·12分で読めます
DeepSeek系を1から — MoEと蒸留で殴り込んだ系譜
MoE・MLA・GRPO・蒸留という4つの道具でオープンLLMの勢力図を塗り替えたDeepSeekの系譜を、V2/V3/R1の設計判断に沿って前提知識ゼロから解説。話題になった学習コストの数字の読み方と、蒸留モデルの正しい使いどころまで。
180
·機械学習の基礎·無料·論文·14分で読めます
決定木と勾配ブースティング — 表データ最強の座は今も
XGBoost: A Scalable Tree Boosting System
行と列でできた「表」のデータでは、いまも決定木を束ねた勾配ブースティングが第一候補です。分岐の直感からアンサンブル、XGBoost/LightGBMの中身、そしてニューラルネットが表データで勝ちきれない理由までを、前提知識ゼロから積み上げます。
181
·計算機アーキテクチャ·★ 会員·論文·12分で読めます
CPUパイプラインと分岐予測 — 1クロックの中の工場
Spectre Attacks: Exploiting Speculative Execution
1命令が1クロックで終わるように見えるのは、工場のラインと同じ流れ作業だから。5段パイプラインの組み立てから、流れを止める3種のハザード、分岐予測と投機実行、そして投機の副産物が情報漏洩になったSpectreまでを、前提知識ゼロから追いかけます。
182
·RAG・検索拡張·★ 会員·12分で読めます
チャンキング戦略 — 分け方で検索は決まる
RAGの精度の大半は「文書をどう切るか」で決まる。固定長とオーバーラップの算数、構造分割、意味分割、親子チャンク、そして鬼門である表と数式の扱いまでを1から解説する。
183
·スケーリングと電力·★ 会員·12分で読めます
チップレットの経済学 — 大きく作れないから分ける
チップを分けるのは速くなるからではなく、分けないと売れる値段で作れないから。レチクル限界と歩留まりの指数、良品1個あたりの原価、分割が損に転じる折り返し点、プロセスの混載、そしてUCIeという「縫い目の規格」までを算数で追う。
184
·データ構造·★ 会員·14分で読めます
B木とLSM木 — データベースの心臓
世のデータベースはほぼ全部、B木かLSM木のどちらかの上に建っています。「ディスクはページ単位でしか書けない」という物理から出発して、両者がなぜ正反対の設計になったのか、書込増幅とは何か、PostgreSQLとRocksDBで何が違うのかを、前提知識ゼロから実務のパラメータ名まで。
185
·デバイス物理·無料·14分で読めます
バンド理論を1から — なぜシリコンだったのか
電気を通す/通さないを分けているものは何か。原子が集まると準位が「帯」になる話からバンドギャップ・フェルミ分布・ドーピングまでを前提知識ゼロで組み立て、最後に「なぜ半導体はシリコンなのか」の実際の答え——材料の性能ではなく酸化膜——まで到達します。
186
·数値計算·無料·14分で読めます
自動微分の仕組み — PyTorchの魔法を1から
loss.backward() と書くだけで何百万個ものパラメータの微分が出てくるのはなぜか。計算グラフ・連鎖律・前進モードと後退モードを前提知識ゼロから解き、40行のミニautogradまで自作します。
187
·音声系·無料·14分で読めます
音声認識を1から — 波形からテキストまで
マイクが拾う数字の列がどうやって文字になるのかを前提知識ゼロから。スペクトログラムによる特徴抽出、アラインメント問題を解いたCTC、自己回帰デコーダのencoder-decoder、そしてWhisperまでを歴史の順に追う。
188
·深層学習の基礎·無料·論文·15分で読めます
活性化関数を1から — なぜ非線形が必要なのか
Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification
層を何段積んでも、活性化関数がなければ1段と同じことしかできない——その一行の証明から始めて、sigmoidが捨てられReLUが勝ち、いまのLLMがSiLU/SwiGLUに落ち着くまでを、傾きを実際に触れる動く図とともに辿ります。
189
·論文解説·★ 会員·論文·18分で読めます
論文解説 Large Discovery Models — LLMに「次に何を試すべきか」を教える価値信号
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
LLMは案を出せても、その案が本当に良いかを自分では採点できない。論文 Large Discovery Models は、LLMの提案分布をガウス過程由来の「獲得値」で傾けることで、高価な実験予算のもとでの探索を回す枠組みを示す。式から実験数値まで1から解説。
190
·エージェント·★ 会員·論文·21分で読めます
論文解説: Zetta ζ — 方策を凍結したまま、ロボットが実行中に自分を直す「閉ループ・ハーネス」
Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
エピソードが終わってから反省する既存の身体エージェントに対し、Zettaは「コードで書かれた監視役」を行動と同じ頻度で回し、失敗の兆候が出た瞬間に介入する。方策の重みを一切触らずに成功率を押し上げた設計を、論文本文に沿って1から解説する。
191
·動画圧縮·★ 会員·12分で読めます
動き補償を1から — 動画圧縮の9割はここ
動画のビットの行き先を決めているのは、変換でも量子化でもなく入口の予測です。ブロックマッチングが本当は何を最小化しているのか、なぜ動きベクトルは物体の動きではないのか、P/Bフレームの参照構造とGOPの切れ目が配信でどう事故になるのかを、前提知識なしで1から解きます。
192
·生成モデル·無料·13分で読めます
VAEを1から — 「圧縮して戻す」に確率を混ぜると生成になる
圧縮して元に戻すだけのオートエンコーダは、なぜ新しいデータを作れないのか。そこに確率を一滴混ぜると生成モデルに変わる理屈を、ELBO・再パラメータ化・潜在空間の補間まで前提知識ゼロから解説します。
193
·スケーリングと電力·無料·11分で読めます
ムーアの法則の実際 — 何が終わり、何が続いているのか
「2年で2倍」は物理法則ではなく、業界が合わせに行った予定表だった。終わったのはDennardスケーリング、鈍ったのはコスト、続いているのは密度と立体化 — ムーアの法則をめぐる話を、対数のものさし・平面からGAAへの構造変遷・コストの計算まで前提知識ゼロでほどきます。
194
·Transformerの仕組み·無料·論文·13分で読めます
トークナイザを1から — LLMが世界を切り刻む単位
Neural Machine Translation of Rare Words with Subword Units
LLMは文字も単語も読んでいない。BPEがどう語彙を作るか、SentencePieceが何を解決したか、なぜ日本語は同じ内容で損をするのか、語彙サイズを増やすと何と何が交換されるのかを、前提知識ゼロから手計算とコードで追う。
195
·時系列データ系·★ 会員·論文·13分で読めます
時系列にTransformerは効くのか — 論争と実務の答え
Are Transformers Effective for Time Series Forecasting?
1層の線形モデルが当時の時系列Transformer群を上回った2022年の論争から、パッチ化で反撃したPatchTST、軸を転置したiTransformerまで。原因は注意機構ではなくトークンの切り方でした。それでも実務のコンペを勾配ブースティングが取り続ける理由も、データの形の違いから説明します。
196
·エージェント·★ 会員·論文·17分で読めます
論文解説: StateM — モデルの重みを1gも動かさず、Terminal-Bench 2.1で95.3%・実行費15ドルへ
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
長時間タスクのエージェントは、各ステップを解けるモデルを積んでいても落ちる。StateMは重みを触らず「実行の器」だけを鍛え、Terminal-Bench 2.1で95.3%、最終スコアのAPI費を574.68ドルから約15ドルへ下げたと報告する。ハーネススケーリングという賭けを1から解説する。
197
·エージェント·★ 会員·論文·18分で読めます
論文解説 SemaPLC — 「できました」と言わせない検証ゲート型エージェント
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
工場の制御コードをLLMに書かせる研究の多くは「動いて見せる」で止まっていた。SemaPLCは外部検査のログが揃うまでエージェントに完了を宣言させない設計で、実機ランタイム上の挙動スコアをベースラインの最大31.4に対し52.2まで引き上げた。
198
·生成モデル·★ 会員·論文·12分で読めます
CFGとサンプラー — 生成AIの「強さ」パラメータの正体
Classifier-Free Diffusion Guidance
画像生成ツールの「CFG Scale」と「Sampling steps / method」が内部で何をしているのかを、前提知識ゼロから解く。CFGは条件あり/なしの予測の差への外挿、サンプラーはODEの数値解法。忠実さ・多様性・時間の取引が、この2つのつまみでどう決まるか。
199
·RAG・検索拡張·★ 会員·論文·13分で読めます
推薦システムと埋め込み — RAGと同じ数学、違う目的
BPR: Bayesian Personalized Ranking from Implicit Feedback
「あなたへのおすすめ」の中身は、RAGのベクトル検索とほとんど同じ数学です。協調フィルタリングの行列分解から二塔モデル、ANN検索の使い回しまでを前提知識ゼロから解説し、同じ道具を使いながら評価も落とし穴も別物になる理由を整理します。
200
·計算量と評価·★ 会員·14分で読めます
乱択アルゴリズム — サイコロを振ると速くなる不思議
なぜ乱数を混ぜると速くなるのか。ランダムピボットのクイックソート、片側誤りのブルームフィルタ、モンテカルロとラスベガスの違いを前提知識ゼロから積み上げ、乱数の扱いを間違えたときに起きる事故まで見ます。
201
·音声圧縮·★ 会員·12分で読めます
MP3と心理音響 — 「聞こえない音」の科学
MP3が捨てているのは「無い音」ではなく「有るのに聞こえない音」です。最小可聴閾・臨界帯域・マスキングの広がりという耳の穴を測る心理音響モデルを式まで降りて解説し、SMRからビット割り当て、MP3エンコーダの二重ループとビットリザーバまでつなげます。
202
·微分と最適化の数学·★ 会員·論文·16分で読めます
SGDの先へ — Adam・二次法・制約付き最適化
Adam: A Method for Stochastic Optimization
モーメンタムは何を溜めているのか、Adamの4行は各行で何をしているのか、AdamWは何を直したのか、理論上もっと速いはずの二次法がなぜLLMで使われないのか。勾配クリッピングまで含めて、比喩→式→動く図→コード→現場の順で前提知識なしに解きほぐします。
203
·数値計算·★ 会員·13分で読めます
数値の落とし穴 — 桁落ち・丸め・logsumexp
「学習を回して3時間後に損失がnanになる」の正体を、浮動小数点の丸め・条件数・桁落ちの順に前提知識ゼロから解きます。最後は、softmaxと交差エントロピーの実装に必ず入っている logsumexp という一つの定石に合流します。
204
·深層学習の基礎·★ 会員·論文·13分で読めます
正規化レイヤー全史 — BatchNormからRMSNormまで
Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift
深層学習を「実際に深くできるもの」に変えた正規化レイヤーを前提知識ゼロから辿る。BatchNormが効く理由をめぐる内部共変量シフト論争、LayerNormがバッチ軸を捨てた理由、そしてLLMが一様にRMSNormへ行き着いた理由まで。
205
·学習手法・アライメント·★ 会員·論文·14分で読めます
混合精度学習 — fp16/bf16/fp8で壊れずに速くする
Mixed Precision Training
同じモデルを半分のビット数で学習させると、速くなる代わりに勾配が0やinfに化けます。壊れ方の正体(アンダーフローとオーバーフロー)から出発し、loss scalingが何をしている一手なのか、bf16はなぜそれを不要にしたのか、fp8で何が戻ってきたのかを順に。最後はPyTorch AMPの設定と、クリップ順序を間違えて静かに事故る典型例まで。
206
·線形代数·★ 会員·17分で読めます
行列分解ツアー — LU・QR・コレスキー・SVDの使い分け
行列分解は「同じ変形を、扱いやすい部品の掛け算に書き直す」操作です。解く(LU)・半額で解く(コレスキー)・直交化して最小二乗(QR)・壊れた行列でも扱う(SVD)の4つを、なぜ逆行列を作ってはいけないのかから始めて、選び方の一枚表とnumpyの実装まで一気につなぎます。
207
·確率・統計·★ 会員·12分で読めます
マルコフ連鎖を1から — 「今だけ見る」確率過程
次に何が起きるかは、今どこにいるかだけで決まる — この割り切りがマルコフ連鎖です。遷移行列と定常分布から、PageRankがなぜ固有ベクトルなのか、MCMCがなぜ正規化定数を無視できるのかまでを、前提知識ゼロから積み上げます。
208
·学習手法・アライメント·★ 会員·論文·14分で読めます
学習率スケジュール — warmupとcosineの理由
Attention Is All You Need
学習率は固定の数字ではなく、訓練の最初から最後まで動かす曲線です。なぜ最初にわざと遅く走る(warmup)のか、なぜ余弦カーブで落とす(cosine)のか、バッチサイズを変えたら何を一緒に動かすのか。式・動く図・PyTorch実装・現場の落とし穴まで前提知識なしで解説します。
209
·計算機アーキテクチャ·★ 会員·論文·12分で読めます
GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。
210
·生成モデル·★ 会員·論文·14分で読めます
GANの栄枯盛衰 — 敵対で学ぶ発明と、拡散に負けた理由
Generative Adversarial Networks
2014年に「本物らしさの物差しごと学習させる」という発想で画像生成を一変させたGANが、なぜモード崩壊と学習の不安定さに悩み、WGANで立て直し、それでも拡散モデルに主役を譲ったのか。10年の流れを式と動く図でたどります。
211
·生成モデル·★ 会員·論文·12分で読めます
Flow Matchingを1から — 拡散の次に来た「まっすぐ運ぶ」生成
Flow Matching for Generative Modeling
Stable Diffusion 3 や FLUX の土台になった Flow Matching を前提知識ゼロから。速度場・常微分方程式・rectified flow を比喩と動く図で辿り、なぜ「まっすぐ運ぶ」と少ないステップで生成できるのか、現場で触るスケジューラ設定までを繋ぐ。
212
·エージェント·★ 会員·論文·17分で読めます
論文解説: FACET — 指示・環境・解答・採点を「同じ実行状態」に接地させる課題合成
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
ターミナル課題は「指示文・環境・模範解答・採点器」の4点セット。FACETは環境を先に建てて動かし、その実現済み状態を全部品の共通の地面にすることで整合を取る。7万件のスキルから6,078課題を作り、1.2Kの成功軌跡だけでQwen3.5を4B/9B/27Bとも底上げした論文を1から解説する。
213
·製造とパッケージ·★ 会員·12分で読めます
EUVリソグラフィ — 13.5nmの光を作るという狂気
波長13.5nmの光は空気にもレンズにも吸収される。それでも半導体産業がこの光を選んだのはなぜか。スズプラズマ光源、レンズを1枚も使わない反射光学、そして「露光を4回重ねる」マルチパターニングとの損得勘定を、前提知識ゼロから解説する。
214
·符号化の理論·無料·13分で読めます
誤り訂正を1から — 壊れる前提で送るという発想
パリティ1ビットから始めて、ハミング距離・シンドローム復号・リード・ソロモンまでを前提知識ゼロで積み上げ、QRコードが汚れても読める理由と、現場でECCを扱う落とし穴までつなげます。
215
·エージェント·★ 会員·論文·12分で読めます
論文解説: EnvHarness — 練習場を作り直さず、外から「治具」をかぶせてエージェントを鍛える
EnvHarness: Awakening Static Worlds for Agent Learning
LLMエージェントの学習環境は手作りで静的、エージェントの弱点にも上達にも追随しない。EnvHarnessは環境の中身を書き換えずに外から挙動を作り替えるプラグイン層で、元の検証器はそのまま保つ。その設計と自動化役EnvRiggerを、前提知識ゼロから解く。
216
·情報理論·無料·12分で読めます
エントロピーと交差エントロピー — 損失関数の出どころ
分類モデルで必ず出てくる交差エントロピー損失は、天下り式に決められたものではありません。「驚きの量」から出発して、エントロピー → 交差エントロピー → あの見慣れた損失式へと一本道でたどり、なぜ二乗誤差ではダメなのかまで説明します。
217
·エージェント·★ 会員·論文·11分で読めます
論文解説: Agent Skillsはなぜ効くのか、そしてどこで壊れるのか
Demystifying Agent Skills: Why They Work-Until They Don't
エージェントに手順書(Skill)を持たせると成績が上がる。その中身を8,135件の実行記録と528組の対照軌跡で解剖した論文を、前提知識ゼロから読み解く。効くのは知識の注入ではなく「手順の錨」であり、棚が大きくなると取り出しが壊れる。
218
·デバイス物理·★ 会員·12分で読めます
電力バジェットで読むチップ設計 — リークと発熱の物理
チップの設計は「何を置けるか」ではなく「同時に何を光らせられるか」で決まります。動的電力とリーク電力という2つの支出、温度でリークが膨らむ正帰還、ワットを温度に換算する熱抵抗、そして予算を空間・時間・仕事あたりで配る手口までを、電力バジェットという1枚の家計簿として読み解きます。
219
·データ構造·★ 会員·13分で読めます
キャッシュに優しいコード — 同じO(n)で10倍差がつく理由
計算量が同じ2つの実装で実行時間が桁違いになるのは、CPUがデータを「1個ずつ」ではなく「64バイトの塊」で運ぶからです。局所性・キャッシュライン・配列と連結リストの実測差・AoS/SoA・ループ順序・false sharing を、前提知識ゼロから、最後は perf で自分の目で確かめるところまで。
220
·確率・統計·★ 会員·13分で読めます
ベイズ的に考える — 事前・尤度・事後の実務感覚
ベイズ更新は「事後を次の事前として継ぎ足す」操作です。共役事前を使えば更新は疑似カウントの足し算に退化し、A/Bテストは『勝つ確率』と『期待損失』の2枚看板で読めるようになります。停止規則と事前の選び方の落とし穴まで、前提知識ゼロから。
221
·Transformerの仕組み·★ 会員·論文·11分で読めます
Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意
Fast Transformer Decoding: One Write-Head is All You Need
MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。
222
·推論・高速化·★ 会員·論文·23分で読めます
論文解説: Agentic ESOpt — 逆伝播をやめて「モデルを揺らす」だけで、長丁場のLLMエージェントを鍛える
Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
勾配を一切計算せず、パラメータにノイズを足した分身をG体走らせて良かった方向へ寄せるだけ——推論と同じGPUメモリ(8.41GB)で27Bの全パラメータを更新し、15手必要な数独でGRPOに12.50ポイント差をつけたNUSらの論文を、1から解説する。
223
·製造とパッケージ·★ 会員·11分で読めます
先端パッケージング — CoWoS・HBM積層がAIの律速になった
AIアクセラレータの供給を決めていたのは、最先端ロジックのウェハではなく「チップを並べて1つにまとめる工程」だった。レチクル限界と歩留まりの指数、2.5Dインターポーザ、HBMの縦積みとTSV、ハイブリッドボンディング、そして熱と反りという請求書までを前提知識ゼロで追う。
224
·線形代数·無料·10分で読めます
LoRAとRAGを支える線形代数 — 固有値・低ランク・ベクトル検索を、動かして掴む
行列は空間の変形、固有ベクトルは変形しても向きが変わらない方向、SVDはその一般化、内積は「似ている」の定義。LoRAのΔW=BAとRAGのベクトル検索がどちらも同じ線形代数の上に建っていることを、4つの動く図と数式で確かめる。読むだけでなく、スライダーとドラッグで手を動かすためのコラム。
225
·LLM — 大規模言語モデル·★ 会員·論文·16分で読めます
論文解説: SA-MRPO — 満点の科目を勉強し続けるな。飽和した報酬から勾配を引きはがす
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
報酬を複数使うRL学習では、すでに満点に近い目的にも勾配予算が配られ続ける。SA-MRPO (arXiv:2608.16072) は目的ごとの「飽和率」を測って重みを割り引き、伸びしろの残る目的へ最適化の力を回す。論文本文だけを根拠に、仕組みと限界を解説する。
226
·VLM・マルチモーダル·★ 会員·論文·10分で読めます
VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか
Learning Transferable Visual Models From Natural Language Supervision
画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。
227
·線形代数·★ 会員·論文·13分で読めます
特異値分解と低ランク近似 — LoRAの数学的な下地
LoRA: Low-Rank Adaptation of Large Language Models
特異値分解(SVD)を「回す・伸ばす・回す」の比喩から出発し、行列がrank-1の層の重ね合わせであること、実データでは少数の層だけで十分なこと(低ランク近似)までを前提知識ゼロから解説。LoRAが巨大モデルを0.4%のパラメータで微調整できる理由の、数学的な土台を作る。
228
·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます
スケーリング則を1から解説 — なぜ大きくすると賢くなるのか
Training Compute-Optimal Large Language Models
「モデルを大きくすれば賢くなる」を数式にしたのがスケーリング則。Kaplan則からChinchilla論文(Hoffmann et al., 2022)への転換を、400本超の実験・3つの推定法・70B対280Bの直接対決まで、論文本文だけを根拠に1から解説する。
229
·エージェント·★ 会員·論文·15分で読めます
論文解説: Recursive Synthesis — 検証済みタスクを「増築」して、長時間ターミナル課題を4万件量産する
Recursive Synthesis for Long-Horizon Terminal Tasks
1件数百〜数千ドルかかる長時間ターミナルタスクを、検証済みの種から再帰的に増築して約$0.05で量産するRST。15ラウンドで37,484件、模範解答は中央値67行から374行へ難化し、その軌跡でQwen3.5をSFT+PPOで実際に強くした——Tencentらのデータ合成論文を1から解説する。
230
·モデル系統図鑑·★ 会員·10分で読めます
Qwen系を1から解説 — HuggingFace DL数トップ勢の実力
Hugging Faceのダウンロード数上位の常連、Alibaba CloudのQwen。Qwen2.5の「全サイズ×用途別」カタログ戦略からQwen3の思考モードとMoEまで、系譜・多言語とコードに強い理由・実務の落とし穴を前提知識ゼロから解説する。
231
·推論・高速化·★ 会員·論文·18分で読めます
論文解説: 正解も強い教師もなしで伸びる — u-OPSD が使う「自分の多数決」
On-Policy Self-Distillation without Any Supervision
模範解答も強い教師モデルも使わず、モデル自身が出した8本の答案の多数決を『特権的な文脈』に仕立てて自己蒸留する u-OPSD(arXiv:2608.06296)を、論文本文だけを根拠に1から解説する。
232
·エージェント·★ 会員·論文·11分で読めます
論文解説: Metis — 記憶を外付けせず、モデルの中に住まわせる「Memory Foundation Model」
Metis: Memory Foundation Model
AIエージェントの記憶は今もRAGなどの「外付け」が主流。この論文は記憶をモデル本体の順伝播に内蔵する Memory Foundation Model を提唱し、初のプロトタイプ Metis を提案する。覚える・忘れる・更新するを勾配なしのforward計算だけで実行する仕組みと、その実力・限界を1から解説。
233
·エージェント·★ 会員·論文·12分で読めます
論文解説: MerchantBench — LLMエージェントは1年間ネットショップを経営できるか。人間の27.3%しか稼げない理由
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
365日のEC店舗経営シミュレーションでLLMエージェントの「長期一貫性」を測るMerchantBenchを論文本文から解説。最良構成でも人間の平均純資産の27.3%にとどまる理由を、活動の減衰・早すぎる撤退・証拠に合わない方針固定化という失敗パターンから読み解く。
234
·エージェント·★ 会員·論文·10分で読めます
論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。
235
·情報理論·★ 会員·論文·12分で読めます
KL情報量を1から — 2つの分布の「ズレ」を測る
Training language models to follow instructions with human feedback
2つの確率分布の「ズレ」を測るKL情報量を、圧縮の無駄払いという比喩から定義・非対称性・numpy実装へと積み上げる。後半はVAEの正則化項とRLHFのKLペナルティという2大応用で、この量が現代のAIをどう支えているかまでつなげる。
236
·データ構造·★ 会員·論文·9分で読めます
ハッシュと近傍探索 — ベクトル検索の下地
Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs
「探す」を速くする2つの発明——完全一致のハッシュ表と、意味の近さで探すLSH・HNSW——を前提知識ゼロから解説。RAGやベクトルDBの裏で動いている近傍探索の仕組みが分かる。
237
·探索と最適化·★ 会員·論文·10分で読めます
グラフアルゴリズムを1から — 最短経路とその応用
Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs
乗換案内からベクトル検索まで、世界の裏側は「点と線」で動いている。BFS・ダイクストラ法・A*を前提知識ゼロから積み上げ、最後はLLM時代の検索を支えるHNSWまで一本の道でつなぐ。
238
·エージェント·★ 会員·論文·16分で読めます
論文解説: Frontis-MA1 — 「AIを作るAI」を鍛える。MLエンジニアリングで再帰的自己改善に一歩迫るOpenMLE
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
「解くモデル」ではなく「解を改善する操作」を実行結果で訓練し、その操作で進化探索を回す——OpenMLEスタックと35BモデルFrontis-MA1を論文本文から解説。MLE-Bench Liteでの39.39%→71.21%という伸びの内訳、探索効率の仕組み、そして論文自身が認める限界まで。
239
·数値計算·★ 会員·論文·12分で読めます
FFTを1から理解する — なぜ畳み込みが掛け算になるのか
An Algorithm for the Machine Calculation of Complex Fourier Series (Cooley & Tukey
音を周波数に分解するフーリエ変換を、比喩→回転する針の直感→DFTの式→分割統治のFFTの順に前提知識ゼロから解説。畳み込みがなぜ周波数領域では掛け算1回になるのか、多項式の積の視点で腹落ちさせる。
240
·RAG・検索拡張·無料·論文·9分で読めます
埋め込み(Embedding)を1から理解する — word2vecの直感から文脈化埋め込みまで
Efficient Estimation of Word Representations in Vector Space
「王様 − 男 + 女 ≈ 女王」はなぜ成り立つのか。単語を数値の座標に変える埋め込みを、地図の比喩→分布仮説→word2vecの式→numpyコード→BERT以降の文脈化埋め込み→RAG実務の順で、前提知識ゼロから解説します。
241
·微分と最適化の数学·★ 会員·論文·10分で読めます
凸性と最適化 — なぜ深層学習は「凸でない」のに動くのか
Identifying and attacking the saddle point problem in high-dimensional non-convex optimization
最適化理論の教科書は「凸なら解ける、凸でないなら保証なし」と教える。では損失面が凸でない深層学習はなぜ動くのか。凸集合・凸関数の定義から、局所解より恐い鞍点、汎化と結びつく平坦な最小値まで、地形の言葉で一気につなぐ。
242
·計算量と評価·★ 会員·10分で読めます
計算量と実測が食い違うとき — キャッシュ・分岐・メモリ帯域
同じO(n)のコードが実測では桁で違う——O記法が意図的に捨てている「メモリの現実」を、キャッシュ階層・分岐予測・メモリ帯域の3つの側面から解き明かす。
243
·エージェント·★ 会員·論文·15分で読めます
論文解説: ComBodied Agents — エージェントの「作用対象」を人そのものに置き直す
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
デジタルエージェントはソフトの状態を、身体エージェントは物理の状態を書き換える。では「人の状態」を第一の対象にするのは誰か。Combodied Agents は知覚・縦断記憶・Personal World Model・介入方針を1つの閉ループに束ね、成功の基準を課題達成から『主体性が保たれたか』へ移す枠組みを提案する。実験を持たない立場表明論文として、その骨格と限界を本文に沿って読む。
244
·エージェント·★ 会員·論文·11分で読めます
論文解説: 共進化するエージェント系 — 人間の設計を超えた自己進化への三段階
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
「デプロイ後も賢くなり続けるエージェント」はなぜ頭打ちになるのか。相手・環境・進化の仕組みそのものを順に動かしていく三段階の分類を、サーベイ論文の本文から1から解説する。定義の式、各段階の代表手法、評価と安全の未解決点まで。
245
·製造とパッケージ·★ 会員·11分で読めます
チップはこう作られる — ウェハから歩留まりまで
GPUもスマホの頭脳も、砂から始まる数百工程の「多層印刷」で作られる。露光・エッチング・イオン注入という基本動作から、EUVという力技、そして「大きいチップほど不良が増える」歩留まりの数学までを前提知識ゼロから解説。
246
·確率・統計·★ 会員·論文·11分で読めます
ベイズの定理をAIで使う — 事前分布・事後分布・不確実性
On Calibration of Modern Neural Networks
たった1行のベイズの定理が、AIの現場では「確率の校正」「能動学習」「ベイズ最適化」という3つの実務ツールに化ける。検査の陽性から始めて、事前分布・事後分布・不確実性を前提知識ゼロで解説する。
247
·アクセラレータ·★ 会員·論文·10分で読めます
AIアクセラレータの設計様式 — GPU/NPU/TPUは何が違うのか
In-Datacenter Performance Analysis of a Tensor Processing Unit
GPU・TPU・NPUは「汎用性をどこまで捨てて行列積に振るか」の答えが違う3つの流儀。シストリックアレイの仕組み、データフロー設計、量子化との共進化を、比喩→式→コードの順で前提知識ゼロから解説する。
248
·学習手法・アライメント·★ 会員·論文·14分で読めます
論文解説: ABSeeker — 答えから逆算して「良い一手」を採点する、長距離検索エージェントの訓練法
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
何十手もWeb検索を重ねるエージェントの訓練では「最後に正解したか」しか報酬がなく、途中の良い一手も悪い一手も同じ扱いになる。答えから手がかりを逆算して全ステップを採点するABC(Answer-Backtracked Credit Assignment)と、それで訓練された4BモデルABSeekerを、論文本文に沿って1から解説する。
249
·論文解説·★ 会員·論文·14分で読めます
論文解説: WorldClaw — テキスト1文から「歩ける・編集できる」3Dオープンワールドをエージェントが建設する
WorldClaw: Agentic 3D Open-World Generation at Scale
「熱帯の海賊島」と一文入れると、歩き回れて個々の建物を後から動かせる大規模3Dワールドが出てくる——Tencent Hunyuanチームの WorldClaw を論文本文から解説。計画→地形→地域オブジェクトの3段階を専門エージェントが分担し、レンダリングして自分で検品するまでの全工程を追う。
250
·推論・高速化·★ 会員·論文·12分で読めます
論文解説: The Personalization Mirage — LLMは「あなた」を勝手に作り上げ、自己申告は逆を指す
The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
メモリ付きLLMは、ユーザーが一度も言っていない属性をどれだけ「知っている」ことにしてしまうのか。150ペルソナ×6タスク×14万件超の主張を判定したMirageBenchから、全12モデルが35〜49%を過剰推論する実態と、自己申告が控えめなモデルほど実際は捏造が多いという逆転現象を、論文本文に沿って解説する。
251
·エージェント·★ 会員·論文·13分で読めます
論文解説: SWE-Bench ProMax — 多言語・大規模リファクタリングでコーディングエージェントの本当の実力を測る
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-benchの飽和と採点欠陥への回答として登場した、7言語・平均11.4ファイル修正の大規模リファクタリングベンチマークを論文本文から解説。最強モデルでも41.2%しか解けない理由と、支配的な失敗モード「やり切らないリファクタリング」を読み解く。
252
·推論・高速化·★ 会員·論文·11分で読めます
投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする
Fast Inference from Transformers via Speculative Decoding
小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。
253
·デバイス物理·無料·10分で読めます
MOSFETを1から — 電圧で開く水門と、リーク電流という現実
CPUやGPUを埋め尽くすスイッチ・MOSFETを前提知識ゼロから。水門の比喩→しきい値電圧→サブスレッショルド漏れの式→なぜ微細化すると漏れるのかまで、電力問題の根っこを1本でつかむ。
254
·論文解説·★ 会員·論文·13分で読めます
Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。
255
·エージェント·★ 会員·論文·10分で読めます
論文解説: Macaron-V1 — 凍結ベース×LoRA混合で「出荷後も育つ」エージェントモデルを作る
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Labのオープンエージェントモデル群Macaron-V1を論文本文から解説。凍結した744Bベースに4枚のLoRA専門家を重ねてターンごとに1枚選ぶMixture-of-LoRAと、モデル+ハーネスのペアを世代ごとに鍛える再帰的自己改善ループの中身を追う。
256
·モデル系統図鑑·★ 会員·11分で読めます
Llama系を1から解説 — オープンLLMの本流
MetaのLlamaはなぜオープンLLMの本流になったのか。Llama 1の逆張り設計からLlama 3.xまでの系譜、llama.cpp・GGUF・Ollamaのエコシステム、そして商用利用前に必ず読むべきライセンスの罠を、前提知識ゼロから解説する。
257
·モデル系統図鑑·★ 会員·論文·12分で読めます
Gemma系を1から解説 — 系譜・特徴・使いどころ
Gemma: Open Models Based on Gemini Research and Technology
GoogleのオープンウェイトLLM「Gemma」を系譜から解説。蒸留・局所注意・実効パラメータという各世代の発明、ライセンスの実務注意、Ollamaでのローカル運用までを1本で通す。
258
·エージェント·★ 会員·論文·11分で読めます
論文解説: EnvACE — 環境まで自分で演じる「world rehearsal」がエージェントRLの環境不足を解く
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
ツール実行環境を一切呼ばずに、LLM自身が「行動役」と「環境役」を交互に演じて強化学習する EnvACE を論文本文から解説。役割別GRPO、テスト時の脳内リハーサル、4ベンチマークでの結果と限界まで。
259
·推論・高速化·★ 会員·論文·11分で読めます
論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ
DAPD: Dual-Anchored Policy Distillation
模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。
260
·推論・高速化·★ 会員·論文·11分で読めます
論文解説: CodeNib — コーディングエージェントにリポジトリの文脈を「配膳」する多ビューデータシステム
CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
コーディングエージェントが毎タスクgrepで探し直す無駄を、リポジトリを「データベース」と見立てて解消するCodeNib(UCサンディエゴら)。字句・密・構造の3ビュー、差分更新、文脈配信ポリシーの実測を、限界まで含めて読み解く。
261
·推論・高速化·★ 会員·論文·11分で読めます
論文解説: BDH-CQ — 言葉にせずに考えるAI。再帰メモリ×潜在推論がARCのコスト効率を塗り替えた
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
思考の途中経過を一切言語化せず、デモを再帰メモリに書き込み高次元潜在空間の反復計算で解く BDH-CQ (arXiv:2608.09888)。150MパラメータでARC-AGI-1の29.5% pass@2を1タスク$0.0007で達成し、コスト対精度のパレート境界を突破した論文を、本文だけを根拠に解説する。
262
·論文解説·★ 会員·論文·11分で読めます
論文解説: AskChem — 検索の単位を「論文」から「出典付きクレーム」に変える文献インフラ
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
化学文献の検索単位を論文からDOI+原文引用つきの「クレーム」に変えたNYU発のインフラ論文を解説。240万クレームの索引・証拠グラフ・ハイブリッド検索の設計と、DOI捏造を88.3%→100%解決に変えた評価、そして限界までを1から読む。
263
·論文解説·★ 会員·論文·12分で読めます
論文解説: Alpamayo — 自動運転の推論モデル
Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
NVIDIAの自動運転VLA「Alpamayo-R1」を原論文から読み解く。因果の鎖で推論を構造化するChain of Causationデータセット、flow matchingで99msに収めた軌道デコード、推論と行動のズレをRLで罰する3段階学習まで、1から解説する。
264
·推論・高速化·★ 会員·論文·14分で読めます
論文解説: AgentOPSD — 「どのターンが勝敗を分けたか」をベイズ信念の再帰更新で見つけるエージェントRL
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
長いマルチターン対話の最後に成功/失敗しか教えてくれない環境で、「効いた一手」をどう見つけるか。自己蒸留のギャップをベイズ証拠と読み替え、log-odds空間で信念を再帰更新するAgentOPSDを論文本文から解説。ALFWorld 89.1%の結果、アブレーション、限界まで。
265
·時系列データ系·無料·13分で読めます
RNNとLSTMを1から理解する — Transformer時代になぜ学ぶのか
系列を「状態を持って1つずつ読む」という発想から出発し、同じ行列を何度も掛けることがなぜ勾配を消すのか、LSTMの3つのゲートが何を解いたのかを式と動く図で追います。Transformerに置き換わった理由と、それでもこの再帰の考え方が生き残る場所まで。
266
·LLM — 大規模言語モデル·無料·論文·10分で読めます
プロンプトエンジニアリングの科学 — 何が実証され、何が迷信か
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
「ステップバイステップで考えて」は効くのか。Chain-of-Thought論文(Wei et al., 2022)の本文だけを根拠に、実験で実証されたこと(規模の閾値を超えたモデルでのみ効く創発)と、巷の呪文の多くが未検証であることの線引きをする。
267
·エージェント·★ 会員·論文·11分で読めます
LLMエージェントを1から解説 — ツール使用とループの設計
ReAct: Synergizing Reasoning and Acting in Language Models
「考える→道具を使う→結果を見て考え直す」というループはどう設計されているのか。ReAct論文(Yao et al., 2022)の本文だけを根拠に、行動空間に言語を足すという発想、function callingの実装の形、実測された失敗モード(ループの暴走・幻覚したツール呼び出し)まで。
268
·学習手法・アライメント·★ 会員·論文·13分で読めます
Instruction Tuning と RLHF を1から解説 — 指示に従うモデルはどう作られるか
Training language models to follow instructions with human feedback
事前学習しただけのモデルが指示に従わないのは能力不足ではなく目的関数のずれ。InstructGPT論文(Ouyang et al., 2022)の本文だけを根拠に、SFT→報酬モデル→強化学習の3段を式まで追い、「1.3Bが175Bを人間評価で上回った」という主張と、論文自身が認めた限界を§番号付きで読む。
269
·並列・分散·★ 会員·12分で読めます
GPUはなぜ速いのか — 実行モデルと並列化の限界
CPUとGPUは「速い」の定義が違います。トランジスタ予算の使い道、32スレッドを束ねるSIMTとワープ、分岐発散で性能が落ちる理由、占有率とレジスタ圧。最後はAmdahlの法則で「どこまで速くなるか」を着手前に見積もり、プロファイラのどの指標を見てCPU律速に気づくかまで降ります。
270
·並列・分散·★ 会員·13分で読めます
分散学習を1から — データ並列・モデル並列・通信がボトルネックになるとき
なぜ1台に載らないのかをメモリの内訳から出発し、データ並列とall-reduce、ZeRO/FSDPが何を分割するのか、テンソル並列とパイプライン並列を順に。最後は通信量と計算量の比で「どこで頭打ちになるか」を自分で見積もり、勾配蓄積・NCCLの設定・ハングの切り分けまで降ります。
271
·VLM・マルチモーダル·★ 会員·論文·9分で読めます
論文解説: CLIP — 言葉と画像を同じ地図に置く
Learning Transferable Visual Models From Natural Language Supervision
CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。
272
·Transformerの仕組み·無料·論文·13分で読めます
位置エンコーディングを1から理解する(絶対位置からRoPEまで)
Attention Is All You Need
Transformerは素のままでは語順を知らない。なぜ位置情報が要るのかから始めて、sin/cosの絶対位置、学習型、そして現代LLMの標準であるRoPEまでを段階的に解説。「なぜ回転が相対位置を表せるのか」を式で示す。
273
·推論・高速化·★ 会員·10分で読めます
LLM量子化を1から解説 — なぜ精度を落としても動くのか
16ビットの重みを4ビットに切り詰めても、モデルは文章を書き続けます。なぜ壊れないのか。スケールとゼロ点という2つの数から始め、重みは落とせるのに活性化が落としにくい理由(外れ値)、PTQとQATの分かれ道、INT8/INT4で実際に起きること、そして「perplexityだけ見て通す」という最も多い評価事故まで。
274
·確率・統計·★ 会員·10分で読めます
AIのための確率・統計 — モデルの出力は確率である
分類モデルもLLMも、返しているのは答えではなく確率分布です。分布・期待値・条件付き確率・ベイズの定理を記号から説明し、山場として「最尤推定がなぜ損失関数になるのか」を導きます。交差エントロピーもMSEも、発明されたのではなく出てきたものです。
275
·スケーリングと電力·★ 会員·12分で読めます
電力の物理 — なぜ電圧を下げると劇的に効くのか
スイッチ1回に払うエネルギーを導出するところから始めて、動的電力の式で電圧だけが2乗で効く理由、Dennardスケーリングとその終焉、60 mV/decadeという熱力学の壁、ダークシリコン、そして専用回路と低精度演算へ向かった必然までを1本の線でつなぎます。最後に推論の電力コストを自分で計算します。
276
·アクセラレータ·無料·11分で読めます
数の表し方 — FP32からFP8・INT4まで
符号・指数・仮数という3つの区画を1から見て、指数部が「範囲」を、仮数部が「精度」を決めることを押さえます。そこからbfloat16が生まれた理由、FP8にE4M3とE5M2の2種類がある理由、INT8/INT4の等間隔量子化で何が失われるのかへ。最後に、学習と推論でどの型を選び、精度劣化をどう検知するかまで。
277
·計算機アーキテクチャ·★ 会員·11分で読めます
メモリの壁を1から — なぜ演算より転送が高いのか
掛け算より、数を運ぶほうが高い。配線の充放電という物理から出発して、DRAMのレイテンシがなぜ縮まないのか、メモリ階層の桁、リトルの法則、マシンバランスとルーフラインまで。最後に、目の前のカーネルが計算律速か帯域律速かを自分で切り分けられるところまで持っていきます。
278
·数値計算·★ 会員·10分で読めます
行列積のコスト — AIの計算はほぼここに帰着する
なぜGEMMが全てなのか。O(n³)の内訳、メモリ帯域と演算強度、GPUが速い理由、タイル化の直感。最後に、AIモデルの学習・推論に必要なFLOPsを自分の手で見積もれるところまで持っていきます。
279
·線形代数·無料·9分で読めます
AIのための線形代数 — ベクトルと行列が何をしているのか
行列式もクラメルの公式も要りません。AIの論文に本当に出てくるのは、ベクトル=意味を置く座標と、行列=その座標を運ぶ変換、この2つだけです。内積がなぜ「意味の近さ」になるのかから、Attentionの式を記号ごとに読み下すところまで。
280
·推論・高速化·無料·10分で読めます
KVキャッシュを1から理解する — 推論高速化の核心
LLMは1トークンずつ答えを吐きます。素朴に実装すると、1トークン出すたびに文全体を計算し直すという壮大な無駄が生まれる。KとVは過去のぶんが二度と変わらない——この一点だけで計算量が桁で落ちます。代わりに払うのがメモリで、その量は自分で見積もれます。バッチサイズと文脈長がなぜメモリで頭打ちになるのかまで。
281
·情報理論·★ 会員·11分で読めます
情報理論とAI — 交差エントロピー損失はどこから来たのか
情報量は驚きの大きさ、エントロピーは平均の驚き、KL情報量は2つの分布のズレ。この3つを積み上げると、分類でいつも使っているあの損失関数が必然として出てきます。なぜ対数なのか、なぜあの形なのか、そしてperplexityが何を数えているのかまで。
282
·符号化の理論·★ 会員·11分で読めます
エントロピー符号化を1から — ハフマンから算術符号まで
「情報量がそのまま符号長になる」——この一行が圧縮のすべてです。シャノンの下限からハフマン符号の作り方、整数ビットという限界、それを外す算術符号とANS、そしてJPEG・PNG・H.264・zstdのどこで何が動いているかまで。最後に、圧縮率が頭打ちになったときの切り分け方を置きます。
283
·探索と最適化·★ 会員·10分で読めます
動的計画法を1から解説 — 部分問題を覚えておくということ
素朴な再帰はなぜ指数爆発するのか。メモ化と表埋めで何が変わるのか。フィボナッチ・ナップサック・編集距離を順に分解し、編集距離が音声認識のWERや拡散モデルのステップ選択にそのまま現れることまで見ます。
284
·データ構造·無料·8分で読めます
データ構造の選び方 — 配列・ハッシュ・木・ヒープ
配列・ハッシュ表・木・ヒープが、それぞれ何を速くして何を諦めているのか。用途からの逆引き表と、トークナイザ・ベクトル検索・KVキャッシュといったAI実装で実際にどれが使われているかまで。
285
·計算量と評価·無料·8分で読めます
計算量を1から理解する — オーダー記法は何を測っているのか
O(n)・O(n log n)・O(n²)が実行時間としてどんな体感になるのか。定数倍とオーダーの違い、時間と空間のトレードオフ、そして理論の計算量とプロファイラの実測が食い違う理由まで、前提知識ゼロで解説します。
286
·微分と最適化の数学·無料·9分で読めます
AIのための微分 — 勾配は「どちらに動けば良くなるか」の矢印
極限の厳密な定義も、置換積分も要りません。学習の全体は「傾きを測って逆向きに進む」だけです。微分=倍率、勾配=傾きを並べたベクトル、連鎖律=倍率の掛け算。ヤコビアンとヘッセ行列は「何を表すか」だけを押さえ、論文の更新式を読み下します。
287
·機械学習の基礎·無料·7分で読めます
機械学習とは何か — 「学習」を数式なしで理解する
「プログラムを書く」と「学習させる」は何が違うのか。ルールベースとの対比、丸暗記と汎化の差、教師あり・教師なし・強化学習の地図までを、数式をほぼ使わずに整理する入門記事。
288
·機械学習の基礎·★ 会員·9分で読めます
過学習と評価設計 — 精度99%を疑え
訓練データに合わせすぎたモデルはなぜ現場で壊れるのか。train/validation/testの役割分担、交差検証、実務で最も多い失敗であるデータリーク、不均衡データで精度が嘘をつく仕組みと、適合率・再現率・F1の使い分けまで。
289
·深層学習の基礎·無料·9分で読めます
ニューラルネットワークを1から理解する — 1個のニューロンから多層まで
ニューロン1個の中身から多層ネットワークまでを、比喩→式→動く図→numpyコードの順で。「なぜ活性化関数が必要なのか」を、線形の合成が線形にしかならないという一行の証明から腹落ちさせます。
290
·機械学習の基礎·無料·9分で読めます
損失関数と最適化 — モデルはどうやって「間違いから学ぶ」のか
MSEと交差エントロピーはなぜあの形なのか。勾配とは何を指す矢印なのか。勾配降下法の1ステップを、式・動く図・10行のコードで分解します。学習率を上げすぎたときの発散も手元で体感できます。
291
·深層学習の基礎·★ 会員·12分で読めます
誤差逆伝播を1から解説 — 連鎖律だけで全部わかる
1000万個のパラメータの勾配を、なぜ順伝播1回ぶんの手間で全部求められるのか。連鎖律の復習から計算グラフ、2層ネットの手計算1ステップ、そして勾配消失が起きる理由までを、記号を1つずつ説明しながら追います。
292
·論文解説·★ 会員·論文·13分で読めます
論文解説 LoRA: Low-Rank Adaptation of Large Language Models — なぜ低ランクで足りるのか
LoRA: Low-Rank Adaptation of Large Language Models
LoRA原論文(Hu et al., 2021)を本文だけを根拠に読み直す。BAという式の意味、論文が実測した「増幅率21倍」、r=1で足りた理由、そして論文自身が残した未検証領域まで。
293
·論文解説·★ 会員·論文·14分で読めます
論文解説 Attention Is All You Need — 再帰を捨てたモデルは何を証明したのか
Attention Is All You Need
Transformerの原論文を、本文だけを根拠に読み解く。スケーリング付き内積注意の式、なぜルートd_kで割るのか、アブレーションが暴いた設計の急所、そして論文自身が認めた限界まで。
294
·RAG・検索拡張·★ 会員·10分で読めます
RAGの基礎と設計パターン — 埋め込み・チャンク・リランキング・評価を1から
検索拡張生成(RAG)を前提知識ゼロから解説。仕組みの直感、チャンク分割の戦略、ハイブリッド検索とリランキング、そして最重要の評価設計まで。
295
·Transformerの仕組み·無料·10分で読めます
Attention機構を1から理解する — Transformerの心臓部を絵解きで
ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。