JA EN

#optimization

15 記事

01 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: Normalized Low-Rank Adaptation — LoRAの「入口行列」を正規化するだけで効く理由 Normalized Low-Rank Adaptation LoRAのダウン射影行列Aを「ランク方向に単位長へそろえる」だけで、収束・安定性・忘却耐性が改善する。原題 Normalized Low-Rank Adaptation (NoRA) を、隠れた前処理行列という視点から1から解説する。 02 ·エージェント·★ 会員·論文·16分で読めます 論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。 03 ·学習手法・アライメント·無料·論文·14分で読めます 学習が壊れた時の診断学 — loss発散・NaN・停滞の切り分け On the difficulty of training Recurrent Neural Networks 学習が壊れる形は「発散」「NaN」「停滞」の3つしかありません。損失曲線の形から原因を絞り込む対応表を軸に、なぜ発散するのかを式と動く図で押さえ、NaNの発生地点を特定するコード、停滞の切り分け手順までを前提知識ゼロから解説します。 04 ·微分と最適化の数学·★ 会員·15分で読めます ヤコビアンとヘッセ行列 — 多変数の微分を図で ヤコビアンは「その場の拡大鏡」、ヘッセ行列は「その場の曲がり具合」。局所線形化から、固有値による地形の分類、ニュートン法が理論上は速いのに使われない理由、そして10億次元でも計算できるヘッセ行列ベクトル積までを一本につなぎます。 05 ·言語処理系·無料·13分で読めます コンパイラを1から — ソースが機械語になるまで たった1行の式が、字句解析・構文解析・意味解析・中間表現・最適化・コード生成の6工程を通って1命令の機械語になるまでを、前提知識ゼロから追い切ります。なぜ -O2 でバグが表に出るのか、なぜベンチマークのループが消えるのかも、この道筋の上で説明できます。 06 ·計算量と評価·★ 会員·16分で読めます 近似アルゴリズム — 厳密を諦めて保証を取る 最適解を諦める代わりに「最悪でも◯倍以内」という値札を付ける技術。近似比の定義から、貪欲アルゴリズムの保証を最後まで証明する手つき、巡回セールスマンで三角不等式の有無が結論をひっくり返す理由までを前提知識ゼロで積み上げます。 07 ·探索と最適化·★ 会員·13分で読めます 焼きなましと遺伝的アルゴリズム — 厳密に解けない時の実務 最適解を保証しない探索法が、なぜ現場の配送計画やスケジューリングを支えているのか。局所探索の3点セットから、焼きなましの温度、遺伝的アルゴリズムの集団、そして「これを使ってはいけない場面」の見分け方までを積み上げます。 08 ·探索と最適化·★ 会員·13分で読めます 焼きなましと遺伝的アルゴリズム — 厳密に解けない時の実務 最適解を保証しない探索法が、なぜ現場の配送計画やスケジューリングを支えているのか。局所探索の3点セットから、焼きなましの温度、遺伝的アルゴリズムの集団、そして「これを使ってはいけない場面」の見分け方までを積み上げます。 09 ·探索と最適化·★ 会員·13分で読めます 線形計画を1から — 最適化の王道 限られた在庫・予算・時間の中で最善を選ぶ、いちばん古くていちばん使われている最適化の道具。定式化の3点セットから、答えが必ず「角」にある理由、シンプレックス法の歩き方、双対が教える「材料1kgの値打ち」まで、前提知識ゼロで積み上げます。 10 ·探索と最適化·★ 会員·13分で読めます 線形計画を1から — 最適化の王道 限られた在庫・予算・時間の中で最善を選ぶ、いちばん古くていちばん使われている最適化の道具。定式化の3点セットから、答えが必ず「角」にある理由、シンプレックス法の歩き方、双対が教える「材料1kgの値打ち」まで、前提知識ゼロで積み上げます。 11 ·微分と最適化の数学·★ 会員·論文·16分で読めます SGDの先へ — Adam・二次法・制約付き最適化 Adam: A Method for Stochastic Optimization モーメンタムは何を溜めているのか、Adamの4行は各行で何をしているのか、AdamWは何を直したのか、理論上もっと速いはずの二次法がなぜLLMで使われないのか。勾配クリッピングまで含めて、比喩→式→動く図→コード→現場の順で前提知識なしに解きほぐします。 12 ·学習手法・アライメント·★ 会員·論文·14分で読めます 学習率スケジュール — warmupとcosineの理由 Attention Is All You Need 学習率は固定の数字ではなく、訓練の最初から最後まで動かす曲線です。なぜ最初にわざと遅く走る(warmup)のか、なぜ余弦カーブで落とす(cosine)のか、バッチサイズを変えたら何を一緒に動かすのか。式・動く図・PyTorch実装・現場の落とし穴まで前提知識なしで解説します。 13 ·微分と最適化の数学·★ 会員·論文·10分で読めます 凸性と最適化 — なぜ深層学習は「凸でない」のに動くのか Identifying and attacking the saddle point problem in high-dimensional non-convex optimization 最適化理論の教科書は「凸なら解ける、凸でないなら保証なし」と教える。では損失面が凸でない深層学習はなぜ動くのか。凸集合・凸関数の定義から、局所解より恐い鞍点、汎化と結びつく平坦な最小値まで、地形の言葉で一気につなぐ。 14 ·探索と最適化·★ 会員·10分で読めます 動的計画法を1から解説 — 部分問題を覚えておくということ 素朴な再帰はなぜ指数爆発するのか。メモ化と表埋めで何が変わるのか。フィボナッチ・ナップサック・編集距離を順に分解し、編集距離が音声認識のWERや拡散モデルのステップ選択にそのまま現れることまで見ます。 15 ·機械学習の基礎·無料·9分で読めます 損失関数と最適化 — モデルはどうやって「間違いから学ぶ」のか MSEと交差エントロピーはなぜあの形なのか。勾配とは何を指す矢印なのか。勾配降下法の1ステップを、式・動く図・10行のコードで分解します。学習率を上げすぎたときの発散も手元で体感できます。