JA EN

#reasoning

15 記事

01 ·無料·論文·11分で読めます Chain-of-Thought を1から — 「考えを書かせる」と何が変わるのか Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 「ステップごとに考えて」と一言足すだけで解ける問題が増えるのはなぜか。few-shot CoT・zero-shot CoT・self-consistency を前提知識ゼロから解説し、計算の直列化という理屈、効かない条件、推論モデルとの関係まで踏み込む。 02 ·無料·論文·11分で読めます Chain-of-Thought を1から — 「考えを書かせる」と何が変わるのか Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 「ステップごとに考えて」と一言足すだけで解ける問題が増えるのはなぜか。few-shot CoT・zero-shot CoT・self-consistency を前提知識ゼロから解説し、計算の直列化という理屈、効かない条件、推論モデルとの関係まで踏み込む。 03 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: Random Attention — KVキャッシュの追い出しは「ランダムで十分」だった Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning KVキャッシュから何を捨てるかを決める「重要度スコア」は、ほとんど効いていなかった。プロンプトだけ守って残りをヘッドごとに一様ランダムで捨てるだけで最強手法と同等の精度、しかもvLLMで32〜43%速い。4モデル×6タスクの実測と、なぜそうなるかの2つの対照実験を読み解きます。 04 ·評価と審判·★ 会員·論文·16分で読めます 自己改善するAI — 共進化・自己対戦・カリキュラム生成の系譜 Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm 外から教師データを足さずにモデルが強くなる、という現象がどういう条件で成立するのかを1から分解する。AlphaZeroの自己対戦が成立した三つの条件を取り出し、それが言語モデルでどこから壊れるか、共進化とカリキュラム生成がその穴をどう埋めようとしているか、そして自己改善の主張をどう評価すべきかまでを扱う。 05 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える TTPO: Test-Time Policy Optimization 多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。 06 ·LLM — 大規模言語モデル·★ 会員·論文·17分で読めます 推論時スケーリング — 「長く考える」モデルの原理 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。 07 ·LLM — 大規模言語モデル·★ 会員·論文·17分で読めます 推論時スケーリング — 「長く考える」モデルの原理 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。 08 ·論文解説·★ 会員·15分で読めます 記号主義vs接続主義 — 60年論争の現在地 AIには「規則を書き下す派」と「例から重みを学ぶ派」という二つの部族があり、60年ずっと争ってきました。パーセプトロン本・エキスパートシステムの崩壊・誤差逆伝播の逆転劇をたどり、なぜ今のLLMが電卓を呼び文法に縛られているのか、その必然を1から解説します。 09 ·LLM — 大規模言語モデル·★ 会員·論文·12分で読めます スケーリング懐疑論 — 「大きくするだけ」批判の系譜 Training Compute-Optimal Large Language Models 「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。 10 ·LLM — 大規模言語モデル·★ 会員·論文·12分で読めます スケーリング懐疑論 — 「大きくするだけ」批判の系譜 Training Compute-Optimal Large Language Models 「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。 11 ·モデル系統図鑑·無料·12分で読めます DeepSeek系を1から — MoEと蒸留で殴り込んだ系譜 MoE・MLA・GRPO・蒸留という4つの道具でオープンLLMの勢力図を塗り替えたDeepSeekの系譜を、V2/V3/R1の設計判断に沿って前提知識ゼロから解説。話題になった学習コストの数字の読み方と、蒸留モデルの正しい使いどころまで。 12 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: 正解も強い教師もなしで伸びる — u-OPSD が使う「自分の多数決」 On-Policy Self-Distillation without Any Supervision 模範解答も強い教師モデルも使わず、モデル自身が出した8本の答案の多数決を『特権的な文脈』に仕立てて自己蒸留する u-OPSD(arXiv:2608.06296)を、論文本文だけを根拠に1から解説する。 13 ·推論・高速化·★ 会員·論文·11分で読めます 論文解説: DAPD — 蒸留の教師が持つ「カンニングペーパーの幻想」を二重アンカーで断つ DAPD: Dual-Anchored Policy Distillation 模範解答を見た教師から蒸留すると、生徒は本番で「見えない答えを思い出したふり」をする——この privilege illusion の根本原因を情報の非対称性と特定し、二重のアンカーで解消する DAPD (arXiv:2608.01735) を論文本文だけを根拠に解説する。 14 ·推論・高速化·★ 会員·論文·11分で読めます 論文解説: BDH-CQ — 言葉にせずに考えるAI。再帰メモリ×潜在推論がARCのコスト効率を塗り替えた BDH-CQ: In-Context Learning with Recurrent Latent Reasoning 思考の途中経過を一切言語化せず、デモを再帰メモリに書き込み高次元潜在空間の反復計算で解く BDH-CQ (arXiv:2608.09888)。150MパラメータでARC-AGI-1の29.5% pass@2を1タスク$0.0007で達成し、コスト対精度のパレート境界を突破した論文を、本文だけを根拠に解説する。 15 ·論文解説·★ 会員·論文·12分で読めます 論文解説: Alpamayo — 自動運転の推論モデル Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail NVIDIAの自動運転VLA「Alpamayo-R1」を原論文から読み解く。因果の鎖で推論を構造化するChain of Causationデータセット、flow matchingで99msに収めた軌道デコード、推論と行動のズレをRLで罰する3段階学習まで、1から解説する。