JA EN

#self-consistency

2 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·17分で読めます 推論時スケーリング — 「長く考える」モデルの原理 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。 02 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: 正解も強い教師もなしで伸びる — u-OPSD が使う「自分の多数決」 On-Policy Self-Distillation without Any Supervision 模範解答も強い教師モデルも使わず、モデル自身が出した8本の答案の多数決を『特権的な文脈』に仕立てて自己蒸留する u-OPSD(arXiv:2608.06296)を、論文本文だけを根拠に1から解説する。