JA EN

#test-time-compute

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·17分で読めます 推論時スケーリング — 「長く考える」モデルの原理 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。