JA EN

#chain-of-thought

4 記事

01 ·無料·論文·11分で読めます Chain-of-Thought を1から — 「考えを書かせる」と何が変わるのか Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 「ステップごとに考えて」と一言足すだけで解ける問題が増えるのはなぜか。few-shot CoT・zero-shot CoT・self-consistency を前提知識ゼロから解説し、計算の直列化という理屈、効かない条件、推論モデルとの関係まで踏み込む。 02 ·LLM — 大規模言語モデル·★ 会員·論文·17分で読めます 推論時スケーリング — 「長く考える」モデルの原理 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。 03 ·★ 会員·論文·12分で読めます 論文解説: DEFT-RLVR — 自動運転VLMに未来の軌跡を「先に見せる」と推論が捏造される Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs 自動運転VLMのCoT教師データ作成で正解軌跡を先に見せると、教師は理由を後付けし幻覚が29%→50%に倍増する——この「軌跡アンカリングバイアス」を実証し、走行計画を選択問題化(AD-MCQ)して軌跡の開示を決断の後に遅延させる強化学習 DEFT-RLVR (arXiv:2608.01755) を論文本文だけを根拠に解説する。 04 ·LLM — 大規模言語モデル·無料·論文·10分で読めます プロンプトエンジニアリングの科学 — 何が実証され、何が迷信か Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 「ステップバイステップで考えて」は効くのか。Chain-of-Thought論文(Wei et al., 2022)の本文だけを根拠に、実験で実証されたこと(規模の閾値を超えたモデルでのみ効く創発)と、巷の呪文の多くが未検証であることの線引きをする。