JA EN

#safety

8 記事

01 ·評価と審判·★ 会員·論文·12分で読めます 報酬ハッキング — 測り方を決めると、そこが壊れる Concrete Problems in AI Safety 指標を決めた瞬間から、その指標は壊れ始める。Goodhartの法則がなぜ統計的に避けられないのかを代理報酬のずれから説明し、ボートレースの周回からRLHFの冗長化・おべっか・テストのハードコードまで実例で追い、最適化圧と真の性能の乖離を検出する方法とKL正則化などの現実的な対策を扱う。 02 ·論文解説·無料·20分で読めます 代理指標では、もう守れない — 自動運転 2026年8月新着8本を束ねて読む 2026年8月下旬の自動運転系arXiv新着8本を横断して読む。安全を期待値で測るのをやめる動き、自車の履歴の外側に観測経路を足す動き、そして無理に束ねられない独立した2本を、関係が見える形で整理する。 03 ·LLM — 大規模言語モデル·無料·論文·11分で読めます ハルシネーションはなぜ起きる — 仕組みと現実的な対策 Survey of Hallucination in Natural Language Generation LLMが平然と嘘をつくのはバグではなく、次トークン予測という学習目的の素直な帰結。損失関数に真偽の項がないこと、圧縮された知識が端から崩れること、サンプリングが裾を引くこと、採点方法が当てずっぽうに報酬を与えることを1から分解し、RAG・引用照合・不確実性推定という現場で実際に効く順に対策を並べる。 04 ·LLM — 大規模言語モデル·無料·論文·11分で読めます ハルシネーションはなぜ起きる — 仕組みと現実的な対策 Survey of Hallucination in Natural Language Generation LLMが平然と嘘をつくのはバグではなく、次トークン予測という学習目的の素直な帰結。損失関数に真偽の項がないこと、圧縮された知識が端から崩れること、サンプリングが裾を引くこと、採点方法が当てずっぽうに報酬を与えることを1から分解し、RAG・引用照合・不確実性推定という現場で実際に効く順に対策を並べる。 05 ·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます アライメント概説 — RLHFからConstitutional AIまで Training language models to follow instructions with human feedback アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。 06 ·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます アライメント概説 — RLHFからConstitutional AIまで Training language models to follow instructions with human feedback アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。 07 ·セキュリティ·★ 会員·論文·13分で読めます LLMセキュリティ — プロンプトインジェクションと防御 Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection LLMは「上司の指示」と「書類に書かれた文字」を区別できない。この一点から生まれる直接注入・間接注入・ツール境界の問題を前提知識ゼロから解き、プロンプトで守ろうとする誤りと、実行層に境界を置く多層防御の組み方までを扱う。 08 ·セキュリティ·★ 会員·論文·13分で読めます LLMセキュリティ — プロンプトインジェクションと防御 Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection LLMは「上司の指示」と「書類に書かれた文字」を区別できない。この一点から生まれる直接注入・間接注入・ツール境界の問題を前提知識ゼロから解き、プロンプトで守ろうとする誤りと、実行層に境界を置く多層防御の組み方までを扱う。