JA EN

#prompt-injection

2 記事

01 ·エージェント·★ 会員·論文·15分で読めます 論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げる SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 防御用に微調整したLLMも、適応的なプロンプトインジェクションにはほぼ100%破られてきた。原因は「出力全体に1つの点数」しか与えない訓練にある。注入前のきれいな入力を見た教師にトークン単位で採点させるSecOPDを、前提知識ゼロから解説する。 02 ·セキュリティ·★ 会員·論文·13分で読めます LLMセキュリティ — プロンプトインジェクションと防御 Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection LLMは「上司の指示」と「書類に書かれた文字」を区別できない。この一点から生まれる直接注入・間接注入・ツール境界の問題を前提知識ゼロから解き、プロンプトで守ろうとする誤りと、実行層に境界を置く多層防御の組み方までを扱う。