JA EN

#llm-security

1 記事

01 ·エージェント·★ 会員·論文·15分で読めます 論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げる SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 防御用に微調整したLLMも、適応的なプロンプトインジェクションにはほぼ100%破られてきた。原因は「出力全体に1つの点数」しか与えない訓練にある。注入前のきれいな入力を見た教師にトークン単位で採点させるSecOPDを、前提知識ゼロから解説する。