JA EN

#contamination

4 記事

01 ·評価と審判·★ 会員·論文·12分で読めます ベンチマーク汚染 — 「高スコア」を疑う技術 Rethinking Benchmark and Contamination for Language Models with Rephrased Samples ベンチマークの高スコアが実力なのか暗記なのかを見分けるための記事。汚染の3つの型、n-gram重なり・埋め込み近傍・メンバーシップ推論という検出手段とその限界、カナリア文字列と時系列分割の仕組みを1から解説し、論文を読むときの警戒点をチェックリストにまとめる。 02 ·評価と審判·無料·論文·15分で読めます エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るか SWE-bench: Can Language Models Resolve Real-World GitHub Issues? エージェント評価の代表3本(SWE-bench・GAIA・OSWorld)が実際に何を測っているかを、採点方式の違いから解きほぐす。汚染とリークの4類型、そして発表されたスコアを自分の用途向けに読み替える手順まで。 03 ·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます LLM評価を1から — ベンチマークの読み方と汚染問題 Measuring Massive Multitask Language Understanding モデル発表資料に並ぶベンチマークの棒グラフを、正しく疑いながら読むための記事。採点方式がMMLUのスコアを動かす仕組み、問題数から来る誤差の幅、公開ベンチマークが構造的に汚染される理由、Chatbot ArenaのBradley-Terryモデルとその弱点、LLM-as-a-judgeの三つの偏りまでを1から扱う。 04 ·エージェント·★ 会員·論文·15分で読めます エージェント評価 — ベンチとハーネスの作法 SWE-bench: Can Language Models Resolve Real-World GitHub Issues? エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。