PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#contamination
4 記事
01
2026-09-03
·
評価と審判
·
★ 会員
·
論文
·
12分で読めます
ベンチマーク汚染 — 「高スコア」を疑う技術
Rethinking Benchmark and Contamination for Language Models with Rephrased Samples
ベンチマークの高スコアが実力なのか暗記なのかを見分けるための記事。汚染の3つの型、n-gram重なり・埋め込み近傍・メンバーシップ推論という検出手段とその限界、カナリア文字列と時系列分割の仕組みを1から解説し、論文を読むときの警戒点をチェックリストにまとめる。
02
2026-09-03
·
評価と審判
·
無料
·
論文
·
15分で読めます
エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るか
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェント評価の代表3本(SWE-bench・GAIA・OSWorld)が実際に何を測っているかを、採点方式の違いから解きほぐす。汚染とリークの4類型、そして発表されたスコアを自分の用途向けに読み替える手順まで。
03
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
LLM評価を1から — ベンチマークの読み方と汚染問題
Measuring Massive Multitask Language Understanding
モデル発表資料に並ぶベンチマークの棒グラフを、正しく疑いながら読むための記事。採点方式がMMLUのスコアを動かす仕組み、問題数から来る誤差の幅、公開ベンチマークが構造的に汚染される理由、Chatbot ArenaのBradley-Terryモデルとその弱点、LLM-as-a-judgeの三つの偏りまでを1から扱う。
04
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
15分で読めます
エージェント評価 — ベンチとハーネスの作法
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。