JA EN

#mmlu

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます LLM評価を1から — ベンチマークの読み方と汚染問題 Measuring Massive Multitask Language Understanding モデル発表資料に並ぶベンチマークの棒グラフを、正しく疑いながら読むための記事。採点方式がMMLUのスコアを動かす仕組み、問題数から来る誤差の幅、公開ベンチマークが構造的に汚染される理由、Chatbot ArenaのBradley-Terryモデルとその弱点、LLM-as-a-judgeの三つの偏りまでを1から扱う。