JA EN

#bias

1 記事

01 ·評価と審判·無料·論文·12分で読めます LLM-as-a-Judge を1から — AIがAIを採点する仕組みと限界 Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena モデルの出力をモデルに採点させる「LLM-as-a-Judge」を、前提知識ゼロから解説。判定を確率分布として読む方法、位置バイアス・冗長性バイアス・自己選好という三つの偏り、比較回数が2乗で増える構造、そして審査員自身を人手と突き合わせて検証する手順までを扱います。