JA EN

#llm-as-judge

1 記事

01 ·エージェント·★ 会員·論文·12分で読めます 論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。