JA EN

#computer-use

2 記事

01 ·エージェント·★ 会員·論文·12分で読めます 論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。 02 ·エージェント·★ 会員·論文·10分で読めます 論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。