コンピュータ操作エージェントのベンチマーク評価における誤採点の分析
arXiv cs.AI ・ 2026-07-30
原題: How Benchmarks Mis-Score Computer-Use Agents
AI による要約
ウェブ閲覧やデスクトップ操作を行うコンピュータ操作エージェントのベンチマークスコアが、硬直したスクリプト等の理由でどのように誤採点されているかを監査した研究。失敗判定の多くが評価者の見落としやタスクの破損に起因することを明らかにしています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。