トレンド一覧

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

arXiv cs.AI ・ 2026-07-28

AI による要約

AIエージェントを共通環境で評価するための統一コーパス「Messier」が発表されました。本コーパスは30個のベンチマーク、714のエージェント、1万超のタスクにわたる95万件以上の実行記録を標準化して収録しています。エージェント評価の断片化を解消し、プログラミングや関数呼び出しなどの能力の進化を正確に分析・比較可能にする点で重要です。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

AIエージェント / 研究・論文