長期的なエージェント評価を目的としたオープンベンチマーク「CivBench」
arXiv cs.AI ・ 2026-09-02
原題: CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI
AI による要約
言語モデルエージェントを長期的なツール媒介型環境で評価するためのオープンソースベンチマーク「CivBench」を開発した。Model Context Protocol(MCP)を介して76のツールや構造化されたテキスト変換レイヤーを提供し、1エピソード300ターン以上にわたる計画立案や状態監視の能力を評価する。4つのモデルファミリーを対象としたパイロット評価を実施し、エージェントの振る舞いを測定する2つのインターフェース指標を導入した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。