トレンド一覧

長期的なエージェント評価を目的としたオープンベンチマーク「CivBench」

arXiv cs.AI ・ 2026-09-02

原題: CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI

AI による要約

言語モデルエージェントを長期的なツール媒介型環境で評価するためのオープンソースベンチマーク「CivBench」を開発した。Model Context Protocol(MCP)を介して76のツールや構造化されたテキスト変換レイヤーを提供し、1エピソード300ターン以上にわたる計画立案や状態監視の能力を評価する。4つのモデルファミリーを対象としたパイロット評価を実施し、エージェントの振る舞いを測定する2つのインターフェース指標を導入した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

AIエージェント / 研究・論文

この話題に関わるコラム