ノイズのあるツール環境下での対話エージェント評価PredAct-Bench
arXiv cs.CL ・ 2026-08-03
原題: PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise
AI による要約
出力結果に誤りや確率的ノイズが含まれるツールを使用する対話エージェントの性能を評価するベンチマーク「PREDACTBENCH」を開発した。現実の運用で発生する不完全なツール出力環境において、AIシステムが人間の意思決定を適切に支援できるかを評価可能にする。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。