HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
arXiv cs.CL ・ 2026-07-28
AI による要約
企業の標準作業手順書などの長大なポリシー文書が、エージェントの長期的なツール使用にどのように影響するかを評価するベンチマーク「HANDBOOK.md」が提案されました。実務環境に近い自己完結型の空間で指示追従能力を厳密に測定できるため重要です。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。