QuoteBench: LLMエージェントのコマンド実行パス障害を暴く評価基準
arXiv cs.AI ・ 2026-08-13
原題: QuoteBench: How Matched Scores Can Hide Command-Path Failures
AI による要約
LLMコーディングエージェントがBashコマンドを発行する際のシリアライズや再パースに起因する障害を検証するQuoteBenchを提案した。14系統のインシデントに由来する56のワンショットタスクを用い、パーサーの介在による成否の変化を測定している。追加パーサーを通すだけで同一応答の成功率が55.4〜73.2ポイント低下することを確認した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。