スキル拡張LLMエージェントの実際のスキル有効性を評価する指標
arXiv cs.MA ・ 2026-07-29
原題: Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents
AI による要約
言語エージェントが「スキルを使用した」と自称しても、実際の意思決定に変化を与えていない「Reasoning Backroom」問題に着目した。スキルの指示や内容に介入して効果を判定する評価枠組みBACKTRACEおよび検証用テストベッドBACKROOMBenchを構築し、見せかけのスキル利用を定量的に評価可能にした。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.MA)をご確認ください。