長期エージェント学習に向けた動的ルブリックによる報酬割り当て
arXiv cs.AI ・ 2026-09-03
原題: DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
AI による要約
プログラム的なチェッカーが存在しない長期エージェントドメインにおいて、報酬の信頼性を確保するための動的ルブリックベースのアドバンテージ再分配手法「DRACO」が提案された。トレーニング中にポリシーの進化する能力を追跡するルブリックを動的に生成し、完了した軌跡ごとにスコアを算出して、GRPOにおけるステップごとの差別化されたアドバンテージを生成する。AppWorldベンチマークにおいてベースモデルから15.9ポイントの性能向数を記録した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。