トレンド一覧

長期エージェント学習に向けた動的ルブリックによる報酬割り当て

arXiv cs.AI ・ 2026-09-03

原題: DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

AI による要約

プログラム的なチェッカーが存在しない長期エージェントドメインにおいて、報酬の信頼性を確保するための動的ルブリックベースのアドバンテージ再分配手法「DRACO」が提案された。トレーニング中にポリシーの進化する能力を追跡するルブリックを動的に生成し、完了した軌跡ごとにスコアを算出して、GRPOにおけるステップごとの差別化されたアドバンテージを生成する。AppWorldベンチマークにおいてベースモデルから15.9ポイントの性能向数を記録した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

AIエージェント / 研究・論文

この話題に関わるコラム