長期探索エージェントの効率的学習を可能にする新たな訓練手法
arXiv cs.AI ・ 2026-08-05
原題: ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
AI による要約
長期探索エージェントの学習手法として、ABC(Answer-Backtracked Credit Assignment)を提案した。ABCは軌跡レベルの結果をステップレベルの教師信号に変換し、有用な行動を報酬として与え、誤った行動を抑制する仕組みだ。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。