The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
arXiv cs.AI ・ 2026-07-27
AI による要約
AIエージェントのマルチターン長期的計画能力を強化・分析するための制御可能な環境およびオンポリシー蒸留手法が提案されました。事前学習から事後学習までの過程において、ワールドモデルの構築や適切なデータ構成が長期計画の汎化性能を高めることを体系的に明らかにしています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。