LLM報酬信号を用いた政策不変な報酬 shaping の理論的保証を提示
arXiv cs.AI ・ 2026-08-18
原題: Policy-Invariant Reward Shaping from LLM Feedback: A Framework for Hybrid RL Agents
AI による要約
LLMと強化学習のハイブリッドアーキテクチャにおいて、LLM由来の報酬信号を用いた報酬 shaping が最適政策を保持する条件を理論的に示す。Goal-Augmented MDPの枠組みで、LLMの進捗スコアを潜在関数として用いることで、不正確なスコア下でも最適政策が維持されることを数値実験で検証する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。