オフライン強化学習におけるマルチステップ近接方策改善手法
arXiv cs.LG ・ 2026-09-03
原題: Multi-step Proximal Policy Improvement in Offline Reinforcement Learning
AI による要約
オフライン強化学習においてデータセットの分布から外れた方策改善を安全に行うため、方策を確率多様体としてモデル化したマルチステップ近接方策改善(MPI)手法が提案された。連続的なリセンター近接ステップを組み合わせることで、各段階での近接制御を維持しながらデータセットサポートを超える制御を可能にする。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。