トレンド一覧

Average-Reward CMDPs におけるニューラル Actor-Critic の階層型モンテカルロ法

arXiv cs.LG ・ 2026-07-30

原題: Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs

AI による要約

安全性基準を満たしながら報酬を最大化する制約付きマルコフ決定過程(CMDP)において、ニューラルクリティックを用いたアルゴリズムのオーダー最適収束を達成した研究。階層型マルチレベルモンテカルロ法によりバイアスと最適化コストのトレードオフを解消した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。

研究・論文