拡散環境における多腕バンディットの方策勾配の収束と後悔
arXiv cs.LG ・ 2026-07-31
原題: Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment
AI による要約
連続時間強化学習フレームワークにおける拡散環境下での多腕バンディット問題に対し、方策勾配更新の収束性と非漸近的後悔上界を解析した。新しいリヤプノフ関数を用いて解析の透明性を高め、離散時間アルゴリズムへの応用も示した点が重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。