トレンド一覧

拡散環境における多腕バンディットの方策勾配の収束と後悔

arXiv cs.LG ・ 2026-07-31

原題: Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

AI による要約

連続時間強化学習フレームワークにおける拡散環境下での多腕バンディット問題に対し、方策勾配更新の収束性と非漸近的後悔上界を解析した。新しいリヤプノフ関数を用いて解析の透明性を高め、離散時間アルゴリズムへの応用も示した点が重要である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。

研究・論文