トレンド一覧

ロバスト MDP に対する適応的政策ポートフォリオの理論的枠組みを構築

arXiv cs.AI ・ 2026-08-18

原題: Adaptive Policy Portfolios for Robust Markov Decision Processes

AI による要約

ロバスト MDP における適応的政策ポートフォリオの理論的枠組みを提案した。記憶を持たないランダム化政策の集合をオフラインで合成し、軽量なオンライン選択器と組み合わせる。ロバスト後悔尺度を用いてポートフォリオの品質を評価し、証明可能な合成手法を与えた。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

研究・論文

この話題に関わるコラム