不確実なMDPにおけるミニマックスリグレットの最適化
arXiv cs.AI ・ 2026-08-03
原題: Optimizing Minimax Regret in Uncertain MDPs with Small Sets of Policies
AI による要約
不確実なマルコフ決定過程(UMDP)では、環境のモデルが不確実であることが多い。UMDPでは、可能な環境を共有状態と行動を持つMDPのセットとして表現する。単一のポリシーをすべての可能なMDPにわたって最適化することは、パフォーマンスを犠牲にする可能性がある。一方、すべてのMDPに対して個別に最適化されたポリシーを準備することは、運用、規制、または解釈可能性の制約に違反する可能性がある。研究者は、k-適応ポリシーシンセシスを導入し、k個のポリシーのセットをミニマックスリグレット目標の下で最適化する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。