トレンド一覧

不確実なMDPにおけるミニマックスリグレットの最適化

arXiv cs.AI ・ 2026-08-03

原題: Optimizing Minimax Regret in Uncertain MDPs with Small Sets of Policies

AI による要約

不確実なマルコフ決定過程(UMDP)では、環境のモデルが不確実であることが多い。UMDPでは、可能な環境を共有状態と行動を持つMDPのセットとして表現する。単一のポリシーをすべての可能なMDPにわたって最適化することは、パフォーマンスを犠牲にする可能性がある。一方、すべてのMDPに対して個別に最適化されたポリシーを準備することは、運用、規制、または解釈可能性の制約に違反する可能性がある。研究者は、k-適応ポリシーシンセシスを導入し、k個のポリシーのセットをミニマックスリグレット目標の下で最適化する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル