Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions
arXiv stat.ML ・ 2026-07-28
AI による要約
隠れた行動を持つオフライン強化学習において、次状態変数をプロキシとして利用する新しい頑健な推定量「LURE」が提案された。これにより、観測誤差のあるデータからでも偏りのない方策評価が可能になり、統計的推論の精度向上が期待できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv stat.ML)をご確認ください。