トレンド一覧

Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions

arXiv stat.ML ・ 2026-07-28

AI による要約

隠れた行動を持つオフライン強化学習において、次状態変数をプロキシとして利用する新しい頑健な推定量「LURE」が提案された。これにより、観測誤差のあるデータからでも偏りのない方策評価が可能になり、統計的推論の精度向上が期待できる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv stat.ML)をご確認ください。

研究・論文