マルコフサンプリング下の固定ステップサイズTD学習における自己正規化推論
arXiv cs.LG ・ 2026-08-11
原題: Self-Normalized Inference for Constant-Stepsize Temporal-Difference Learning under Markovian Sampling
AI による要約
固定ステップサイズの線形TD学習において、自己相関とステップサイズ依存の目標値を考慮した機能的中心極限定理を確立した。ブラウン橋を用いた自己正規化手法を提案し、共分散行列の推定やバンド幅選定を行わずに漸近的にピボタルな信頼領域を構築可能にした。1パス処理が可能でメモリ消費が軌跡長に依存しない推論を実現する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。