部分空間推論による効率的な能動型報酬学習を実現するPreferenceEKF
arXiv cs.AI ・ 2026-09-03
原題: Subspace Inference Enables Efficient Active Reward Learning from Preferences
AI による要約
人間のフィードバックからの強化学習において報酬モデルの不確実性を効率的に追跡するため、拡張カルマンフィルタを用いた逐次ベイズフィルタリング手法「PreferenceEKF」を提案した。ニューラルネットワークの全パラメータ空間ではなく低次元パラメータ部分空間で推論を行うことで、サンプル効率を高める。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。