Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
arXiv cs.LG ・ 2026-07-29
AI による要約
強化学習において事前学習済みポリシーをファインチューニングする際、Q関数の事前学習が実際に出力を向上させるかを体系的に調査した。ナイーブなQ関数の事前学習はランダム初期化に対してほとんど利点をもたらさないことが明らかになった。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。