GRPOのロールアウト負荷を軽減するリプレイ制御手法が提案
arXiv cs.CL ・ 2026-09-03
原題: Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO
AI による要約
推論モデルの強化学習においてボトルネックとなるロールアウト生成コストを削減する制御手法「Headroom-Drift Replay」が提案された。蓄積されたグループを残存学習価値を示すHeadroomでランク付けし、現行ポリシーとの適合度を表すDriftで再利用をフィルタリングする。新たな生成や補助モデルを追加することなくGRPOにおける過去軌跡の原則的な再利用を実現した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。