トレンド一覧

GRPOのロールアウト負荷を軽減するリプレイ制御手法が提案

arXiv cs.CL ・ 2026-09-03

原題: Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO

AI による要約

推論モデルの強化学習においてボトルネックとなるロールアウト生成コストを削減する制御手法「Headroom-Drift Replay」が提案された。蓄積されたグループを残存学習価値を示すHeadroomでランク付けし、現行ポリシーとの適合度を表すDriftで再利用をフィルタリングする。新たな生成や補助モデルを追加することなくGRPOにおける過去軌跡の原則的な再利用を実現した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム