トレンド一覧

RLVRとオンポリシー蒸留では順次適用が同時適用を凌駕

arXiv cs.AI ・ 2026-09-03

原題: Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

AI による要約

検証可能な報酬を用いた強化学習(RLVR)とオンポリシー蒸留(OPD)を単一のステップで同時に適用する従来手法に対し、単純な2段階のスキームである「OPD-then-RL」が論理・数学推論ベンチマークにおいて一貫して優れた性能を示すことが示された。OPDが教師のサポートする解の網羅性を広げ、RLがその範囲内を洗練させることで、一貫した学習ダイナミクスとパラメータ更新が実現される。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム