RLVRとオンポリシー蒸留では順次適用が同時適用を凌駕
arXiv cs.AI ・ 2026-09-03
原題: Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
AI による要約
検証可能な報酬を用いた強化学習(RLVR)とオンポリシー蒸留(OPD)を単一のステップで同時に適用する従来手法に対し、単純な2段階のスキームである「OPD-then-RL」が論理・数学推論ベンチマークにおいて一貫して優れた性能を示すことが示された。OPDが教師のサポートする解の網羅性を広げ、RLがその範囲内を洗練させることで、一貫した学習ダイナミクスとパラメータ更新が実現される。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。