CRPO: 対比学習が解くAgent RLにおける自蒸留の露出バイアス問題
Zenn LLM ・ 2026-08-01
AI による要約
Agent RLにおける自蒸留手法の露出バイアス問題を、対比学習の視点から解決する新しい手法「CRPO」が提案されました。予測エントロピー差を用いて正例と負例を分類し、推論ベンチマークで一貫した改善を示しています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Zenn LLM)をご確認ください。
Zenn LLM ・ 2026-08-01
Agent RLにおける自蒸留手法の露出バイアス問題を、対比学習の視点から解決する新しい手法「CRPO」が提案されました。予測エントロピー差を用いて正例と負例を分類し、推論ベンチマークで一貫した改善を示しています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Zenn LLM)をご確認ください。