トレンド一覧

CRPO: 対比学習が解くAgent RLにおける自蒸留の露出バイアス問題

Zenn LLM ・ 2026-08-01

AI による要約

Agent RLにおける自蒸留手法の露出バイアス問題を、対比学習の視点から解決する新しい手法「CRPO」が提案されました。予測エントロピー差を用いて正例と負例を分類し、推論ベンチマークで一貫した改善を示しています。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Zenn LLM)をご確認ください。

研究・論文 / AIエージェント