SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
arXiv cs.CL ・ 2026-07-29
AI による要約
ラベル付きフィードバックなしで推論時に言語モデルが自己進化するための強化学習手法「SERPO」を提案する。回答の多数決に頼らず、応答のエビデンス、クエリごとの基準、ポリシーを閉ループで共進化させることで、オープンエンドな生成タスクへの適応を可能にする。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。