トレンド一覧

What do Reward Models Memorize?

arXiv cs.CL ・ 2026-07-27

AI による要約

人間好みのデータセットで学習された判定型報酬モデル(RM)の暗記傾向を分析した研究が発表された。モデルが訓練データ固有のショートカットや回答の長さといった単純な規則性に依存して丸暗記を行っており、多様な文脈における適切な評価能力を阻害している実態が明らかになった。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文