DPO学習中の内部信号でトークンごとの貢献度を調整する「Se-DPO」
arXiv cs.CL ・ 2026-08-10
原題: Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization
AI による要約
直接選好最適化(DPO)において全トークンを同等に扱う従来の課題に対し、各トークンの貢献度を動的に調整する「Se-DPO」が提案された。モデル内部の進化する報酬信号を利用して各位置のKL正則化をリアルタイムに制御する。これにより学習進行に伴う信号の不整合を防ぎ、人間選好への整合精度を向上させる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。