トレンド一覧

DPO学習中の内部信号でトークンごとの貢献度を調整する「Se-DPO」

arXiv cs.CL ・ 2026-08-10

原題: Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

AI による要約

直接選好最適化(DPO)において全トークンを同等に扱う従来の課題に対し、各トークンの貢献度を動的に調整する「Se-DPO」が提案された。モデル内部の進化する報酬信号を利用して各位置のKL正則化をリアルタイムに制御する。これにより学習進行に伴う信号の不整合を防ぎ、人間選好への整合精度を向上させる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム