潜在的報酬レジスタ: 拡散モデルの好みの整列
arXiv cs.LG ・ 2026-08-04
原題: Latent Reward Registers for Diffusion Preference Alignment
AI による要約
拡散モデルを人間の好みに整列させる通常の方法は、最終的な生成されたサンプルに対するスパースな終端報酬に依存している。これにより、多段階のノイズ除去プロセス全体で重大な時間的帰属課題が生じる。潜在的報酬レジスタは、凍結された拡散トランスフォーマー(DiT)の入力シーケンスに学習可能な、位置に依存しないレジスタトークンを追加することで、終端好みを直接中間のノイズのある潜在的状態から推定するメカニズムである。この独立した読み出しメカニズムは、ジェネレーターの隠れ状態や速度場を変更せずに潜在的報酬証拠を抽出する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。