トレンド一覧

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

arXiv cs.AI ・ 2026-07-29

AI による要約

ファインチューニング時の脆弱性や忘却問題に対処するため、安全性と専門スキルの両立を図る新しいアライメントフレームワークROPDを提案する。出力確率分布の乖離をモデル化することで、プロンプトのテンプレート変更に対しても頑健な安全性を実現する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

研究・論文 / LLM・基盤モデル