On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment
arXiv cs.AI ・ 2026-07-29
AI による要約
ファインチューニング時の脆弱性や忘却問題に対処するため、安全性と専門スキルの両立を図る新しいアライメントフレームワークROPDを提案する。出力確率分布の乖離をモデル化することで、プロンプトのテンプレート変更に対しても頑健な安全性を実現する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。