LLMの拒絶動作と安全性を決定する事後学習手法の内部メカニズム検証
arXiv cs.CL ・ 2026-09-03
原題: Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness
AI による要約
有害なリクエストに対するLLMの拒絶動作が、どのような事後学習手法によって内部で構築されるかを比較検証した。推論を伴うファインチューニングがすべてのモデルで独特な拒絶メカニズムを生み出す一方、完全な安全性を単独で達成する手法はないことが示された。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。