Diffusion LLMの内部安全性メカニズムと削減攻撃の検証
arXiv cs.AI ・ 2026-08-07
原題: Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits
AI による要約
Diffusion LLM(DLLM)の安全性整列をメカニズム面から分析した研究。自己回帰モデルから初期化されたDLLMは元の安全性ニューロン構造を継承しており、特定ニューロンの削減によって攻撃成功率が大幅に上昇することを実証した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。