トレンド一覧

Diffusion LLMの内部安全性メカニズムと削減攻撃の検証

arXiv cs.AI ・ 2026-08-07

原題: Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

AI による要約

Diffusion LLM(DLLM)の安全性整列をメカニズム面から分析した研究。自己回帰モデルから初期化されたDLLMは元の安全性ニューロン構造を継承しており、特定ニューロンの削減によって攻撃成功率が大幅に上昇することを実証した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム