LLMのホワイトボックス攻撃手法を提案する研究成果
arXiv cs.LG ・ 2026-08-18
原題: Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
AI による要約
LLMの知識編集を悪用した新たなホワイトボックス攻撃手法が提案された。編集対象のカテゴリ全体に関連知識を活用することで、従来手法より攻撃効果を高める。複数のアーキテクチャで実験し、一般性能への悪影響を抑えつつ攻撃精度を向上させた。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。