SafeCAによるText-to-Video生成モデルのジェイルブレイク攻撃防御技術
arXiv cs.CV ・ 2026-08-11
原題: SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense
AI による要約
テキストからの動画生成モデルに対するジェイルブレイク攻撃を防ぐため、クロスアテンション特徴空間に着目した防御機構SafeCAを提案した。拡散プロセス中に通常サンプルと攻撃サンプルの線形分離可能性が高まる現象を発見し、重要なアテンション領域を特定して正規化を行う。入力フィルタリングのような意味の歪みや処理遅延を起こさずに有害コンテンツの生成を抑制する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。