LLMの文脈漏洩を検知するLeakGaugeの提案
arXiv cs.AI ・ 2026-08-18
原題: The Model's Tell: Measuring Context-Leakage Attack Signals with Behavior Gauges
AI による要約
LLMが処理する文脈情報の漏洩を検知する手法LeakGaugeを提案した。モデルのプリフィル段階で漏洩リスクをスコア化する手法で、11のLLMに対し検証した結果、機密内容に依存しない汎用的な指標がより頑健なシグナルを示すことを確認した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。