LLMの安全対策を突破する暗黙の文脈・語用論に着目したプロンプト攻撃手法
arXiv cs.CL ・ 2026-08-10
原題: Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models
AI による要約
大規模言語モデル(LLM)の安全アライメントにおいて、明示的なプロンプトではなく人間言語の暗黙的な文脈や語用論を突く攻撃手法が分析された。世界知識や社会的規範といった直接表現されない前提条件を悪用することで、既存のアライメントガードレールを回避できる脆弱性が実証された。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。