AIモデルの「モデル催眠」現象を発見 微弱なテキストで強力な挙動制御が可能に
arXiv cs.AI ・ 2026-08-17
原題: Model Hypnosis: Strong control of AI via additive subliminal effects
AI による要約
AIモデルが「モデル催眠」と呼ばれる現象に脆弱であることを実証した。一見無関係なプロンプトの微弱な組み合わせで、モデルの挙動を強力に制御できる。複数のモデルファミリーで再現され、催眠プロンプトはモデル間で転移することも確認。AI安全性と解釈性に新たな課題を提起する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。