オープンモデルの内部活性化からコード脆弱性を探知する手法
arXiv cs.LG ・ 2026-08-10
原題: Activation Probes Surface Code-Security Signals that the Model's Output Misses
AI による要約
AIエージェントが生成したコードの安全性を検証するため、オープンウェイトモデルの内部活性化(アクティベーション)を線形プローブで解析する手法が提案された。モデルがテキスト出力で取りこぼすセキュリティ信号を直接抽出し、61〜67%のケースで脆弱性を見抜くことに成功した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。