入力の乱れに対する言語モデルの脆弱性と層ごとの特性に関する詳細な分析
arXiv cs.CL ・ 2026-08-04
原題: Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling
AI による要約
入力の微小な乱れに対する言語モデルの脆弱性について、表現の乖離(感度)、活性の復元(因果関係)、アダプターによる修復(代償容量)という3つの観点から層ごとの特性を分析した。モデルのスケール拡大に伴う伝播レジームの変化を明らかにした点で重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。