入力の乱れに対する言語モデルの脆弱性と層ごとの特性に関する詳細な分析
arXiv cs.CL ・ 2026-08-04
原題: Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling
AI による要約
言語モデルが入力の乱れ(タイプミスやOCRノイズなど)に対し、層ごとの振る舞いを3つの指標(感度・因果性・補償能力)で分析した。5つのモデルで伝播パターンを比較したところ、Phi-3.5やGemma-2-9Bは「スパイク抑制」型、Llama-3やMistral、Qwen2.5-7Bは「後期蓄積」型を示し、Qwen2.5ファミリーでは規模拡大に伴い後期蓄積型が強まることが確認された。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。