Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects
arXiv cs.CL ・ 2026-07-27
AI による要約
大規模言語モデルの解釈性ツールであるスパースオートエンコーダー(SAE)のモデル挙動への因果的影響を分析した研究。特徴量介入時のロジット変化の幾何学を調べることで、単一方向的な効果を持つ特徴量が稀であることを示した。モデル内部の動作メカニズムをより深く理解するために重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。