SAEVerbalizer: 疎自己符号化器の特徴量を自然言語で説明する手法
arXiv cs.CL ・ 2026-08-13
原題: SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
AI による要約
疎自己符号化器(SAE)が抽出した特徴量に対し、外部の振る舞い観察に頼らず自然言語による説明を直接生成するSAEVerbalizerを提案した。SAEのデコーダ方向をLLMの内部表現に注入し、下流層を微調整して特徴量を言語化させている。未知の特徴量や異なるSAE辞書間にも汎化し、軽量アダプタを用いることで柔軟な適用が可能だ。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。