BabelSteering: 英語の安全性ベクトルで多言語モデルの安全性を向上
arXiv cs.CL ・ 2026-08-17
原題: BabelSteering: Multilingual Safety Alignment via English Steering Vectors
AI による要約
多言語環境で展開されるLLMの安全性向上手法「BabelSteering」を発表した。英語の安全性監督から得た拒否方向を活性化方向として用い、軽量な推論時介入で複数言語の安全性を改善。8言語で有害リクエストの拒否率を向上させつつ、タスク性能への影響を最小化した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。