トレンド一覧

BabelSteering: 英語の安全性ベクトルで多言語モデルの安全性を向上

arXiv cs.CL ・ 2026-08-17

原題: BabelSteering: Multilingual Safety Alignment via English Steering Vectors

AI による要約

多言語環境で展開されるLLMの安全性向上手法「BabelSteering」を発表した。英語の安全性監督から得た拒否方向を活性化方向として用い、軽量な推論時介入で複数言語の安全性を改善。8言語で有害リクエストの拒否率を向上させつつ、タスク性能への影響を最小化した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

研究・論文

この話題に関わるコラム