多言語説得的ジェイルブレイク攻撃に対するLLMの安全性評価
arXiv cs.CL ・ 2026-09-03
原題: IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks
AI による要約
インドの低リソース言語における大規模言語モデルの安全性を評価するため、ペルソナや説得戦略を組み合わせたベンチマーク「IndicSafeEval」を構築した。4つのインド言語と10の安全性カテゴリにわたる7,200件の敵対的プロンプトを用いた評価から、モデルの安全性は言語やプロンプトのスタイルによって大きく変動することが示された。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。