トレンド一覧

ToolHazard:LLMベースのエージェントのセキュリティ評価と整合性のためのアドバーサリアル環境のスケーリング

arXiv cs.CL ・ 2026-08-12

原題: ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

AI による要約

大規模言語モデルエージェントは、外部ツールと統合されているが、環境状態に埋め込まれた間接的なプロンプトインジェクションに脆弱である。ToolHazardは、人間工学と計算を必要とするアドバーサリアル環境のシンセシスフレームワークを提供する。環境シミュレータ、攻撃エージェント、ユーザーシミュレータを備え、実行可能な状態ベースの環境をシンセシスし、有効なインジェクションポイントとペイロードを生成し、状態ベースの長時間タスクを構築する。ToolHazardを使用して、ToolHazard-Benchを構築し、エージェントをストレステストする。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル

この話題に関わるコラム