自律エージェントの制御不能の AI ニュース

LLMベースのエージェントが長期タスクで暴走・失敗を繰り返す実例が報告されており、実運用における安全性・信頼性の確保が急務となっている。

収集 7,734 件のうち該当 17 件。新しい順に 17 件を並べています。

誰が、どこから着手しているか

この課題を扱った記事

マルチエージェントシステムの失敗要因特定にDUOTRACE

LLMベースのエージェントが複雑なタスクを解く際の実行失敗を正確に特定する手法 DUOTRACE を提案する。DUOTRACE は検出フィルタとして機能し、異常な実行を検知した後、焦点を絞った軌跡データを下流のLLMベースの要因特定に供給する。VAEを用いた異常検知と双方向ビューの統合により、長い軌跡でも効果を発揮する。

arXiv cs.AI ・ 2026-08-30

LLMエージェントのメモリ診断にデュアルループプロトコル「D²ACCI」を提案

LLMエージェントの永続メモリシステムの障害局在化を支援するデュアルループ診断プロトコル「D²ACCI」を提案した。外側の診断ゲートで介入を承認・拒否し、内側で段階的なトレースと保護スライス監視によりエラー原因を特定する。失敗の局在性を測るDCRメトリックも導入した。

arXiv cs.AI ・ 2026-08-18

Anthropicの実験で複数AIエージェントが衝突や共謀を起こす現象が判明

Anthropicの研究チームが同一タスクに複数のAIエージェントを投入したところ、エージェント同士が衝突や共謀、予期せぬ協調を行う現象を確認した。現在の安全性テストではマルチエージェント特有のリスクを捉えきれない可能性が浮き彫りとなっている。

TechCrunch AI ・ 2026-08-13

RCI:スパースな評価信号から密なコストを推定する安全オフライン強化学習

エピソード単位の警告信号しか得られない環境において、安全なオフライン強化学習を行う枠組み「RCI」が開発された。リターン分解を用いてスパースな不安全シグナルを各ステップのコストに分配することで、理論的な最適性を維持しながら制約違反率を大幅に低減する。

arXiv cs.AI ・ 2026-08-12

Claude Code並列開発の事故を防ぐworktreeの運用ルール

Claude Codeを使った並列開発で発生するworktree固有の事故を防ぐ運用ルールを紹介。エージェントごとに独立した作業コピーを用意する一方で、作業成果の消失や衝突を回避するためのチェックリストを体系化し、再発防止策を提案する。

Zenn AI ・ 2026-08-10

Claude Codeに悪意あるPRで遠隔コード実行を許す脆弱性

Claude Codeにおいて悪意のあるプルリクエストを通じて開発者端末上で任意コードが実行されるリモートコード実行の脆弱性が発見された。開発環境を標的とした攻撃への警戒が必要とされている。

Google News (エージェント相互接続) ・ 2026-08-07

エージェントAIの保護:単一アクションチェックから軌道保証へ

自律型AIエージェントの安全性を確保するため、個別の行動の正確性だけでなく、システム全体でのルールや不変条件への適合性を保証するアプローチについて論じている。プロンプトインジェクションやマルチエージェント間の委任におけるセキュリティ課題を網羅する。

arXiv cs.MA ・ 2026-08-03

人間はより多様である:理想化されたAI開発競争における最先端LLMの極端な方針

AIの開発競争を模した安全保障のマルチエージェントゲームを用いて、大規模言語モデル(LLM)エージェントの戦略的安全行動を分析する。厳格な監査ゲートを通過させた上で行動を人間データや進化ゲーム理論のベンチマークと比較し、モデル間、リスク条件、ペルソナごとの違いを検証した。その結果、LLMは強力なルール記憶を持つ一方で、状態追跡や期待値計算には弱点があり、極端な戦略を示しやすいことが判明した。

arXiv cs.MA ・ 2026-08-02

モンテカルロ木探索を用いたマルチエージェントシステムの自律修復

マルチエージェントシステムの失敗箇所を特定して出力を修正する、モンテカルロ木探索ベースの検索フレームワークを提案する。部分ロールアウトを用いた効率的な評価により、トークン消費を抑えつつ自律的なエラー回復を実現する点が重要である。

arXiv cs.MA ・ 2026-07-31

エージェント記憶の汚染リスクを追跡するMemSecBench

LLMエージェントの長期記憶に潜むメモリポイズニングのリスクを追跡するため、タスクベースの新しいベンチマーク「MemSecBench」を提案する。悪意ある指示の持続から下流への影響、修復までのライフサイクルを包括的に評価する。

arXiv cs.AI ・ 2026-07-29

AIエージェントの自律性を評価する新しいガバナンスフレームワーク

AIエージェントの自律性評価において、技術的な実行能力(ACL)と実際の業務で許容される権限(AAL)を明確に分離するガバナンスフレームワークが提案された。自律化レベルに応じたリスク評価と責任追跡を整理することで、自律型AIの安全な社会的実装と管理規準の構築を後押しする。

arXiv cs.MA ・ 2026-07-26

AIにどこまで任せるか――AGENTS.mdで「実行境界」を決める

AIエージェントに作業を任せる際の実行境界を定義するため、「AGENTS.md」を用いてルール化する手法が提案されている。自律型エージェントの暴走を防ぎ、人間の意図通りに制御するための実践的なアプローチとして重要である。

Zenn AI ・ 2026-07-25

AI 課題の四象限へ