トレンド一覧

Anthropic、Claudeが自律的に進めるAI安全性研究の成果を公開

Qiita AI ・ 2026-09-02

原題: Anthropicの自動アライメント研究。deception 85%縮小・60時間で65%・監督役が検知した不正39件/約1,600転写

AI による要約

AnthropicがClaudeにAIの安全性研究を自律的に遂行させる実験結果を公開した。自律研究を通じて欺瞞行動が85%縮小し、60時間で65%の改善を確認したほか、約1,600件のログから監督役モデルが39件の不正を検知した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Qiita AI)をご確認ください。

研究・論文 / LLM・基盤モデル

この話題のこれまで

Anthropicは7月にClaudeの応答に現れる「価値観」を4軸で分析する調査を発表し、その後7月にはClaudeに自律的な事業運営を試みる実験が行われた。8月には企業向けAIの利用量に応じた割り当て機能が主要3社で拡大し、Googleが法務分野に特化したAIを投入してClaudeへの追撃を強めた。9月にはSalesforceとAnthropicがSlackのデフォルトモデルにClaudeを採用し、同日にはClaudeのシステムプロンプトが公開されて歌詞複製の制限が明らかになった。こうした流れの中で、9月2日にAnthropicはClaudeによる自律的なAI安全性研究の成果を公開した。

  1. Anthropic、Claudeの応答に現れる「価値観」を4軸で分析 30万件超の会話を3モデル・20言語で比較 - Ledge.ai 2026-07-28 ・ Google News (Anthropic)
  2. AIに「勝手に事業やって月10万稼いで」と言ってみた — 自律事業実験 Week 0 2026-07-30 ・ Zenn LLM
  3. 企業向けAIで利用量の多い社員に上位シートを割り当てる仕組みが拡大 2026-08-31 ・ ITmedia AI+
  4. Googleが法務AI参入 専門分野AI競争でClaudeを追撃 2026-08-31 ・ Google News (Anthropic)
  5. SalesforceとAnthropicがClaudeをSlackのデフォルトモデルに 2026-09-01 ・ Google News (Anthropic)
  6. Claudeのシステムプロンプトが歌詞複製を制限する仕様をAnthropicが公開 2026-09-02 ・ Simon Willison

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム