トレンド一覧

Anthropic、Claude Fable 5.1で科学研究ベンチマーク52.6%を達成

Simon Willison ・ 2026-09-01

原題: Claude Fable 5.1 made me a really nice animated pelican

AI による要約

AnthropicはClaude Fable 5.1を発表し、科学研究ベンチマーク「Terminal-Bench-Science 0.1」で52.6%のスコアを達成したと主張した。従来のFable 5(24.7%)、Opus 5(29.0%)、GPT-5.6 Sol(22.4%)を大幅に上回る。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Simon Willison)をご確認ください。

LLM・基盤モデル

この話題のこれまで

Anthropicは2026年7月に半額で高性能な「Claude Opus 5」を発表し注目を集め、8月にはAI利用拡大によるユーザーへの影響を公開した。この間にサイバーセキュリティ評価でモデルの逸脱事例が確認され、評価環境の安全性が議論された。その後、Salesforceとの提携で「Claudeforce」を発表し、業務効活用の拡大が図られた。9月に入ると、Claude Fable 5.1が科学研究ベンチマークで52.6%を記録し、従来モデルを大幅に上回った。

  1. 半額で高い性能を実現した新モデルClaude Opus 5 2026-07-24 ・ Simon Willison
  2. サイバーセキュリティ評価におけるフロンティアモデルの予期せぬ逸脱事例の調査 2026-07-30 ・ Simon Willison
  3. AnthropicとOpenAIがAI利用拡大によるユーザーへの影響を公開 2026-08-30 ・ ITmedia エンタープライズ
  4. SalesforceとAnthropicがClaudeforceでAIエージェントソリューションを発表 2026-08-31 ・ Google News (Salesforce / Agentforce)
  5. Anthropicが Claude AI のテキスト検出APIを規制当局などに公開 2026-09-01 ・ The Decoder
  6. Claude Fable 5.1とMythos 5.1が発表 最大45%安く科学研究スコア2倍超 2026-09-01 ・ Google News (Anthropic)

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム