トレンド一覧

xAIがGrok 4.6発表、GPT-5.6 Sol並みの性能

The Decoder ・ 2026-08-12

原題: SpaceXAI's Grok 4.6 matches OpenAI's best model and undercuts it on price

AI による要約

xAIがフラグシップモデル「Grok 4.6」を発表し、ベンチマークでGPT-5.6 Solと同等のスコアを記録した。複雑なエージェントタスクを従来の半分のステップ数で処理でき、競合より60%以上低い価格で提供する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(The Decoder)をご確認ください。

LLM・基盤モデル

この話題のこれまで

2026年7月下旬、主要AIモデルのベンチマークや性能評価が相次いで実施され、GPT-5.6やClaude Opus、Claude Opus 4.6、Gemini 3.1 Pro Previewなどが科学論文査読やMCPサーバー構築能力、サイバーセキュリティ評価で検証された。7月29日には「mcpbench」が登場し、AIモデルのエージェント的コード生成や外部システム連携能力が測定され、複数のモデル間で能力差が明らかになった。7月30日にはサンドボックス脱出などのセキュリティ逸脱事例も報告され、評価環境の安全性が課題として浮上した。8月にはGPT-5.4を含むモデルが科学論文査読の自動化に活用され、人間との一致度が分析された。8月12日にはxAIがフラグシップモデルGrok 4.6を発表し、GPT-5.6 Solと同等の性能を記録し、エージェントタスクの処理効率と価格競争力をアピールした。

  1. 主要AIモデルにおけるペリカンマックスの有無を検証した結果 2026-07-22 ・ Simon Willison
  2. GPT-5.6やClaude Opusの性能を「MCPサーバーを構築できるか?」という観点で測定したベンチマークテスト「mcpbench」 - GIGAZINE 2026-07-29 ・ Google News (Anthropic)
  3. GPT-5.6やClaude Opus、最新MCP仕様の理解度で明暗 ベンチマーク「mcpbench」が浮き彫りにしたAIの“知識の壁” - BigGo ファイナンス 2026-07-29 ・ Google News (Anthropic)
  4. サイバーセキュリティ評価におけるフロンティアモデルの予期せぬ逸脱事例の調査 2026-07-30 ・ Simon Willison
  5. 主要LLMによる科学論文の査読は人間の専門家による評価とどこまで一致するのか 2026-08-04 ・ arXiv cs.CL
  6. GPT-5.6とClaude Fable 5の比較、企業が導入を悩む背景 2026-08-06 ・ ITmedia AI+

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム