トレンド一覧

コードリファクタリング用評価基準SWE-Bench ProMax

arXiv cs.CL ・ 2026-08-10

原題: SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

AI による要約

既存のAIコーディング評価基準にあるテスト不備に対処するため、広範なコードリファクタリングを評価するベンチマーク「SWE-Bench ProMax」を公開した。PythonやJavaなど7種類のプログラミング言語から実際のコミットをもとに制作された170事例を収録し、複数ファイルに跨る変更作業の正確性を検証できる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

AIエージェント / 開発ツール

この話題のこれまで

AIベンチマークの多様化が進む中、実務に即した評価基準が次々と登場している。まず化学実験の計画・実行能力を測るonepot-Bench 0、データベースライフサイクルを網羅するDBLifeBench、LLM出力の感情プロファイリングを行うVIBEベンチマークが発表された。その後、コーディングエージェントのスキル管理を扱うGSE基盤や、企業導入を巡るGPT-5.6とClaude Fable 5の比較、知能測定に関する議論が続いた。今回のSWE-Bench ProMaxは、コードリファクタリングの実務評価に特化したベンチマークとして、既存のテスト不備に対応し、7言語170事例で複数ファイルに跨る作業を検証する枠組みを整えた。

  1. 化学実験の計画と実行能力を評価するonepot-Bench 0 2026-08-03 ・ arXiv cs.LG
  2. データベースライフサイクル全体を評価するDBLifeBench 2026-08-04 ・ arXiv cs.AI
  3. LLM出力の感情プロファイリングを行うVIBEベンチマーク 2026-08-04 ・ arXiv cs.AI
  4. コード生成AIの過学習を防ぎスキル再利用を可能にするGSE基盤 2026-08-06 ・ arXiv cs.AI
  5. GPT-5.6とClaude Fable 5の比較、企業が導入を悩む背景 2026-08-06 ・ ITmedia AI+
  6. 「賢いAI」とは?ベンチマークで知能を測る 2026-08-07 ・ Zenn LLM

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム