コードリファクタリング用評価基準SWE-Bench ProMax
arXiv cs.CL ・ 2026-08-10
原題: SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
AI による要約
既存のAIコーディング評価基準にあるテスト不備に対処するため、広範なコードリファクタリングを評価するベンチマーク「SWE-Bench ProMax」を公開した。PythonやJavaなど7種類のプログラミング言語から実際のコミットをもとに制作された170事例を収録し、複数ファイルに跨る変更作業の正確性を検証できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。