SciCode-Verified: ベンチマークの欠陥が科学コーディング能力を低く評価した
arXiv cs.AI ・ 2026-08-05
原題: SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models
AI による要約
SciCodeは、言語モデルの科学コーディング能力を評価するためのベンチマークです。しかし、最近の研究では、SciCodeのスコアが頭打ちになっていることが報告されています。この研究では、SciCodeの欠陥を調査し、263の欠陥を発見しました。これらの欠陥により、正しい解答が誤って拒否されることがあります。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。