トレンド一覧

SciCode-Verified: ベンチマークの欠陥が科学コーディング能力を低く評価した

arXiv cs.AI ・ 2026-08-05

原題: SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

AI による要約

科学コーディング能力ベンチマーク「SciCode」の65問を専門家が検証し、263の欠陥を発見した。このうち192の欠陥が正解のコードを誤って不合格にしていた。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル

この話題に関わるコラム