[PAPER] GPQA, MMLU-Pro, and MMMU-Pro were audited for broken questions, and up to 12% of them had to be removed. New drop in clean versions released
r/LocalLLaMA ・ 2026-07-28
AI による要約
GPQAやMMLU-Proなどの主要AIベンチマークを検証した結果、最大12%の問題に誤りや不備があることが判明し、クリーン版のデータセットと論文が公開された。モデル評価の飽和(天井効果)の原因を明かし、AI性能測定の信頼性を高める上で非常に重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。