トレンド一覧

[PAPER] GPQA, MMLU-Pro, and MMMU-Pro were audited for broken questions, and up to 12% of them had to be removed. New drop in clean versions released

r/LocalLLaMA ・ 2026-07-28

AI による要約

GPQAやMMLU-Proなどの主要AIベンチマークを検証した結果、最大12%の問題に誤りや不備があることが判明し、クリーン版のデータセットと論文が公開された。モデル評価の飽和(天井効果)の原因を明かし、AI性能測定の信頼性を高める上で非常に重要である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

研究・論文 / LLM・基盤モデル