LLM評価の順位は生成トークン予算で逆転することが判明
arXiv cs.AI ・ 2026-08-12
原題: Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
AI による要約
LLMの推論ベンチマークにおいて生成トークン予算を64〜4,096に変動させて検証したところ、予算に応じてモデル間の性能順位が逆転することが判明した。さらに予算を増やすと精度が下がる非単調な挙動が3〜19%の項目で観測され、モデルやタスクに応じた予算配分ルーターの有効性が示された。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。