トレンド一覧

LLM評価の順位は生成トークン予算で逆転することが判明

arXiv cs.AI ・ 2026-08-12

原題: Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

AI による要約

LLMの推論ベンチマークにおいて生成トークン予算を64〜4,096に変動させて検証したところ、予算に応じてモデル間の性能順位が逆転することが判明した。さらに予算を増やすと精度が下がる非単調な挙動が3〜19%の項目で観測され、モデルやタスクに応じた予算配分ルーターの有効性が示された。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム