トレンド一覧

ラベルなし戦略における精度と順序感度の乖離

arXiv cs.CL ・ 2026-08-12

原題: Accuracy and Order Sensitivity Diverge Under Label-Free Strategies

AI による要約

マルチプルチョイスベンチマークは、大規模言語モデルを評価するために広く使用されるが、MCQスコアは知識と選択肢順序への感度を混同させ、モデル知識の信頼性のない尺度となる。ラベルなし戦略では、モデルが選択肢のラベルを見ないようにし、回答をコミットすることで位置依存を除去し、パフォーマンスを向上させることができるか。2つの戦略を評価する。生成してマッチングするアプローチと、選択肢を分離してスコアリングするアプローチである。どちらも一貫して精度を向上させることはできなかった。完全な分解により、ボトルネックは選択肢の除去にあることが示された。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル

この話題に関わるコラム