ブラックボックスLLM審判の共有エンドポイントにおける再現性の検証
arXiv cs.AI ・ 2026-09-03
原題: Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
AI による要約
言語モデルによる評価の信頼性を検証し、同一リクエストの繰り返しランキングや翌日の同一入力による再生で合意率が著しく低下することを明らかにした。ラベルと意味の対応関係の偏りや、同一入力で異なるランキングを返すノイズが原因として挙げられている。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。