言語モデルの不確実性の検証と認証
arXiv cs.AI ・ 2026-08-05
原題: Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models
AI による要約
11の言語モデル(0.5B~14Bパラメータ)を用いて、ARCE-ChallengeとTruthfulQAで2万5168件のローカル予測を分析し、言語モデルの不確実性検証手法を提案した。8つのモデルタスクペアで理論的保証に基づくリスク制御が可能なことを実証した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。