タスク分解は自動NLG評価を改善しない:LLM-as-a-judgeの検証
arXiv cs.CL ・ 2026-09-01
原題: Does task decomposition improve automatic NLG evaluation?
AI による要約
LLM-as-a-judge(LLMaJ)のタスク分解が自動NLG評価に与える影響を検証した。分解手法は人間ラベルを用いない限り性能向上を示さず、分解自体の効果はないと結論付けた。人間ラベルを用いる場合、分解なしでも人間評価に匹敵する性能を達成できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。