LLM評価基準を有向グラフにコンパイルする「GSR」手法
arXiv cs.AI ・ 2026-08-12
原題: Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges
AI による要約
LLMを評価者として使う際に、自然言語のルーブリックを型付き評価グラフに事前コンパイルして厳密に適用する「GSR」が提案された。評価基準の分解・変換・集約をグラフ構造で行うことで、GPT-OSS-120Bにおいて評価スコアの完全一致率を最大6.75ポイント向上させた。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。