トレンド一覧

国家標準文書の自動ルール審査に向けた評価指標「GB/T-Bench」

arXiv cs.CL ・ 2026-08-06

原題: Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

AI による要約

大規模言語モデルによる構造化文書の不備審査能力を評価するため、中国の国家規格文書(GB/T)を題材とした評価基盤「GB/T-Bench」が構築された。文書の構造、用語の一貫性、規範的表現などのルール違反を階層的に判定・検証できる環境を提供する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文