コンテンツモデレーションにおけるLLM挙動の基準別評価
arXiv cs.CL ・ 2026-09-03
原題: Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation
AI による要約
標準的なコンテンツモデレーションベンチマークで高い性能を示す大規模言語モデルが、複数の基準を分離して各基準を信頼性をもって適用できるかを検証するため、基準非依存の因数分解評価手法「Diagnostic Evaluation of COntent(DECO)」が導入された。4つのモデレーションデータセットと4つのLLMを用いた評価の結果、ベンチマークでの高い性能が基準レベルでの重大な失敗を隠蔽している場合があることが判明した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。