言語モデル・クラシファイアーのためのブラックボックス監査
arXiv stat.ML ・ 2026-08-12
原題: When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers
AI による要約
言語モデル・クラシファイアは、説明可能なAIのための重要なコンポーネントである。ブラックボックス監査は、言語モデル・クラシファイアの信頼性を評価するための手法である。グラウンデッドネス・ドリフトは、言語モデル・クラシファイアの説明の信頼性を評価するための新たなスコアである。グラウンデッドネス・ドリフトは、既存の手法を超える性能を示す。グラウンデッドネス・ドリフトは、言語モデル・クラシファイアの信頼性を評価するための新たな基準を提供することが期待される。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv stat.ML)をご確認ください。