BLOOM-WILT: LLM監査の行動抽出を最適化する手法を発表
arXiv cs.AI ・ 2026-08-31
原題: BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing
AI による要約
LLMの展開時行動を自動監査する BLOOM-WILT を提案した。入力側で対話戦略を学習し、出力側で次トークン分布を適応的に再重み付けして、まれな行動を自然なマルチターンで抽出する。学習コストや内部アクセス不要で動作する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。