視覚言語モデルの皮肉理解と単なる不一致を評価するPragMatch
arXiv cs.CL ・ 2026-08-10
原題: PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models
AI による要約
視覚言語モデル(LVLM)が画像とテキストの真の語用論的不整合(皮肉)を理解しているかを検証するベンチマークPragMatchが開発された。3,000組の評価データによる実験の結果、モデルが表面的な単語やスタイルの特徴に依存したショートカット予測を行っている実態が明らかになった。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。