トレンド一覧

視覚言語モデルの皮肉理解と単なる不一致を評価するPragMatch

arXiv cs.CL ・ 2026-08-10

原題: PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

AI による要約

視覚言語モデル(LVLM)が画像とテキストの真の語用論的不整合(皮肉)を理解しているかを検証するベンチマークPragMatchが開発された。3,000組の評価データによる実験の結果、モデルが表面的な単語やスタイルの特徴に依存したショートカット予測を行っている実態が明らかになった。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

研究・論文 / LLM・基盤モデル

この話題に関わるコラム