トレンド一覧

周波数特性から視覚言語モデルの知覚能力を高めるHAFI-VLM

arXiv cs.CL ・ 2026-08-03

原題: HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

AI による要約

視覚言語モデル(VLM)が細粒度の視覚的証拠を必要とする予測で信頼性に欠ける原因を、事前学習済みビジョンエンコーダーの「スペクトル応答の硬直性」に見出した研究。タスク条件付き周波数経路を導入する HAFI-VLM を提案し、階層的適応周波数注入(HAFI)によってマルチスケールな視覚証拠を取得する。VLMの視覚的知覚能力を高める上で重要な成果である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文