トレンド一覧

視覚推論で画像非依存のテキスト足場活用を提唱するTextCall

arXiv cs.CV ・ 2026-08-10

原題: Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

AI による要約

ツール拡張型視覚言語モデルにおいて、切り出し画像そのものではなくツール呼び出し時のテキスト情報が推論向上に寄与していることが判明した。戻り値の画像をスキップする手法「TextCall」により、画像データを処理に含めずとも従来のツール利用と同等以上の性能を達成した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題のこれまで

視覚言語モデルの性能向上に向け、まず Beacon が MLLM におけるツール活用の最適なタイミングと手法を提案した。続いて HAFI-VLM が VLM の知覚能力向上のためスペクトル応答の硬直性を解決し、周波数経路導入でマルチスケールな視覚証拠獲得を実現した。次に SABRE が VLM の限界評価を自動化するベンチマーク構築機構を示し、モデルの視覚情報への依存度を精密に測定した。その後、TextCall がツール拡張型 VLM において画像そのものではなくテキスト情報が推論向上に寄与することを明らかにし、画像データを排除した手法で従来と同等以上の性能を達成した。

  1. エージェント型視覚推論の適切な実行タイミングと手法を学ぶ「Beacon」 2026-07-30 ・ arXiv cs.CV
  2. 周波数特性から視覚言語モデルの知覚能力を高めるHAFI-VLM 2026-08-03 ・ arXiv cs.CL
  3. SABRE: 視覚言語モデルの限界を評価する自動ベンチマーク構築機構 2026-08-07 ・ arXiv cs.AI

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム