視覚推論で画像非依存のテキスト足場活用を提唱するTextCall
arXiv cs.CV ・ 2026-08-10
原題: Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning
AI による要約
ツール拡張型視覚言語モデルにおいて、切り出し画像そのものではなくツール呼び出し時のテキスト情報が推論向上に寄与していることが判明した。戻り値の画像をスキップする手法「TextCall」により、画像データを処理に含めずとも従来のツール利用と同等以上の性能を達成した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。