Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing
arXiv cs.CV ・ 2026-07-28
AI による要約
超高解像度リモートセンシング画像におけるマルチモーダル大規模言語モデル(MLLM)の視覚推論能力を向上させるための大規模データセット「GeoMTVR」が提案された。従来の単一のズームインツールを超えた、多ツールを用いた広域かつ分散した証拠の推論を可能にする。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。