エージェント型視覚推論の適切な実行タイミングと手法を学ぶ「Beacon」
arXiv cs.CV ・ 2026-07-30
原題: Beacon: Knowing When and How to Perform Agentic Visual Reasoning
AI による要約
マルチモーダル大規模言語モデル(MLLM)が複雑な視覚推論を行う際、ツールをいつ、どのように使うべきかを自律的に判断する「Beacon」を提案した研究。不要な計算コストを抑えつつ、必要な場面でのみツールを活用して性能を最大化するアプローチを示す。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。