トレンド一覧

エージェント型視覚推論の適切な実行タイミングと手法を学ぶ「Beacon」

arXiv cs.CV ・ 2026-07-30

原題: Beacon: Knowing When and How to Perform Agentic Visual Reasoning

AI による要約

マルチモーダル大規模言語モデル(MLLM)が複雑な視覚推論を行う際、ツールをいつ、どのように使うべきかを自律的に判断する「Beacon」を提案した研究。不要な計算コストを抑えつつ、必要な場面でのみツールを活用して性能を最大化するアプローチを示す。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

研究・論文