トレンド一覧

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

arXiv cs.CV ・ 2026-08-04

AI による要約

テキスト記述と3D視覚入力から対象を特定するゼロショット3Dビジュアルグランドリングにおいて、曖昧なクエリと不十分な視点を解決するTDVRフレームワークを提案している。3DシーングラフとLLMを組み合わせることで、訓練不要で高精度な視点推論とオブジェクトローカライゼーションを実現する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

研究・論文