トレンド一覧

3Dシーングラフを用いたマルチモーダルLLMの空間推論フレームワークGraFT

arXiv cs.CV ・ 2026-09-03

原題: GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

AI による要約

マルチモーダルLLMの3D空間推論能力を向上させるため、トレーニング不要のフレームワーク「GraFT」を提案している。コンパクトな3Dシーングラフを介して、記号ツールによる決定論的幾何学、鳥瞰図レンダリングによるアロセントリックなレイアウト、視覚的属性の接地という3つの空間推論機能を提供する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

研究・論文

この話題に関わるコラム