マルチモーダルLLMの空間推論のためのトレーニング不要フレームワーク
arXiv cs.CL ・ 2026-08-05
原題: Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs
AI による要約
マルチモーダル大規模言語モデル(MLLM)の空間推論における推論の不整合やエラーの伝播を防ぐためのトレーニング不要のフレームワークです。空間証拠グラフ(SEG)を構築し、視覚エンティティと推論ステップを関連付けることで空間推論の正確性を向上させます。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。