The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding
arXiv cs.AI ・ 2026-07-27
AI による要約
密なフレームで事前学習されたマルチモーダルLLMが、モデレーションなどの現場で使われるスパースなフレーム入力で大幅に性能低下する問題を分析した研究が発表されました。視覚特徴抽出がボトルネックであることを突き止め、少フレーム環境での時空間動画グラウンディングの精度低下を防ぐ調整手法を提示しています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。