ビデオ言語モデルにおける永続的なオブジェクトナレッジ
arXiv cs.CV ・ 2026-08-05
原題: Persistent Object Narratives for Token-Efficient Video Language Models
AI による要約
ビデオ言語モデル(Video-LLMs)がオープンエンドのビデオ理解タスクで高い性能を示すことが知られているが、視覚的なインターフェースがトークン集約的であるという問題がある。この研究では、永続的なオブジェクトナレッジを用いたビデオ言語モデルの提案を行った。結果は、提案手法が有効であることを示している。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。