ビデオ言語モデルにおける永続的なオブジェクトナレッジ
arXiv cs.CV ・ 2026-08-05
原題: Persistent Object Narratives for Token-Efficient Video Language Models
AI による要約
ビデオ言語モデル向けに SlotNarrative を提案し、ビデオ内のオブジェクトを永続的なスロットと状態トークンで表現。フレーム間の対応付けを先に行うことで、再発するオブジェクトの構造化されたナラティブを構築し、トークン効率を改善した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。