長尺動画MLLMにおける視覚トークン配分の制御検証
arXiv cs.CL ・ 2026-09-03
原題: Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs
AI による要約
長時間の動画を処理するマルチモーダル言語モデルにおいて、フレーム選択、空間圧縮、および節約されたトークンの再投資が性能に与える影響についての検証が行われた。LongVideoBenchの1時間のビンを用いた実験において、クエリによって選択された8つのフレームが、均等に配置された16のフレームを6.9ポイント上回る性能を記録した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。