トレンド一覧

長尺動画MLLMにおける視覚トークン配分の制御検証

arXiv cs.CL ・ 2026-09-03

原題: Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs

AI による要約

長時間の動画を処理するマルチモーダル言語モデルにおいて、フレーム選択、空間圧縮、および節約されたトークンの再投資が性能に与える影響についての検証が行われた。LongVideoBenchの1時間のビンを用いた実験において、クエリによって選択された8つのフレームが、均等に配置された16のフレームを6.9ポイント上回る性能を記録した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム