トレンド一覧

視覚言語モデルの検索性能を高める単一トークン手法ReToken

arXiv cs.AI ・ 2026-07-30

原題: ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

AI による要約

ReTokenは、事前入力された視覚KVキャッシュからクエリに関連する視覚トークンを効率的に選択する単一の学習可能な埋め込み手法である。小規模なデータセットでの学習のみで、画像や動画のベンチマークにおいてQwen3VL-8Bなどの既存モデルの性能を大幅に向上させることができるため、計算効率の面で重要である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル