視覚言語モデルの検索性能を高める単一トークン手法ReToken
arXiv cs.AI ・ 2026-07-30
原題: ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
AI による要約
ReTokenは、事前入力された視覚KVキャッシュからクエリに関連する視覚トークンを効率的に選択する単一の学習可能な埋め込み手法である。小規模なデータセットでの学習のみで、画像や動画のベンチマークにおいてQwen3VL-8Bなどの既存モデルの性能を大幅に向上させることができるため、計算効率の面で重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。