トレンド一覧

文書画像質問応答のための訓練不要な適応型ページ検索手法「ViSAR」

arXiv cs.AI ・ 2026-09-02

原題: ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question Answering

AI による要約

文書画像質問応答(DocVQA)におけるRAGのレイテンシー削減と精度向上のため、訓練不要の適応型ページ検索手法「ViSAR」を提案した。埋め込み空間上でクエリに応じたページレベルの類似度行列を直接構築し、取得するページ数を動的に決定する。複数のエンコーダーおよび大規模視覚言語モデルにおいて、コンパクトかつクエリに適したページセットの取得を実現した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム