大規模視覚言語モデルの幻覚を抑制する RVSD
arXiv cs.AI ・ 2026-09-02
原題: RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models
AI による要約
大規模視覚言語モデルの視覚幻覚を低減する手法RVSDを発表した。検索不要なトークンを選択的に疎化する「semantics-directed token selection」と、Semantic-Space Visual Retrievalを1回のデコーディングで統合。追加学習やマルチラウンドデコーディングを必要とせず、計算コストを抑えたまま幻覚を軽減する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。