トレンド一覧

大規模視覚言語モデルの幻覚を抑制する RVSD

arXiv cs.AI ・ 2026-09-02

原題: RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models

AI による要約

大規模視覚言語モデルの視覚幻覚を低減する手法RVSDを発表した。検索不要なトークンを選択的に疎化する「semantics-directed token selection」と、Semantic-Space Visual Retrievalを1回のデコーディングで統合。追加学習やマルチラウンドデコーディングを必要とせず、計算コストを抑えたまま幻覚を軽減する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

この話題に関わるコラム