LookBack:視覚参照を用いたLVLM応答のスコアリング
arXiv cs.CL ・ 2026-08-12
原題: LookBack: Where and How to Score LVLM Responses via Visual Reference Usage
AI による要約
大規模ビジョン言語モデル(LVLM)は、視覚認識と言語生成を統合するが、画像に基づかない応答を生成することがある。LookBackは、トレーニング不要のLVLM応答スコアリング方法を提供する。トークン確率に視覚参照スコアを追加し、各応答トークンが画像に参照する強度を測定する。既存の信頼度ベースの尺度は、画像を除去してもほとんど変化しないことが示され、テキストの妥当性のみを捉えている。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。