マルチモーダルLLMの推論コストを削減するフレームワークを提案
arXiv cs.CL ・ 2026-08-03
原題: ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs
AI による要約
マルチモーダルLLMにおける推論コストを削減しつつOCRなどのタスクでの情報欠落を防ぐため、質問に応じた証拠配分を行うフレームワーク「ET-Prune」を提案した。テキスト領域や重要度の高い空間情報を保護しながら、動的な予算配分によってビジュアルトークンを効率的にプルーニングする。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。