長文推論の精度低下を防ぐKVキャッシュ圧縮手法ResKVが登場
arXiv cs.CL ・ 2026-07-31
原題: ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression
AI による要約
長文コンテキスト推論を効率化するため、除外されたトークンのアテンション寄与度を復元するKVキャッシュ圧縮手法「ResKV」が提案された。メインキャッシュとコンパクトな残差キャッシュを組み合わせることで、精度低下を抑えつつメモリを節約する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。