トレンド一覧

追加学習不要でKVキャッシュを最大32倍圧縮するVestigeKV

arXiv cs.CL ・ 2026-09-03

原題: VestigeKV: The NoPE-MLA KV Cache Carries Its Own Eviction Signal in a Vestigial Branch

AI による要約

NoPE MLAアーキテクチャのKVキャッシュ内に残る64次元の痕跡ブランチを重要度シグナルとして利用する圧縮手法「VestigeKV」が提案された。各行の11%のみを参照してキャッシュを通常層とGPU常駐アーカイブ層へ動的に振り分け、追加学習やカーネル変更なしに機能する。8kから65kトークンの文脈長において8倍圧縮で1.00、32倍圧縮でも0.92の検索精度を維持した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

インフラ・半導体 / LLM・基盤モデル

この話題に関わるコラム