LLMファミリー間におけるKVキャッシュ転送とPrefill再利用手法
arXiv cs.LG ・ 2026-08-04
原題: Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
AI による要約
同一モデルファミリーの異なるサイズ間でKVキャッシュを転送し、再計算(Prefill)を回避する手法が提案された。Qwen3の14Bから32Bへの転送実験において、モデル間のKV表現に強い線形構造が存在することを利用している。複数の送信層から最適な層を選択し、位置エンコーディング(RoPE)を除去したうえでリッジ回帰により変換・再利用する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。