Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context
arXiv cs.CL ・ 2026-07-23
AI による要約
100万トークンを超える長文コンテキストにおいて、推測デコーディングのドラフトヘッドが抱えるKVキャッシュのコスト増大問題を解決する手法「Windowed-MTP」が提案された。超長コンテキストLLMの推論効率を改善する上で極めて重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。