トレンド一覧

Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context

arXiv cs.CL ・ 2026-07-23

AI による要約

100万トークンを超える長文コンテキストにおいて、推測デコーディングのドラフトヘッドが抱えるKVキャッシュのコスト増大問題を解決する手法「Windowed-MTP」が提案された。超長コンテキストLLMの推論効率を改善する上で極めて重要である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文