トレンド一覧

DeepSeek-V4-Flash-0731の推論速度をRTX 3090で10→15tok/sに最適化

r/LocalLLaMA ・ 2026-08-06

原題: Final optimization: from ~10 tok/s to ~15 tok/s on DeepSeek-V4-Flash-0731 at 128K ctx - 1 RTX 3090

AI による要約

DeepSeek-V4-Flash-0731をRTX 3090で動作させる際の推論速度を、128Kコンテキストで10tok/sから15tok/sに向上させた。GPU/CPUのメモリ配分やKVキャッシュの量子化など、複数のパラメータを最適化した結果だ。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

LLM・基盤モデル

この話題のこれまで

超長コンテキストLLMの推論効率改善に向け、KVキャッシュのコスト削減手法が相次いで提案された。まず7月に「Windowed-MTP」が100万トークン超の長文でKVキャッシュの課題を解決する手法を発表し、続いて「RMM」が限定メモリ下での破棄判断を推定問題として再定義した。その後「InferScale」がパーソナライズLLMサービング向けに再利用可能なKV状態でTTFT短縮を実現し、KVキャッシュの挙動と精度制御の関係も検証された。8月にはそれら技術を活用したDeepSeek-V4-Flash-0731のRTX 3090における推論速度が、128Kコンテキストで10tok/sから15tok/sに向上した。

  1. 超長コンテキスト推論のKVキャッシュコストを削減する効率化手法「Windowed-MTP」 2026-07-23 ・ arXiv cs.CL
  2. LLMのKVキャッシュ破棄を推定問題として捉え直す新手法RMM 2026-07-27 ・ arXiv cs.AI
  3. パーソナライズLLMサービング向けGPUネイティブKVインジェクション 2026-07-29 ・ arXiv cs.LG
  4. KVキャッシュの挙動とプレフィックス精度制御がデコード結果に与える影響 2026-07-30 ・ arXiv cs.CL

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム