トレンド一覧

DeepSeek-V4-Flash-0731の推論速度をRTX 3090で10→15tok/sに最適化

r/LocalLLaMA ・ 2026-08-06

原題: Final optimization: from ~10 tok/s to ~15 tok/s on DeepSeek-V4-Flash-0731 at 128K ctx - 1 RTX 3090

AI による要約

DeepSeek-V4-Flash-0731をRTX 3090で動作させる際の推論速度を、128Kコンテキストで10tok/sから15tok/sに向上させた。GPU/CPUのメモリ配分やKVキャッシュの量子化など、複数のパラメータを最適化した結果だ。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

LLM・基盤モデル