DeepSeek-V4-Flash-0731の推論速度をRTX 3090で10→15tok/sに最適化
r/LocalLLaMA ・ 2026-08-06
原題: Final optimization: from ~10 tok/s to ~15 tok/s on DeepSeek-V4-Flash-0731 at 128K ctx - 1 RTX 3090
AI による要約
DeepSeek-V4-Flash-0731をRTX 3090で動作させる際の推論速度を、128Kコンテキストで10tok/sから15tok/sに向上させた。GPU/CPUのメモリ配分やKVキャッシュの量子化など、複数のパラメータを最適化した結果だ。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。