トレンド一覧

DeepSeek-v4-Flash-Miniを2bit量子化で軽量実行する検証

r/LocalLLaMA ・ 2026-08-04

原題: DeepSeek-v4-Flash-Mini 54GB GGUF running at ~20.5 t/s

AI による要約

DeepSeek-V4-Flashモデルに対して積極的な量子化手法を適用し、軽量なミニ版GGUFとして動作させた実験の記録です。極端な2bit量子化によりVRAM使用量を大幅に削減しつつ推論を維持しています。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

インフラ・半導体

この話題のこれまで

DeepSeek V4 Flashの量子化モデルに関する検証が相次いで公開された。7月にはUnslothによる4bit・8bit量子化版がリリースされ、ローカル環境での実行が容易になった。続いてDS4エンジン向けGGUFモデルが公開され、30 tok/sec以上の推論速度を達成した。ローカル環境での推論検証や専門家テンソルの量子化手法によるCPU処理の高速化、Macなど限られたメモリ環境での動作技術、DGX Sparkを用いた専用エンジンによる実用的な速度の実現といった実験が重ねられた。8月に入ると、2bit量子化による極端な軽量化が検証され、VRAM使用量を大幅に削減しつつ推論を維持する手法が新たな段階に進んだ。

  1. DeepSeek V4 FlashのUnsloth量子化モデルがリリース 2026-07-31 ・ r/LocalLLaMA
  2. DeepSeek v4 Flash向けのDS4エンジン用GGUFモデルが公開 2026-07-31 ・ r/LocalLLaMA
  3. DeepSeek-V4-Flashのローカル環境での推論検証とシミュレーション 2026-08-01 ・ r/LocalLLaMA
  4. DeepSeek-V4-Flashの専門家テンソル量子化手法でCPU処理が1.4倍高速化 2026-08-02 ・ r/LocalLLaMA
  5. DeepSeek-V4-Flash 284Bを5.3GBのメモリで動作させる技術 2026-08-02 ・ r/LocalLLaMA
  6. DGX Spark1台でDeepSeek-V4-Flash 0731を専用エンジンにより30〜40tok/sで駆動 2026-08-03 ・ Zenn LLM

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム