トレンド一覧

DeepSeek-V4-Flashの専門家テンソル量子化手法でCPU処理が1.4倍高速化

r/LocalLLaMA ・ 2026-08-02

原題: Expert-only IQ3 requant of DeepSeek-V4-Flash-0731: better KLD than UD-IQ3_S, 1.4x decode on a CPU-spill rig

AI による要約

有志がDeepSeek-V4-FlashのRouted ExpertテンソルのみをIQ3精度に再量子化する手法を公開した。VRAMからCPUへ溢れる実行環境においてデコード速度が1.4倍に向上し、既存の手法より低い損失率を達成した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

LLM・基盤モデル / 開発ツール