DeepSeek-V4-Flashの専門家テンソル量子化手法でCPU処理が1.4倍高速化
r/LocalLLaMA ・ 2026-08-02
原題: Expert-only IQ3 requant of DeepSeek-V4-Flash-0731: better KLD than UD-IQ3_S, 1.4x decode on a CPU-spill rig
AI による要約
有志がDeepSeek-V4-FlashのRouted ExpertテンソルのみをIQ3精度に再量子化する手法を公開した。VRAMからCPUへ溢れる実行環境においてデコード速度が1.4倍に向上し、既存の手法より低い損失率を達成した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。