トレンド一覧

KVキャッシュ量子化ベンチマーク:Qwen 3.6 27BとGemma 4 31Bで413通りを検証

r/LocalLLaMA ・ 2026-08-06

原題: KV cache quantization benchmarks: 413 pairs tested on Qwen 3.6 27B, Gemma 4 31B. KLD with BeeLlama.cpp v0.4.0: KVarN 6-bit beats q8_0, precision tail 1024 dominates

AI による要約

Qwen 3.6 27BとGemma 4 31Bを対象に、KVキャッシュ量子化の413通りのベンチマークを実施した。BeeLlama.cpp v0.4.0を用い、KVarN 6-bitがq8_0を上回る精度を示した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

この話題のこれまで

3〜3.5ビットのKVキャッシュ圧縮手法「TurboQuant」の技術的検証が行われた後、LLMベンチマークの実用性と実務成果の乖離が指摘され、ベンチマークSciCodeにおけるGemma 4とQwen3.6 27bの評価結果を巡る議論に至った。その後、Qwen 3.6 27BとGemma 4 31Bを対象としたKVキャッシュ量子化の413通りのベンチマークが実施され、BeeLlama.cpp v0.4.0を用いた検証でKVarN 6-bitがq8_0を上回る精度を示した。

  1. 3ビットKVキャッシュは無損失か、TurboQuantを読む 2026-07-27 ・ Zenn AI
  2. LLMベンチマークの実用性への課題 2026-07-31 ・ r/LocalLLaMA
  3. ベンチマークSciCodeにおけるGemma 4とQwen3.6 27bの評価を巡る議論 2026-08-06 ・ r/LocalLLaMA

当サイトが集めた記事から、同じ話題のものを古い順に並べています。