トレンド一覧

ternary GGUF向けのより高密度なベース3パッキングフォーマット「B3S」

r/LocalLLaMA ・ 2026-09-04

原題: ~22% less weight VRAM, lossless: base-3 packing for ternary GGUFs

AI による要約

-1, 0, +1の重みを持つ三値モデル専用の新しいGGUF量子化フォーマット「Q2_B3(B3S)」が開発された。ブロックあたり128の重みをベース3で直接パッキングし、通常のQ2表現と比較してVRAMの重みサイズを約22%削減しつつロスレスを実現する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

LLM・基盤モデル / 開発ツール

この話題のこれまで

Unslothは軽量LLM「Kimi K3」の新しい量子化モデルをリリースした。Qwen3.6 27Bを用いてGGUFやNVFP4、AWQ、FP8など16種類の量子化フォーマットによるKLダイバージェンスを比較した。DeepSeek-V4-Pro-0813のGGUF量子化モデルが公開され、Gemma 4 12Bでテンソル単位の量子化配分によりコーディング性能が向上した。GGUF量子化で日本語は英語より壊れやすいのか実測した結果、自動指標では日本語が英語より不利になる証拠は見つからなかった。GGUFの語彙を再学習なしで47%削減しローカルLLMの負荷軽減に成功した。GGUF向けのより高密度なベース3パッキングフォーマット「B3S」が開発された。

  1. Unsloth、軽量LLM「Kimi K3」の新しい量子化モデルをリリース 2026-08-07 ・ r/LocalLLaMA
  2. Qwen3.6 27BのGGUF量子化とNVFP4やFP8の性能比較検証 2026-08-10 ・ r/LocalLLaMA
  3. DeepSeek-V4-Pro-0813のGGUF量子化モデルが公開 2026-08-13 ・ r/LocalLLaMA
  4. Gemma 4 12Bでテンソル単位の量子化配分によりコーディング性能が8.55%向上 2026-08-13 ・ r/LocalLLaMA
  5. GGUF量子化で日本語は英語より壊れやすいのか実測した 2026-08-14 ・ Zenn LLM
  6. GGUFの語彙を再学習なしで47%削減しローカルLLMの負荷軽減に成功 2026-09-01 ・ Zenn LLM

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム