Qwen3.6-35B-A3B Q6のMoEエキスパート層の最適化
r/LocalLLaMA ・ 2026-08-06
原題: Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)
AI による要約
Qwen3.6-35B-A3B Q6のMoEモデルで、8層のエキスパート層をCPUにオフロードすることでVRAMを確保し、バッチサイズを512→1024に拡大。プロンプト処理速度が2.36倍向上したが、生成速度は変化なし。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。