Qwen3.6-35B-A3B Q6のMoEエキスパート層の最適化
r/LocalLLaMA ・ 2026-08-06
原題: Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)
AI による要約
RTX 3090の環境において、Qwen3.6-35B-A3B Q6のMoEエキスパート層のCPUオフロード設定を調整することでVRAMを確保し、処理速度を大幅に向上させる検証結果が報告されました。生成速度を維持したままプロンプト処理性能の大幅な改善に成功しています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。