トレンド一覧

Qwen3.6-35B-A3B Q6のMoEエキスパート層の最適化

r/LocalLLaMA ・ 2026-08-06

原題: Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

AI による要約

RTX 3090の環境において、Qwen3.6-35B-A3B Q6のMoEエキスパート層のCPUオフロード設定を調整することでVRAMを確保し、処理速度を大幅に向上させる検証結果が報告されました。生成速度を維持したままプロンプト処理性能の大幅な改善に成功しています。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

LLM・基盤モデル / インフラ・半導体

この話題のこれまで

Qwenシリーズのモデルが次々と発表され、ローカル環境やコスト削減を軸に利用が広がった。まず120B以下のQwenが高い評価を得ており、続いて27Bサイズの新型Qwen3.8-27Bが登場した。その後も多様なパラメータサイズのモデルが公開予定と示唆され、ローカルLLM利用者の選択肢が拡大した。さらにQwen3-Next 80BとClaude Opus 4.6のハイブリッド運用でコスト削減が実現され、Qwen3.8-Maxの発表により価格競争が加速した。AlibabaのQwenアップデートはAI半導体の調達と適応力を示し、最新のQwen3.6-35B-A3B Q6ではMoEエキスパート層の最適化がVRAMと処理速度の向上につながる検証結果が報告された。

  1. 120B以下のモデルでQwenを超えるオープンウェイトAIは本当にないのか 2026-07-29 ・ r/LocalLLaMA
  2. ローカル環境で期待を集める新型Qwen3.8-27B 2026-08-03 ・ r/LocalLLaMA
  3. Qwenモデルの新たなパラメータサイズ版が近く登場へ 2026-08-04 ・ r/LocalLLaMA
  4. Qwen3-Next 80B × Claude Opus 4.6 ハイブリッド運用で月$480削減した話 2026-08-04 ・ Zenn LLM
  5. Alibabaが最新のQwen3.8-Maxを発表、100万トークンあたり2ドルの低価格 2026-08-05 ・ Google News (中国AI企業)
  6. AlibabaのQwenアップデートが示すAI半導体の調達と適応力 2026-08-05 ・ Google News (中国AI企業)

当サイトが集めた記事から、同じ話題のものを古い順に並べています。