トレンド一覧

Qwen 3.5 35B A3B-Q8_0をRadeon 7600で18トークン/秒で実行

r/LocalLLaMA ・ 2026-08-10

原題: Running Qwen 3.5 35B A3B-Q8_0 gguf on a cheap radeon 7600 at 18 token/s

AI による要約

Qwen 3.5 35B A3B-Q8_0をRadeon 7600で実行し、18トークン/秒の処理速度を達成した。Ryzen 5600と64GB DDR4環境で、llama.cppを用いた設定で動作を確認した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

インフラ・半導体 / LLM・基盤モデル

この話題のこれまで

2026年8月初旬、ローカルLLMの推論効率向上に向けた議論が活発化し、llama.cppを中心とした改良が進められた。8月2日には複数GPU構成のスケーリング性能とボトルネックが議論され、8月4日にはllama.cppのプルリクエストでCPUからGPUへのサンプリング処理移行により最大8%の速度向上が実現された。8月5日にはQwen3-TTSの音声クローン機能がllama.cppに正式対応し、8日にはEcho Dot 2上で2800万パラメータのLLMがローカル実行されるなど、ハードウェア制約下でも実用的な推論が可能になった。その後、8月10日にはQwen 3.5 35B A3B-Q8_0がRadeon 7600上で18トークン/秒の処理速度を達成する実績が示された。

  1. LLM推論における複数GPU構成のスケーリング性能と性能ボトルネック 2026-08-02 ・ r/LocalLLaMA
  2. Llama.cppのプルリクエストにより推論速度が8%向上 2026-08-04 ・ r/LocalLLaMA
  3. llama.cppがQwen3-TTSの音声クローン機能を正式サポート 2026-08-05 ・ r/LocalLLaMA
  4. Kokoro 82M活用のローカルPDF音声化アプリ 2026-08-05 ・ r/LocalLLaMA
  5. Echo Dot 2で2800万パラメータLLMをローカル実行 7トークン/秒で動作 2026-08-07 ・ r/LocalLLaMA
  6. llama.cppでQwen 3.6 27Bを動かす設定とRTX 5090での挙動検証 2026-08-07 ・ r/LocalLLaMA

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム