トレンド一覧

Deepseek V4やGemma4に対応したTensorSharpのMoE CPUオフロード機能のベンチマーク

r/LocalLLaMA ・ 2026-08-05

原題: MoE CPU-offload benchmark on Deepseek V4/Gemma4/Qwen/GPT-OSS — TensorSharp vs llama.cpp

AI による要約

TensorSharpにマージされたMoE CPUオフロード機能により、限られたVRAM環境でも大規模なMixture-of-Expertsモデルを効率的に動作させることが可能になった。llama.cppとのパフォーマンス比較を通じて、ローカル推論の最適化手法を示している。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

インフラ・半導体 / LLM・基盤モデル

この話題のこれまで

Gemma 4 12BのCore ML化により、Apple Silicon Mac上で128Kコンテキストの推論が可能になった。その後、DeepSeek-V4-Flash-0731など大規模MoEモデルのローカル実行に向け、VRAM要件やハードウェア構成の議論が進んだ。llama.cppのカスタマイズやメインメモリ活用、SSDストリーミング技術により、限られたリソースでも実行できる手法が広がった。中古ハードウェアでの検証も行われ、安価な環境での大規模モデル動作が現実的となった。この流れの最新段階として、TensorSharpにMoE CPUオフロード機能がマージされ、VRAM制約下でも効率的な推論が可能になったことが示された。

  1. Gemma 4 12B を Core ML で 128K コンテキストで動かす 2026-07-25 ・ Zenn LLM
  2. DeepSeek-V4-Flash-0731を動作させるために必要な最低VRAM要件 2026-07-31 ・ r/LocalLLaMA
  3. DeepSeek-V4-FlashモデルをRTX 3090とDDR5で高速動作させる方法 2026-08-01 ・ r/LocalLLaMA
  4. DeepSeek-V4-Flash 284Bを5.3GBのメモリで動作させる技術 2026-08-02 ・ r/LocalLLaMA
  5. DeepSeek V4-Flashを中古ハードウェアで稼働させた検証結果 2026-08-03 ・ r/LocalLLaMA
  6. DeepSeek V4 Flash 0731を組み込んだローカルベンチマークの更新 2026-08-05 ・ r/LocalLLaMA

当サイトが集めた記事から、同じ話題のものを古い順に並べています。