Nifer is insane. 700t/s with Qwen 3.6 35B (no thinking). Purpose build for RTX5090. Full 250k context too.
r/LocalLLaMA ・ 2026-07-27
AI による要約
RTX 5090向けに特化したローカルLLM推論ツール「Nifer」が公開され、Qwenモデルで700t/sという圧倒的な高速処理を実現した。ハードウェアの性能を極限まで引き出す実装手法として、ローカルLLM愛好家の間で注目を集めている。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。