Ninfer-3090でQwen3.8-27BをRTX 3090上で高速推論
r/LocalLLaMA ・ 2026-08-14
原題: Ninfer-3090
AI による要約
RTX 3090向けの推論ランタイムNinfer-3090で、Qwen3.8-27Bモデルを高速に推論できることを発表。ReplaySSMによりメモリ効率を改善し、MTP3モードを維持しつつバッチ処理を高速化した。1,024出力トークンの持続的な推論で性能を実証した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。