RTX 3090でQwen3.8-27Bの推論速度を2000prefill/秒・132decode/秒に最適化
r/LocalLLaMA ・ 2026-09-01
原題: I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
AI による要約
RTX 3090上でQwen3.8-27Bの推論エンジンを最適化し、prefill速度2000/秒・decode速度132/秒を達成した。カスタムカーネルにより品質劣化を最小限に抑えた。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。