RTX 4080 16GB VRAMでQwen3.6-35B-A3Bのコンテキスト256Kを実測
Zenn LLM ・ 2026-08-14
原題: 16GB VRAMでコンテキスト256K — KV量子化の劣化を実測したら、圧縮自体が要らなかった
AI による要約
RTX 4080の16GB VRAMでQwen3.6-35B-A3Bのコンテキストを8Kから256K(32倍)に拡張してもVRAM使用量は+3.7GBで済み、生成速度は52-62 tok/sで変化がなかった。KV量子化はq8_0のままで同居プロセスも影響を受けなかった。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Zenn LLM)をご確認ください。