トレンド一覧

RTX 4080 16GB VRAMでQwen3.6-35B-A3Bのコンテキスト256Kを実測

Zenn LLM ・ 2026-08-14

原題: 16GB VRAMでコンテキスト256K — KV量子化の劣化を実測したら、圧縮自体が要らなかった

AI による要約

RTX 4080の16GB VRAMでQwen3.6-35B-A3Bのコンテキストを8Kから256K(32倍)に拡張してもVRAM使用量は+3.7GBで済み、生成速度は52-62 tok/sで変化がなかった。KV量子化はq8_0のままで同居プロセスも影響を受けなかった。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Zenn LLM)をご確認ください。

この話題に関わるコラム