Qwen 3.6 35B A4B+で推論トークン数を8.5%削減、追加学習不要の手法を発表
r/LocalLLaMA ・ 2026-09-03
原題: Increasing active parameters per token in MOE (Qwen 35B A4B+) reduce reasoning token by 8.5% - and you don't need to train or finetune!
AI による要約
Qwen 3.6 35B A4B+で、推論時のトークン数を8.5%削減する手法が発表された。追加学習やファインチューニングを必要とせず、ルーターの設定変更のみで実現できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。