トークンごとの動的な幅プルーニングでLLMの推論効率を向上させるWIDE
arXiv cs.AI ・ 2026-07-30
原題: WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning
AI による要約
プレフィルおよびデコードの両シナリオに対応し、トークンごとにアテンションヘッドやFFNチャネルを動的に選択して計算量を最適化する「WIDE」フレームワークを提案。LLMの推論効率を実用的に高めるために重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。