トレンド一覧

トークンごとの動的な幅プルーニングでLLMの推論効率を向上させるWIDE

arXiv cs.AI ・ 2026-07-30

原題: WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

AI による要約

プレフィルおよびデコードの両シナリオに対応し、トークンごとにアテンションヘッドやFFNチャネルを動的に選択して計算量を最適化する「WIDE」フレームワークを提案。LLMの推論効率を実用的に高めるために重要である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

開発ツール / インフラ・半導体