LLM推論向け入力適応型行列積削減手法の提案
arXiv cs.AI ・ 2026-08-13
原題: Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference
AI による要約
Transformerの推論コストを削減するため、入力に応じて行列積の不要なスライスを削減する手法「Reduced Matrix Multiplication (RMM)」が提案された。重みを再学習・変更することなく、保持比率の調整によって精度と効率のトレードオフを制御できる。1Bから70Bパラメータのモデル実験において、自己回帰生成や長文脈環境下でも頑健な削減効果を示した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。