トレンド一覧

LLM推論向け入力適応型行列積削減手法の提案

arXiv cs.AI ・ 2026-08-13

原題: Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

AI による要約

Transformerの推論コストを削減するため、入力に応じて行列積の不要なスライスを削減する手法「Reduced Matrix Multiplication (RMM)」が提案された。重みを再学習・変更することなく、保持比率の調整によって精度と効率のトレードオフを制御できる。1Bから70Bパラメータのモデル実験において、自己回帰生成や長文脈環境下でも頑健な削減効果を示した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / インフラ・半導体

この話題に関わるコラム