トレンド一覧

PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention

arXiv cs.CL ・ 2026-07-27

AI による要約

大規模言語モデルのトークンレベル・スパースアテンション(DSA等)でボトルネックとなるインデックス計算を効率化する手法「PIVOT」が提案された。近接するクエリグループで1回のフルプレフィックススキャンを共有することで、追加学習を必要とせずに推論計算コストを大幅に短縮できる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / インフラ・半導体