PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention
arXiv cs.CL ・ 2026-07-27
AI による要約
大規模言語モデルのトークンレベル・スパースアテンション(DSA等)でボトルネックとなるインデックス計算を効率化する手法「PIVOT」が提案された。近接するクエリグループで1回のフルプレフィックススキャンを共有することで、追加学習を必要とせずに推論計算コストを大幅に短縮できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。