長文RAGの低遅延化を実現するKVキャッシュ再利用手法CoinRAG
arXiv cs.AI ・ 2026-08-07
原題: CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
AI による要約
CoinRAGは、検索テキスト全体ではなく細粒度な情報単位のKVキャッシュを効率的に再利用する長文RAG向け最適化手法である。プリフィル時の遅延を抑制しつつ、ノイズや冗長性を排除して精度と処理効率のトレードオフを改善した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。