パーソナライズLLMサービング向けGPUネイティブKVインジェクション
arXiv cs.LG ・ 2026-07-29
原題: InferScale: GPU-Native KV Injection for Personalized LLM Serving
AI による要約
パーソナライズされた長期コンテキストを持つLLM推論において、プロンプトの再プレフィルを避け再利用可能なKV状態で置き換えるGPUネイティブシステム「InferScale」を提案する。初回トークン生成時間(TTFT)を短縮し、効率的なメモリ管理を実現する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。