トレンド一覧

パーソナライズLLMサービング向けGPUネイティブKVインジェクション

arXiv cs.LG ・ 2026-07-29

原題: InferScale: GPU-Native KV Injection for Personalized LLM Serving

AI による要約

パーソナライズされた長期コンテキストを持つLLM推論において、プロンプトの再プレフィルを避け再利用可能なKV状態で置き換えるGPUネイティブシステム「InferScale」を提案する。初回トークン生成時間(TTFT)を短縮し、効率的なメモリ管理を実現する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。

開発ツール / インフラ・半導体