QCFuse: 압축된 정보를 활용한 쿼리 기반 캐시 통합을 통한 효율적인 RAG 서비스
QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving
검색 증강 생성(RAG)은 외부 정보에 기반하여 LLM의 답변 품질을 향상시키지만, 검색된 컨텍스트를 처리하는 과정에서 프리필 단계가 전체 서비스 비용의 상당 부분을 차지합니다. RAG 캐시 통합은 미리 계산된 키-값(KV) 캐시를 재사용하고 현재 프롬프트에 따라 일부 토큰을 선택적으로 다시 계산하여 이러한 비용을 줄입니다. 기존의 선택기는 품질과 효율성 사이에서 어려움을 겪는데, 빠른 쿼리 무관 또는 최종 레이어 쿼리-컨텍스트 선택기는 요청 관련 정보를 놓칠 수 있으며, 전체 컨텍스트와 레이어를 모두 확인해야 하는 쿼리 기반 선택기는 재계산을 위해 광범위한 정보가 필요하여 레이어별 캐시 통합 파이프라인을 지연시킵니다. 본 논문에서는 RAG 캐시 통합을 위한 압축된 정보를 활용하는 쿼리 기반 선택기인 QCFuse를 제안합니다. QCFuse는 청크-앵커(chunk-anchor) 쿼리 프로빙을 사용하여 사용자 쿼리 상태를 개별 청크에 대한 간결한 정보로 조정하고, 모든 레이어를 검사하지 않고 재계산해야 할 토큰을 식별하기 위해 중요한 레이어 프로파일링을 사용합니다. QCFuse는 SGLang으로 구현되었으며, 여섯 개의 데이터 세트를 사용하여 네 가지 오픈 웨이트 LLM에서 평가되었습니다. QCFuse는 전체 프리필 수준의 품질을 달성했습니다. 동일한 품질 수준에서 QCFuse는 전체 프리필 방식보다 평균 1.7배 빠르고, 가장 강력한 품질 유지 기준인 ProphetKV보다 1.5배 빠른 프리필 시간을 보였습니다.
Retrieval-augmented generation (RAG) improves large language model (LLM) answer quality by grounding generation in external evidence, but processing retrieved contexts makes the prefill stage a dominant serving cost. RAG cache fusion reduces this cost by reusing precomputed key-value (KV) caches for retrieved chunks and selectively recomputing tokens under the current prompt. Existing selectors, however, face a dilemma between quality and efficiency: fast query-agnostic or final-layer query-to-context selectors can miss request-relevant evidence, whereas full-view query-aware selectors require broad context and layer visibility before recomputation and therefore stall the layer-wise cache-fusion pipeline. We present QCFuse, a compressed-view query-aware selector for RAG cache fusion. QCFuse uses chunk-anchor query probing to condition user-query states on compact per-chunk anchors and critical-layer profiling to identify recomputation tokens without all-layer inspection. We implement QCFuse in SGLang and evaluate it on four open-weight LLMs across six datasets. QCFuse reaches full-prefill-level quality. At matched quality, QCFuse achieves an average prefill-time speedup of 1.7x over full prefill and 1.5x over ProphetKV, the strongest quality-preserving baseline.
No Analysis Report Yet
This paper hasn't been analyzed by Gemini yet.
Log in to request an AI analysis.