我要投稿

抛弃 RAG！缓存增强生成或成知识任务新宠

发布日期：2025-01-08 19:36:27 浏览次数： 2156

作者：互联网持续学习圈

微信搜一搜，关注“互联网持续学习圈”

在自然语言处理领域，检索增强生成（RAG）一直是增强语言模型能力的热门方法，但它存在检索延迟、文档选择错误和系统复杂等问题。今天要给大家介绍的这篇论文 “Don’t Do RAG: When Cache-Augmented Generation is All You Need for Knowledge Tasks” 提出了一种新的范式 —— 缓存增强生成（CAG），为知识任务提供了更高效的解决方案。

研究背景

RAG 通过动态整合外部知识源，在处理开放域问题和专业任务方面表现出色。然而，其实时检索的需求导致了延迟，文档选择和排序的错误也会影响生成答案的质量，并且系统集成的复杂性增加了维护成本。随着长上下文大语言模型（LLMs）的发展，它们处理大量文本输入的能力为解决这些问题提供了新的思路。

方法介绍

CAG 框架

CAG 框架主要分为三个阶段：

1. 外部知识预加载

将与目标应用相关的文档集合 D 进行预处理和格式化，使其适应模型的扩展上下文窗口。通过 LLM M 及其参数 θ 处理 D，生成预计算的键值（KV）缓存，该缓存存储在磁盘或内存中供后续使用，且处理 D 的计算成本仅需一次。

2. 推理

在推理过程中，将预计算的与用户查询 Q 一起加载，LLM 利用缓存的上下文生成响应。预加载外部知识消除了检索延迟，降低了动态检索带来的错误风险，同时确保了模型对外部知识和用户查询的统一理解。

3. 缓存重置

为了在多次推理过程中保持系统性能，存储在内存中的 KV 缓存可以高效地重置。由于 KV 缓存是以追加新令牌的方式增长的，重置操作通过截断这些新令牌实现，这样可以快速重新初始化，而无需从磁盘重新加载整个缓存。

CAG 方法相比传统 RAG 系统具有显著优势：减少了推理时间，因为无需实时检索；提供了统一的上下文，提高了响应质量和一致性；简化了系统架构，降低了开发和维护成本。

实验设置与结果

实验设置

使用斯坦福问答数据集（SQuAD）1.0 和 HotPotQA 数据集进行实验，为每个数据集创建了三个不同参考文本长度的测试集，以研究参考文本长度对检索难度的影响。实验在 Tesla V100 32G × 8 GPUs 上进行，所有实验均使用 Llama 3.1 8B 指令模型作为基础 LLM，并通过预计算的 KV 缓存预加载数据集上下文。

基线系统

基线 RAG 系统使用 LlamaIndex 框架实现，包括两种检索策略：BM25 稀疏检索和 OpenAI 密集检索。每个数据集分别进行评估，检索系统仅从相应数据集中获取段落。

实验结果

1. 答案质量

如【表格 2】所示，CAG 方法在大多数情况下获得了最高的 BERTScore，优于传统的 RAG 系统。通过预加载测试集的整个上下文，CAG 消除了检索错误，确保了对所有相关信息的整体推理，在 RAG 系统可能检索到不完整或不相关段落的情况下优势尤为明显。

2. 生成时间

【表格 3】显示，CAG 显著减少了生成时间，特别是随着参考文本长度的增加。这是因为预加载 KV 缓存避免了实时处理参考文本，并且 CAG 比传统 RAG 系统更快，因为它完全绕过了检索阶段。

研究总结与展望

随着长上下文 LLMs 的发展，CAG 方法为重新思考传统 RAG 工作流程提供了有力的依据。虽然本文强调消除检索延迟，但未来也可以探索混合方法，如预加载基础上下文并结合选择性检索，以平衡效率和灵活性，适应不同场景的需求。

总之，CAG 方法在知识任务中展现出了巨大的潜力，为自然语言处理领域的研究和应用提供了新的方向。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-10-28

多少做RAG的人，连分词都搞不定? Milvus Analyzer指南

2025-10-28

先分块再向量化已经过时！先embedding再chunking才是王道

2025-10-28

AI检索增强中路由模型的使用

2025-10-28

HybRAG：混合文本和知识图谱的RAG框架

2025-10-28

“生成幻觉”（Hallucination）和“知识时效性”不足引发的架构范式变革

2025-10-27

RAG优化技巧

2025-10-26

关于RAG系统在多轮对话中的问题改写(优化)方法—使用历史记录改写问题

2025-10-26

你的RAG知识库，真的“喂”对数据了吗？拆解dify分段策略，告别无效召回

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

RAG彻底爆了！一文掌握其效果优化的架构设计及核心要点

2025-09-15

从原理到落地：RAG 技术全解析，手把手教你搭建专属知识库

2025-09-02

响应速度提升300%、检索准确率90%：RAG如何让企业知识“活”起来赚钱？

2025-08-05

优化 GraphRAG：LightRAG的三大改进

2025-08-18

RAG系统全景：架构详解与落地实践指南

2025-08-25

高质量AI知识库应用的前提：选对向量数据库

2025-08-25

一文搞懂大模型：何为深入理解RAG？

2025-08-25

DeepMind爆火论文：向量嵌入模型存在数学上限，Scaling laws放缓实锤？

2025-09-03

别再往AI的知识库塞奇怪的东西了，什么样的知识适合作为RAG知识库？

2025-08-20

万字长文详解腾讯优图RAG技术的架构设计与创新实践

2025-09-08

大家都在问

Embedding与Rerank：90%的RAG系统都搞错了！为什么单靠向量检索会毁了你的AI应用？

2025-10-04

存算一体破局向量检索瓶颈，IBM放出王炸VSM：性能飙升100倍，能效碾压GPU千倍，RAG要变天？

2025-09-30

您应该为您的 RAG 系统使用哪种分块技术？

2025-09-10

关于多模态应用的几个疑问，以及多模态应该怎么应用于RAG？

2025-09-10

DeepMind爆火论文：向量嵌入模型存在数学上限，Scaling laws放缓实锤？

2025-09-03

RAG检索后如何应用更有效？

2025-08-28

一文搞懂大模型：何为深入理解RAG？

2025-08-25

别再往AI的知识库塞奇怪的东西了，什么样的知识适合作为RAG知识库？

2025-08-20

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部