我要投稿

VLLM与PagedAttention实现快速大模型推理服务

发布日期：2024-07-20 08:04:19 浏览次数： 3627

摘要

本文提出了一种名为 PagedAttention 的新型注意力算法，以及一个基于该算法构建的大模型（LLM）服务系统 vLLM。该系统通过高效的内存管理，显著提高了 LLM 的吞吐量。PagedAttention 算法受到操作系统中虚拟内存和分页技术的启发，允许在非连续的分页内存中存储连续的键值对。

vLLM 系统通过块级内存管理和抢占式请求调度，实现了近乎零浪费的键值缓存（KV cache）内存，并在请求之间灵活共享 KV 缓存。实验结果显示，vLLM 在保持相同延迟水平的情况下，将流行 LLM 的吞吐量提高了 2-4 倍。

问题现状

大模型（LLM）的高吞吐量服务需要同时处理大量请求，现有系统在管理每个请求的键值缓存（KV cache）内存时存在挑战，因为这些内存需求巨大且动态变化。当管理效率低下时，内存会因碎片化和冗余复制而显著浪费，限制了批量处理的大小。现有的 LLM 服务系统在管理 KV 缓存内存时存在内部和外部内存碎片化，且无法利用内存共享的机会。

解决方案

PagedAttention 算法：一种受操作系统虚拟内存和分页技术启发的注意力算法，允许在非连续的内存空间中存储连续的键和值。
vLLM 系统：一个基于 PagedAttention 构建的高吞吐量分布式 LLM 服务引擎，通过块级内存管理和抢占式请求调度，实现了高效的内存利用。
内存管理：vLLM 通过将 KV 缓存划分为固定大小的块，并在需要时动态分配这些块，从而减少了内存碎片化和浪费。
解码算法支持：vLLM 支持多种解码算法，如并行采样和束搜索（beam search），通过内存共享机制进一步提高内存效率。

实验数据效果

吞吐量提升：vLLM 在不同模型和工作负载上的评估显示，其吞吐量比现有的最先进系统（如 FasterTransformer 和 Orca）提高了 2-4 倍。
内存效率：通过 PagedAttention 和 vLLM 的内存管理策略，显著减少了内存浪费，提高了内存利用率。
延迟保证：在提高吞吐量的同时，vLLM 保持了与现有系统相似的延迟水平。

后续扩展

分布式执行：vLLM 支持在分布式 GPU 上执行大型 LLM，通过模型并行策略进一步提高扩展性。
内存管理优化：vLLM 的内存管理策略可以应用于其他具有类似内存需求的 GPU 工作负载，尽管这需要针对具体工作负载进行优化。
decoding算法扩展：vLLM 展示了对多种解码算法的支持，未来可以进一步扩展以支持更多复杂的解码场景

视频地址：

https://www.bilibili.com/video/BV1TN4y1B7Fs

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-07-04

从Rax+DX到React，一次跨端组件重写的AI提效探索

2025-07-04

豆包又在偷偷进步！超能创意2.0内测，语意理解能力追平FLUX Kontext

2025-07-04

用cherry studio+mcp访问本地数据库

2025-07-04

Cursor 1.2 版本重磅发布：新增TodoList、消息队列、搜索PR、Tab补全提速！

2025-07-04

AI狂潮下：大公司如何破解"创新者窘境"？

2025-07-04

一文了解智能体协议 MCP . A2A . ANP . AGORA

2025-07-04

SAP AI Agent 开发工作台初体验

2025-07-03

Anthropic多智能体如何破解企业级任务并行处理瓶颈？

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

DeepSeek R1-0528 小版本升级

2025-05-29

教你解决GPT4o无法使用新版生图功能的教程

2025-04-11

AI法规-《生成式人工智能服务管理暂行办法》（中国）（2023.7）

2025-04-12

比 R1 快 8 倍、价格仅 3%，智谱新推理模型来袭，能让免费智能体自己赚钱！张鹏：Agent 也有 Scaling Law

2025-04-06

分而治之：全面解析分布式分离 Inference 系统

2025-04-29

微软突发“封杀令”！全面禁止Cursor使用C、C++、C# 扩展，开发者被迫回退版本

2025-04-12

Qwen3发布: 4B干掉旧代 72B / Windsurf又增加新的免费计划

2025-04-29

CAG 与 RAG：哪种方法能带来性能更好的人工智能

2025-05-07

忽视小模型和知识库，企业AI应用必将是死路一条

2025-05-07

豆包，让有独立显卡的电脑都能部署本地大模型，语料库就是电脑里的文件

2025-04-17

大家都在问

AI狂潮下：大公司如何破解"创新者窘境"？

2025-07-04

Anthropic多智能体如何破解企业级任务并行处理瓶颈？

2025-07-03

AI 商业化，Salesforce 做对了什么？

2025-07-03

AI 编程如何在团队中真正落地？

2025-07-02

AI 如何成为认知导航仪？

2025-07-02

巨头混战Agent，押注背后是真未来还是新泡沫？

2025-07-01

什么才是AI时代最大的创业机会？

2025-07-01

大模型+Agent智能体：新一代全息立体防控体系如何重塑智慧公安？

2025-07-01

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

友情链接：

CopyRight © 2012-2024 深圳市博思协创网络科技有限公司版权所有

粤ICP备17114055号

广州：广州市华景路37号(华景软件园)暨南大学科技大厦6楼（整层）

深圳：深圳市福田区泰然四路29号天安创新科技广场一期A座1204

上海：上海市浦东新区金新路58号1602室

微信扫码
和创始人交个朋友

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部