微信扫码
与创始人交个朋友
我要投稿
Qwen,引领AI模型新纪元!性能与效率的完美结合。核心内容:1. Qwen2.5-1M模型的开源,涵盖7B和14B两个尺寸2. 集成稀疏注意力机制,推理速度显著提升3. 训练策略及硬件依赖的详细说明,助力高效应用
今天,Qwen2.5-1M模型开源。
2个尺寸,7B & 14B。开源并且,并结合vllm,集成了稀疏注意力机制,推理速度提升3到7倍。
14B模型的大海捞针获得了全绿的成绩,7B仅少量错误
长度提升的同时,短序列的成绩依然保持优异!
训练策略: 逐步变长到256K。 然后使用长度外推,外推用到了DCA的策略,
DCA通过将大的相对位置,按chunk分组,映射为较小的值
最后是硬件依赖:
对于处理 1M 长度的序列:
如果 GPU 显存不满足以上要求,仍然可以使用 Qwen2.5-1M 进行较短任务的处理。
最后,祝大家新年快乐!
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-02-02
快速搭建专业AI知识库的开源工具:Ragflow
2025-02-01
刚刚,OpenAI发布o3-mini,可免费使用、3大推理模式
2025-02-01
奥特曼:在开源AI上,我们错了!DeepSeek让OpenAI优势不再,下一个是GPT-5
2025-02-01
回应DeepSeek抄袭的质疑,DeepSeek和OpenAI ChatGPT的比较
2025-01-31
吴恩达评DeepSeek:中国 AI 崛起,开源模型重塑行业格局
2025-01-30
我让DeepSeek自己谈它和GPT的区别,大白话版笑死我了
2025-01-29
使用DeepSeek必备的10个技巧
2025-01-29
DeepSeek R1,本地部署才是王道!支持WebUI
2025-01-01
2024-07-25
2024-05-06
2025-01-21
2024-08-13
2024-06-12
2024-09-20
2024-07-11
2024-07-20
2024-12-26
2025-01-22
2025-01-16
2024-12-24
2024-12-20
2024-12-19
2024-11-22
2024-11-19
2024-11-13