微信扫码
添加专属顾问
我要投稿
6850亿参数的DeepSeek-V3新模型来袭,性能与稳定性的双重飞跃! 核心内容: 1. DeepSeek-V3-0324模型的参数量与前代相同,均为6850亿 2. 支持BF16、F8_E4M3和F32三种不同精度的浮点数格式 3. 性能提升与bug修复,DeepSeek-V3-0324的两大主要改进
DeepSeek 终于发布新模型了!
3 月 24 日晚,DeepSeek 在官方 Hugging Face 社区上传了一个名为 DeepSeek-V3-0324
的新模型。
顾名思义,DeepSeek 的这个新模型是上一代 DeepSeek-V3
的升级版本。
点击进入 DeepSeek-V3-0324
的模型页面,虽然 DeepSeek 官方还没有来得及上传详细的 README 文档,但从右边的模型参数信息也能够推断出蛛丝马迹。
新模型的参数量为 685B,即 6850 亿个参数。这个参数量与上一代 DeepSeek-V3
是一样的。
而新模型所支持的张量数据类型也和前代模型保持一致:支持 BF16、F8_E4M3 和 F32 三种不同精度的浮点数格式进行推理和训练计算。
毫无疑问,将开源进行到底的 DeepSeek 这次推出的 DeepSeek-V3-0324
也是完全开源的模型。
虽然 DeepSeek 官方还没有介绍,但不难推测,这次的 DeepSeek-V3-0324
主要会在两方面提升。
一个是性能。前一代的 DeepSeek-V3
说实话就挺强的,我微信公众号目前接入的就是 DeepSeek-V3
模型。
并且我也在 DeepSeek-V3
刚发布时就做了测试:测试完DeepSeek V3和GPT-4o,我不想再开ChatGPT会员了! 这个测评文章发布于 DeepSeek 爆火之前,当时还有不少小可爱质疑 DeepSeek-V3
的能力。
其二是修 bug。是的,你没有看错,模型也是有 bug 的。之前的 DeepSeek-V3
有一个很“致命”的问题:function call 循环调用和空回复。
这是 DeepSeek 官方之前在其开放平台发的公告。而现在,这句话已经没有了。
至于在哪里使用 DeepSeek-V3-0324
,DeepSeek 官方还没有明确说。但 Hugging Face 已经有小伙伴表示官网 “非深度思考” 模式下的底层模型已经换成了 DeepSeek-V3-0324
。
其实也不用急,DeepSeek-V3-0324
一旦正式发布,DeepSeek 官网和 API 都会同步更新。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-04-16
A2A协议:打破Agent“孤岛”,开启智能协作新时代
2025-04-16
GitMCP: 让AI助手拥抱开源世界的桥梁
2025-04-16
解放双手!Index:顶尖开源AI浏览器代理,复杂网页任务一键搞定 (Claude 3.7 驱动)
2025-04-16
CortexON:开源通用AI Agent,又一替代Manus产品
2025-04-16
AI涌现人类情感!希腊「乐之神」Orpheus开源,单卡可跑语音流式推理
2025-04-16
Second Me 重磅升级:全平台 Docker 支持,Mac/Windows/Linux 全覆盖!
2025-04-15
Spring AI 1.0.0 M7 发布!很炸裂!!
2025-04-15
OpenManus初体验,整合千问大模型Qwen/QwQ-32B
2025-01-01
2024-07-25
2025-01-21
2024-05-06
2024-09-20
2024-07-20
2024-06-12
2024-07-11
2024-08-13
2024-12-26
2025-04-15
2025-04-13
2025-04-10
2025-04-07
2025-04-03
2025-04-03
2025-04-03
2025-04-01