微信扫码
添加专属顾问
我要投稿
论文链接:
百科知识:DeepSeek-V3 在知识类任务(MMLU, MMLU-Pro, GPQA, SimpleQA)上的水平相比前代 DeepSeek-V2.5 显著提升,接近当前表现最好的模型 Claude-3.5-Sonnet-1022。
长文本:长文本测评方面,在DROP、FRAMES 和 LongBench v2 上,DeepSeek-V3 平均表现超越其他模型。
代码:DeepSeek-V3 在算法类代码场景(Codeforces),远远领先于市面上已有的全部非 o1 类模型,并在工程类代码场景(SWE-Bench Verified)逼近 Claude-3.5-Sonnet-1022。
数学:在美国数学竞赛(AIME 2024, MATH)和全国高中数学联赛(CNMO 2024)上,DeepSeek-V3 大幅超过了所有开源闭源模型。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-05-21
从UI修改到AI提效!前端开发者的开源神器,一键选择网页元素与AI对话!
2025-05-21
AI 编程:开始智能 IDE 共建时代
2025-05-21
一站式大模型能力评测,Qwen3系列模型安全能力深度解析!
2025-05-21
OpenAI Codex 云端版完整评测,不堪大用但未来可期
2025-05-21
又一个开源 AI Agent 杀到!II-Agent,号称“全球最强”,击败 Genspark 和 Manus,跑分直逼人类
2025-05-21
世界最强通用智能体 II-Agent发布!碾压Manus 和Genspark
2025-05-20
狂揽 95k star,一键部署私有化 AI 交互平台的开源利器!
2025-05-20
微软深夜宣布VSCode Copilot彻底开源,剑指 Cursor!
2024-07-25
2025-01-01
2025-01-21
2024-05-06
2024-09-20
2024-07-20
2024-07-11
2024-06-12
2024-12-26
2024-08-13
2025-05-17
2025-05-17
2025-05-17
2025-05-16
2025-05-14
2025-05-12
2025-04-30
2025-04-29