我要投稿

腾讯开源Hunyuan-Large，3890亿参数，全球最大开源MoE模型

发布日期：2024-11-05 16:57:19 浏览次数： 1863 作者：猜想笔记

模型技术优势介绍

高质量合成数据：通过使用合成数据增强训练，Hunyuan-Large 可以学习更丰富的表示，处理长上下文输入，并更好地推广到看不见的数据。

KV 缓存压缩：利用分组查询注意（GQA）和跨层注意（CLA）策略显著减少 KV 缓存的内存使用量和计算开销，提高推理吞吐量。

专家特定的学习率缩放：为不同的专家设置不同的学习率，以确保每个子模型有效地从数据中学习并有助于整体性能。

长上下文处理能力：预训练模型支持高达256K的文本序列，Instruct模型支持高达128K，显著增强了处理长上下文任务的能力。
广泛的基准测试：在多种语言和任务上进行大量实验，验证Hunyuan-Large的实用有效性和安全性。

基准评估

与具有相似激活参数大小的 Dense 和 MoE 竞争对手相比， Hunyuan-Large 预训练模型取得了最佳整体性能。

对于 MMLU、MMLU-Pro 和 CMMLU 等聚合基准，Hunyuan-Large 始终取得最佳性能，证实了其在聚合任务上的综合能力。

Hunyuan-Large 在常识理解和推理以及经典 NLP 任务（例如 QA 和阅读理解任务，例如 CommonsenseQA、PIQA 和 TriviaQA）中也表现出色。

对于数学能力，Hunyuan-Large 在 GSM8K 和 MATH 数学数据集上的表现优于所有基线，并且在中文 CMATH 上也获得了最佳结果。Hunyuan-Large 在所有中文任务（例如 CMMLU、C-Eval）中取得了整体最佳性能。

与具有类似激活参数的 LLM 相比，Hunyuan-Large-Instruct在大多数类型的任务上都实现了持续改进，表明了后训练的有效性。

深入研究不同类别基准测试中的模型性能，instruct 模型在 MMLU 和 MATH 数据集上取得了最佳性能。

值得注意的是，在 MMLU 数据集上，模型表现出显着的改进，比 LLama3.1-405B 模型高出 2.6%。

这种增强不仅仅是微不足道的，而是表明 Hunyuan-Large-Instruct 在广泛的语言理解任务中具有出色的理解和推理能力。该模型在 MATH 数据集上的表现进一步凸显了其实力，它比 LLama3.1-405B 明显高出 3.6%。

值得注意的是，这种准确度的飞跃仅通过 520 亿个激活参数就实现了，凸显了模型的效率。

PS：腾讯还开源了一个3D生成大模型。

END.

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-19

DeepSeek+Dify 构建本地知识库，真香！

2025-04-19

微软开源实时交互模型：提升Agent动态复杂处理能力

2025-04-19

微软最新 Playwright MCP 服务器强势来袭？

2025-04-18

OpenManus：开源版 Manus，无需邀请码，5 分钟极速体验！

2025-04-18

OpenAI开源34页Agents最佳实践白皮书~

2025-04-18

OpenAI推出终端编码智能体Codex CLI了

2025-04-18

“开源版coze”爆火，融资超 4.6 亿！如今 Docker 拉取量超 1 亿，斩获 77.5k star

2025-04-18

【开源看AI】GitDiagram：AI帮你理解任意代码库的架构

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

我把最近爆火的 DeepSeek-V3 接到了 Cursor！

2025-01-01

Ollama 本地运行大模型(LLM)完全指南

2024-07-25

万字详解DeepSeek-R1，引爆AI圈的又一力作，大模型爆发势不可挡！

2025-01-21

太强了！10大开源大模型！

2024-05-06

QWEN2.5开源上新，14B/32B回归实测：这就是最强单卡本地模型！

2024-09-20

全民进入GPT-4时代：OpenAI强势推出GPT-4o mini！彻底取代GPT-3.5！

2024-07-20

Qwen2 阿里最强开源大模型（Qwen2-7B）本地部署、API调用和WebUI对话机器人

2024-06-12

如何免费使用 Claude AI？Claude使用指南！

2024-07-11

开源项目Composio：突破 AI 智能体开发的边界

2024-08-13

DeepSeek-V3 正式发布

2024-12-26

大家都在问

微软最新 Playwright MCP 服务器强势来袭？

2025-04-19

OpenAI开源的Codex CLI是什么？

2025-04-17

MCP，这个AI 开源协议有多大想象空间？

2025-04-15

Google ADK，知多少？

2025-04-13

一文看懂谷歌 A2A：它到底是个啥？为什么能带AI Agent 组队开黑？

2025-04-10

实测Llama 4，究竟是王者归来，还是廉颇老矣？

2025-04-07

4天开发，1700万美元融资：开源的Browser Use为啥这么火？

2025-04-03

为什么大模型本地部署后“没了下文”？

2025-04-03

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB