我要投稿

Bilibili发布Index-1.9B大模型：没错，就是那个二次元B站

发布日期：2024-06-14 04:44:41 浏览次数： 3521 作者：猜想笔记

1. **模型简介**：

- Index-1.9B系列是轻量级的语言模型。

- 包含`Index-1.9B base`、`Index-1.9B pure`、`Index-1.9B chat`和`Index-1.9B character`等模型。

- 模型已在HuggingFace和ModelScope上开源。

2. **预训练**：

- 模型在2.8T的数据上训练，涵盖中英文等多种语言。

- 数据经过清洗，包括避免偏置和去重。

- 使用SentencePiece训练BPE Tokenizer，特别针对中文进行了优化。

3. **模型架构**：

- 与主流的Decoder-Only Transformer模型一致，进行了一些调整，如更深的模型层数（36层）和Norm-Head机制。

4. **训练过程**：

- 使用AdamW优化器，两阶段训练策略（Stable和Decay阶段）。

- 训练基建使用了自研训练框架和华为昇腾910B卡。

5. **评测**：

- 使用OpenCompass框架进行评测，包括综合性选择题、理解和推理、数学和代码评测。

6. **讨论和实验**：

- 探讨了模型结构、学习率、预训练中是否加入指令等因素对模型性能的影响。

- 进行了消融实验，分析了不同组件对模型性能的贡献。

7. **对齐**：

- 通过SFT（Supervised Fine-Tuning）和DPO（Direct Preference Optimization）进一步优化模型，以符合人类偏好。

8. **角色扮演**：

- 利用RAG（Retrieval-Augmented Generation）技术，实现few-shot角色扮演定制。

9. **局限性**：

- 尽管采取了合规性检测，但模型可能存在未预料到的问题，使用时需注意潜在风险。

以上由Kimi总结，0 shot。原文档字有点小，凑合看吧。在公众号后台回复“B站”获取原文档。

//

END.

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-07

如何理解政务大模型？

2025-04-07

高德、腾讯、百度地图布局 MCP Server 对比分析

2025-04-07

大模型的分类及技术指标

2025-04-07

警惕“技术名词崇拜”，回归实际需求--伪AI产品盘点

2025-04-07

伯克利最新研究：为什么多 Agent 系统总是“高期待、低表现”？

2025-04-07

可观测性成为ML和LLM应用的最大挑战

2025-04-07

刚刚，DeepSeek公布推理时Scaling新论文，R2要来了？

2025-04-07

谷歌随OpenAI强势入局，劈柴4天闪电部署Gemini+MCP！

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

本地部署大模型？看这篇就够了，Ollama 部署和实战

2024-08-13

16个具有“联网搜索”功能的AI：总有一个适合你！

2024-06-13

Cursor 一个真正让程序员产生危机感的 AI 编程工具

2024-08-21

OpenAI o1与GPT4o的对比分析

2024-09-23

大模型｜“上下文长度”和“上下文窗口”不再傻傻分不清楚！

2024-07-31

一文带你了解大模型——智能体（Agent）

2024-05-28

50+个AI大模型在不同领域的应用案例

2024-08-04

全面对比dify、coze、streamlit、chainlit

2024-04-26

【深度】AI搜索产品深度分析-搜索原理和商业模式分析

2024-07-09

一文读懂OpenAI新发布o1系列大模型

2024-09-17

大家都在问

如何理解政务大模型？

2025-04-07

伯克利最新研究：为什么多 Agent 系统总是“高期待、低表现”？

2025-04-07

刚刚，DeepSeek公布推理时Scaling新论文，R2要来了？

2025-04-07

【AI知识点】什么是 Agentic Workflows？

2025-04-07

VSCode发布Agent+MCP，Cursor劲敌又回来了？

2025-04-06

深入解析Agentic AI架构：如何打造自主决策的智能体？

2025-04-06

大语言模型是如何推理的？

2025-04-05

Transformer到底解决什么问题？

2025-04-02

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

友情链接：

CopyRight © 2012-2024 深圳市博思协创网络科技有限公司版权所有

粤ICP备17114055号

广州：广州市华景路37号(华景软件园)暨南大学科技大厦6楼（整层）杨小姐 186 6662 7370

深圳：深圳市福田区泰然四路29号天安创新科技广场一期A座1204 陈先生 185 8882 0121

上海：上海市浦东新区金新路58号1602室戴先生 186 1639 7587

微信扫码
和创始人交个朋友

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部