我要投稿

大模型所谓的参数是什么？大模型为什么需要训练？大模型训练到底干了什么？

发布日期：2024-06-02 08:06:53 浏览次数： 2130

“ 大模型的本质是机器学习，机器学习的本质就是一种数学模型。”

我们经常能听到这样的说法，某某大模型有多少参数，某某大模型参数量又提升了，这里所说的参数到底是什么？

我们知道大模型是训练出来的，那么哪些训练数据都跑哪去了，大模型训练的过程中都干了什么？为什么大模型需要训练？‍‍

—

大模型的参数到底是什么？

我们知道大模型的发展从刚开始的几百个参数，到现在的上千亿个参数，比如GPT-3就有一千七百多亿个参数。

而随着参数数量的提升，大模型的功能也变得越来越强大，特别是现在GPT-4o的出现，大模型已经可以和人类进行正常的语音和视频交流。‍‍‍‍‍‍‍‍‍

但很多人都不知道这个参数到底是个什么东西？‍‍‍‍‍‍‍‍‍

首先，我们要明白一件事，不要把训练数据当作参数；训练数据是训练数据，参数是参数。‍‍‍‍‍‍‍‍

大模型是基于机器学习模型，通过大量数据训练出来的模型，所以叫做大模型。‍‍‍‍‍‍‍‍

而现在主流的大模型都是基于神经网络模型构建的模型，不论是基于卷积神经网络(CNN)，还是循环神经网络(RNN)，亦或者是Transformer神经网络等。‍‍‍‍‍‍‍‍

但神经网络模型只是机器学习模型中的一个分类，其它还包括支持向量机，决策树，回归模型等。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

而这里说的大模型的参数，是基于神经网络模型而构建的参数。我们知道，神经网络模型有很多层，每一层都有很多个神经元，而每一层又需要进行连接；

这就是大模型参数的由来，比如权重与偏置，就是每个神经元都有的参数。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

一般情况下，大模型的参数是在网络架构时就设定好的，参数数量一般不会发生变化；但也有例外情况，比如动态神经网络就会对参数数量进行动态调整。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

—

大模型训练的具体过程？‍‍‍‍‍

我们都知道，训练大模型需要准备大量的数据，然后对模型进行训练。那么这个训练的过程到底是干了什么，哪些训练数据的作用是什么？‍‍‍‍‍‍‍‍

其实说白了，大模型训练的本质就是调整参数。

在前面我们说了，大模型有很多个参数，现在的大模型基本上参数都是以亿为单位；当然，参数的数量根据大模型的架构而有所不同。‍‍‍

训练的过程其实就是把训练数据输入到大模型中，然后模型根据这些数据对参数进行调整的过程，以求达到一个最优解。

如果把神经网络看作一个黑盒，那么我们输入数据，经过神经网络这个黑盒处理之后，再输出我们的数据。

如下图所示，就是一个简单的神经网络模型图：

神经网络单层模型

类似于人体有无数个神经元组成，而从数学理论来说，更多的神经元与更复杂的神经网络架构，就能够进行更加复杂的数据处理。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

所以，就有了多层的神经网络架构，如下图所示，神经网络由多个神经层组成。如GPT-3就有96层。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

多层神经网络

这就是神经网络的模型架构。‍‍‍‍‍‍‍

训练开始时，需要把训练数据输入到模型中，具体的输入方式这里暂不讨论，我们只需要知道训练数据需要输入到神经网络中即可。‍‍‍‍‍‍‍

因为模型有多个神经层，所以训练数据从输入层进入大模型之后；需要在模型的多个神经层之间进行流转，而这个过程术语叫做正向传播。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

数据从输入层，一层一层的传播到输出层，然后输出结果；但由于大模型刚开始就像一个小学生，所以它输出的结果往往不尽人意。‍‍‍‍‍‍‍‍

所以，为了解决这个问题，大模型的输出结果需要跟实际结果进行匹配，术语叫做计算损失差，损失差越大说明输出结果越差。‍‍‍‍‍‍‍‍‍‍‍‍‍

而有了损失差，说明当前的模型是有问题的；所以就需要对模型进行调整，这就是所谓的反向传播。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

意思就是，模型把输出的结果再次输入到模型中，然后模型根据这个结果，使用某种算法对模型中的参数进行调整，比如不同神经元的权重等。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

而调整参数的这个东西叫做优化器。

模型训练流程

然后，模型根据这个原理，使用训练数据一次一次的输入，然后一次一次的对参数进行调整。最后达到一个最优解，也就是训练好的大模型。‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍‍

这也是为什么大模型要经过很多轮的训练，才能达到比较满意的效果。‍‍‍‍‍‍‍‍‍‍‍

当然，大模型的神经层并不是越多越好，训练数据也不是越多越好，有时候更多的参数和训练数据训练出来的结果，可能还没有少一点的效果好。‍‍‍‍‍‍‍‍‍‍‍‍

而这也有专门的评估函数对训练结果进行评估。‍

以上就是大模型训练的原理。

53AI，企业落地应用大模型首选服务商

产品：大模型应用平台+智能体定制开发+落地咨询服务

承诺：先做场景POC验证，看到效果再签署服务协议。零风险落地应用大模型，已交付160+中大型企业

160+中大型企业正在使用53AI

立即咨询预约演示

百度智能云邀53AI：共创AI新纪元，启航智能新时代

2024-05-27

钉钉恒星计划：53AI与百余位企业家及钉钉生态伙伴，共议“AI 浪潮下的新机遇”

2024-05-22

热点资讯

最强 GPT 免费使用！GPT4O 开启多模态新时代！

2024-05-14

全民AI时代：手把手教你用Ollama & AnythingLLM搭建AI知识库，无需编程，跟着做就行！

2024-04-26

【开源看AI】4.9K star！Khoj：完美融合本地文档和在线网页的AI第二大脑

2024-05-22

OLLama详细的 api 介绍不完全指南 python 直接调用 OLLama api 翻译助手演示

2024-04-12

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

2024-07-18

万字长文解析：大模型需要怎样的硬件算力

2024-03-30

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

2024-05-10

开源项目Composio：突破 AI 智能体开发的边界

2024-08-13

更改ollama模型存储路径

2024-04-25

全面对比dify、coze、streamlit、chainlit

2024-04-26

大家都在问

疯狂星期四Qwen2.5开源，通义成了最Open的AI?

2024-09-20

在长上下文LLM的时代，RAG是否仍然必要？

2024-09-20

【AI赋能】揭秘大模型微调：如何让机器智能跃升一个台阶？

2024-09-19

从案例分析到客户沟通：AI提示词如何优化律师工作流程？

2024-09-19

o1 能带我们走进 AGI 吗？

2024-09-19

如何微调（Fine-tuning）大语言模型？

2024-09-18

AI软件必须用GPU么？

2024-09-18

ChatGPT有三个快捷指令和三个模式，你知道吗？

2024-09-17

开箱即用的企业大模型应用平台

工作+AI

业务+AI

AIx业务

大模型咨询

大模型定制

相关资讯

160+中大型企业正在使用53AI

百度智能云邀53AI：共创AI新纪元，启航智能新时代

钉钉恒星计划：53AI与百余位企业家及钉钉生态伙伴，共议“AI 浪潮下的新机遇”

热点资讯

最强 GPT 免费使用！GPT4O 开启多模态新时代！

全民AI时代：手把手教你用Ollama & AnythingLLM搭建AI知识库，无需编程，跟着做就行！

【开源看AI】4.9K star！Khoj：完美融合本地文档和在线网页的AI第二大脑

OLLama详细的 api 介绍不完全指南 python 直接调用 OLLama api 翻译助手演示

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

万字长文解析：大模型需要怎样的硬件算力

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

开源项目Composio：突破 AI 智能体开发的边界

更改ollama模型存储路径

全面对比dify、coze、streamlit、chainlit

大家都在问

疯狂星期四Qwen2.5开源，通义成了最Open的AI?

在长上下文LLM的时代，RAG是否仍然必要？

【AI赋能】揭秘大模型微调：如何让机器智能跃升一个台阶？

从案例分析到客户沟通：AI提示词如何优化律师工作流程？

o1 能带我们走进 AGI 吗？

如何微调（Fine-tuning）大语言模型？

AI软件必须用GPU么？

ChatGPT有三个快捷指令和三个模式，你知道吗？

热门标签

开箱即用的企业大模型应用平台

工作+AI

业务+AI

AIx业务

大模型咨询

大模型定制

相关资讯

160+中大型企业正在使用53AI

百度智能云邀53AI：共创AI新纪元，启航智能新时代

钉钉恒星计划：53AI与百余位企业家及钉钉生态伙伴，共议“AI 浪潮下的新机遇”

热点资讯

最强 GPT 免费使用！GPT4O 开启多模态新时代！

全民AI时代：手把手教你用Ollama & AnythingLLM搭建AI知识库，无需编程，跟着做就行！

【开源看AI】4.9K star！Khoj：完美融合本地文档和在线网页的AI第二大脑

OLLama详细的 api 介绍 不完全指南 python 直接调用 OLLama api 翻译助手演示

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

万字长文解析：大模型需要怎样的硬件算力

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

开源项目Composio：突破 AI 智能体开发的边界

更改ollama模型存储路径

全面对比dify、coze、streamlit、chainlit

大家都在问

疯狂星期四Qwen2.5开源，通义成了最Open的AI?

在长上下文LLM的时代，RAG是否仍然必要？

【AI赋能】揭秘大模型微调：如何让机器智能跃升一个台阶？

从案例分析到客户沟通：AI提示词如何优化律师工作流程？

o1 能带我们走进 AGI 吗？

如何微调（Fine-tuning）大语言模型？

AI软件必须用GPU么？

ChatGPT有三个快捷指令和三个模式，你知道吗？

热门标签

OLLama详细的 api 介绍不完全指南 python 直接调用 OLLama api 翻译助手演示