我要投稿

LLM之后，Agent的未来是RL！

发布日期：2025-01-23 08:10:17 浏览次数： 1528 来源：探索AGI

嘿，大家好！这里是一个专注于AI智能体的频道~

今天给家人们聊一期播客总结，四十二章经最新一期播客请到了在Meta工作了七年的应用强化学习组负责人朱哲清Bill。作为斯坦福大学强化学习专业博士，现在创业做Agent的他，抛出了一个巨大的反共识观点：

"LLM只是一个翻译官，真正的Agent核心应该是RL。"

等等，这是什么意思？

在2024年，我们见证了GPT-4掀起的Agent热潮。Claude、GPTs、Copilot...几乎所有大公司都在用LLM构建Agent。

但Bill却说，这条路走偏了？

并且，他用自己的技术路线，只花了不到1万美金就训练出了一个能在电商领域超越GPT-4的Agent。

这背后到底有什么玄机？

当前Agent的痛点

要理解Bill的观点，我们先问自己一个问题：当前的Agent真的在"思考"吗？

播客里边给出了一个非常形象的类比：想象你在一个复杂的迷宫里。

如果是人类，会怎么做？

分析当前位置
尝试不同路径
记住死胡同
总结经验教训

但当前的LLM Agent呢？它就像一个只会背诵地图的人：

✓ 能说出每个路口的样子
✓ 能背诵所有可能的路径
× 但不会从错误中学习
× 更不会优化自己的策略

这就是为什么你会发现：

Agent常常重复同样的错误；遇到新情况就抓瞎；效率始终无法提升等等问题

平行宇宙思维

那RL是如何解决这个问题的？

这里有个有趣的概念：平行宇宙。

想象你在玩《王者荣耀》，每次决策都可以看到未来5分钟会发生什么，这边走会被抓，那边走能拿龙，支援上路能赢团战。

这就是RL的核心能力：

并行模拟多个未来
评估每个决策的收益
选择最优的行动路径

就像，AlphaGo能在没有人类棋谱的情况下，可以通过自我对弈达到超越人类的水平了；DeepSeek-R1最新的模型，没有PRM（过程奖励），没有MCTS（蒙特卡洛），Zero模型可以直接开始RL，训出来推理能力。

"翻译官"LLM

这是不是意味着LLM就没用了？

恰恰相反。

Bill提出了一个绝妙的比喻：LLM就像一个优秀的"翻译官"。

想象你是一个天才的围棋选手，但只会下棋，不会说话。你需要有人帮你理解对手的意图，帮你表达想法。

这就是LLM的完美定位：

输入端：把人类语言转换为RL可以理解的抽象状态
输出端：把RL的决策转换为人类可以理解的语言

最后

Bill预测，2025年会出现三个重要趋势：

专业领域的Agent会达到专业人士水平
训练成本会进一步降低
应用场景会不断扩大

但更重要的是，这个技术路线给了我们一个全新的视角：

也许，真正的AI智能体，应该像人类一样：

会在"平行宇宙"中规划
会从经验中学习
会不断优化决策

播客请搜索：

《我是这样用 RL + LLM 做 Agent 的｜对谈 Pokee AI 创始人朱哲清 Bill》

好了，这就是我今天想分享的内容。如果你对构建AI智能体感兴趣，别忘了点赞、关注噢~

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

太爽了！o1 现在可以天天享用了

2024-09-18

FP8 低精度训练：Transformer Engine 简析

2024-07-11

万字综述 10+ 种 LLM 投机采样推理加速方案

2024-07-11

彻底理解系列之：FP32、FP16、TF32、BF16、混合精度

2024-07-26

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

2024-07-09

通义千问超越GPT4了？

2024-06-11

深度剖析：字节跳动大模型训练被实习生“投毒”事件

2024-10-20

基于 Qwen2 大模型微调技术详细教程（LoRA 参数高效微调和 SwanLab 可视化监控）

2024-07-20

DifySandbox 的构建背景和实现机制

2024-07-12

AI中的端到端end to end到底是什么意思？

2024-09-02

大家都在问

怎么学习设计和训练一个大模型——也就是神经网络？

2025-01-22

如何本地部署AI模型？

2025-01-14

一文搞懂：大模型为什么要设计成预训练和微调两个阶段？

2025-01-12

大模型推理框架：Ollama和vLLM到底应该选哪个？

2025-01-06

AI模型训练到底在训练什么？

2024-12-26

微软变脸OpenAI，模型价值之争压不住了？

2024-12-25

大模型时代的软件工程教育，路在何方？

2024-12-24

字节ReFT技术：OpenAI强化微调的幕后功臣？

2024-12-09

开箱即用的企业大模型应用平台

工作+AI

业务+AI

AIx业务

大模型咨询

大模型定制

当前Agent的痛点

平行宇宙思维

"翻译官"LLM

最后

《我是这样用 RL + LLM 做 Agent 的｜对谈 Pokee AI 创始人朱哲清 Bill》

相关资讯

160+中大型企业正在使用53AI

把握AI发展的机遇，共同探索、共同进步

如何打造基于GenAI的员工服务机器人

热点资讯

太爽了！o1 现在可以天天享用了

FP8 低精度训练：Transformer Engine 简析

万字综述 10+ 种 LLM 投机采样推理加速方案

彻底理解系列之：FP32、FP16、TF32、BF16、混合精度

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

通义千问超越GPT4了？

深度剖析：字节跳动大模型训练被实习生“投毒”事件

基于 Qwen2 大模型微调技术详细教程（LoRA 参数高效微调和 SwanLab 可视化监控）

DifySandbox 的构建背景和实现机制

AI中的端到端end to end到底是什么意思？

大家都在问

怎么学习设计和训练一个大模型——也就是神经网络？

如何本地部署AI模型？

一文搞懂：大模型为什么要设计成预训练和微调两个阶段？

大模型推理框架：Ollama和vLLM到底应该选哪个？

AI模型训练到底在训练什么？

微软变脸OpenAI，模型价值之争压不住了？

大模型时代的软件工程教育，路在何方？

字节ReFT技术：OpenAI强化微调的幕后功臣？

热门标签