我要投稿

AI Agent 落地现状：成功率太低，即使用 GPT-4 也不到 15%

发布日期：2024-06-04 06:10:53 浏览次数： 1731

文章转载自「机器之心」，Founder Park 略有增删。

随着大语言模型的不断进化与自我革新，性能、准确度、稳定性都有了大幅的提升，这已经被各个基准问题集验证过了。

但是，对于现有版本的 LLM 来说，它们的综合能力似乎并不能完全支撑得起 AI 智能体。

多模态、多任务、多领域俨然已成为 AI 智能体在大众认知里的必须要求，但是在具体的功能实践中所展现的真实效果却差强人意，这似乎也再次提醒各个 AI 智能体初创公司以及大型科技巨头认清现实：脚踏实地一点，先别把摊子铺得太大，从 AI 增强功能开始做起。

最近，一篇讨论 AI 智能体在宣传和真实表现上的差距的博客中，强调了一个观点：「AI 智能体在宣传上是个巨人，而现实却很不妙。」

不可否认的是，自主 AI 智能体能够执行复杂任务的前景已经引起极大的兴奋。通过与外部工具和功能的交互，LLMs 可以在没有人为干预的情况下完成多步骤的工作流程。

但现实证明，这比预期的要更具挑战性。

WebArena 排行榜（一个真实可复现的网络环境，用于评估实用智能体的性能）对 LLM 智能体在现实任务中的表现进行了基准测试，结果显示即使是表现最好的模型，成功率也只有 35.8%。

WebArena 排行榜对 LLM 智能体在现实任务中的表现进行的基准测试结果：SteP 模型在成功率指标上表现最为良好，达到了 35.8%，而知名的 GPT-4 的成功率仅达到了 14.9%。

什么是 AI 智能体？

「AI 智能体」这个术语并没有真正被定义，对智能体究竟是什么也存在很多的争议。AI 智能体可以定义为「一个被赋予行动能力的 LLM（通常在 RAG 环境中进行函数调用），以便在环境中对如何执行任务做出高层次的决策。」当前，构建 AI 智能体主要有以下两种架构方法：

单一智能体：一个大型模型处理整个任务，并基于其全面的上下文理解做出所有决策和行动。这种方法利用了大型模型的涌现能力，避免了将任务分解所带来的信息丢失。
多智能体系统：将任务分解为子任务，每个子任务由一个更小、更专业的智能体处理。与尝试使用一个难以控制和测试的大型通用智能体相比，人们可以使用许多更小的智能体来为特定子任务选择正确的策略。由于上下文窗口长度的限制或不同技能组合的需要等实际约束，这种方法有时是必要的。

理论上，具有无限上下文长度和完美注意力的单一智能体是理想的。由于上下文较短，在特定问题上，多智能体系统总是比单一系统效果差。

而且，每个单独的智能体具体完全不同的功能时工作效果是最佳的。

HackerNews 上有一个 OpenAI 的员工发表的评论*可以作为一个不错的总结：

* https://news.ycombinator.com/item?id=40508953

单一的 API 调用在这些情况下更好：

大部分信息/子步骤是相关联的
场景是面向普通用户的 app 中，要求立刻提供输出，不需要等待中间步骤

多个、有序的 API 调用则是这些情况下表现更好：

可以将任务分解成更小的步骤，每个步骤都不需要完整的上下文
一棵树状图或步骤图，当你从根开始进行时，你想要修剪不相关的分支
希望在解析/中转代码之外拥有一些 100% 可靠的逻辑
希望根据前几步的结果自定义提示

AI Agent 落地实践中的挑战

在见证了许多 AI 智能体的尝试之后，作者认为它们目前仍为时过早、成本过高、速度过慢且不够可靠。

许多 AI 智能体初创公司似乎在等待一个模型突破，以开启智能体产品化的竞赛。AI 智能体在实际运用中的表现并不够成熟，这体现在输出不精确、性能差强人意、成本较高、赔偿风险、无法获得用户信任等问题：

可靠性：众所周知，LLMs 容易产生幻觉和不一致性。将多个 AI 步骤连接起来会加剧这些问题，尤其是对于需要精确输出的任务。
性能和成本：GPT-4、Gemini-1.5 和 Claude Opus 在使用工具 / 函数调用方面表现不错，但它们仍然较慢且成本高，特别是如果需要进行循环和自动重试时。
法律问题：公司可能需要对其智能体的错误负责。最近的一个例子是，加拿大航空被命令向一位被航空公司聊天机器人误导的客户赔偿。
用户信任：AI 智能体的「黑箱」性质以及类似示例使得用户难以理解和信任其输出。在涉及支付或个人信息的敏感任务中（如支付账单、购物等），赢得用户信任将会很困难。

AI Agent 相关项目和创业公司

目前，以下几家初创公司正在涉足 AI 智能体领域，但大多数仍处于实验阶段或仅限邀请使用：

adept.ai，https://www.adept.ai/，融资 3.5 亿美元，但访问权限仍然非常有限。
MultiOn，https://www.multion.ai/，融资情况未知，他们的 API 优先的方式看起来很有前景。
HypeWrite，https://www.hyperwriteai.com/，融资 280 万美元，起初是一个 AI 写作助手，后来扩展到智能体领域。
minion.ai，https://minion.ai/，最初引起了一些关注，但现在已经沉寂，仅有等候名单。

它们中似乎只有 MultiOn 在追求「给出指令并观察其执行」的方法，这与 AI 智能体的承诺更为一致。

其他所有公司都在走记录和重放的 RPA（record-and-replay）路线，这在现阶段可能是为保证可靠性所必需的。

同时，一些大公司也在将 AI 功能带到桌面 App 和浏览器，并且看起来将会在系统层面上获得本地的 AI 集成。

OpenAI 宣布了他们的 Mac 桌面应用程序，可以与操作系统屏幕互动。
在 Google I/O 大会上，Google 演示了使用 Gemini 自动处理购物退货。
微软宣布了 Copilot Studio，它将允许开发人员构建 AI 智能体机器人。

这些技术演示令人印象深刻，人们可以拭目以待这些智能体功能在公开发布并在真实场景中测试时的表现，而不是仅限于精心挑选的演示案例。

AI 智能体将走向哪条路？

作者强调：「AI 智能体被过度炒作了，大多数还没有准备好用于关键任务。」然而，随着基础模型和架构迅速进步，他表示人们仍可以期待看到更多成功的实际应用。

AI 智能体最有前途的前进道路可能是这样的：

近期的重点应放在利用 AI 增强现有工具，而不是提供广泛的全自主独立服务。
人机协同的方法，让人类参与监督和处理边缘案例。
根据当前的能力和局限，设定不脱离现实的期望。

通过结合严格约束的 LLMs、良好的评估数据、人机协同监督和传统工程方法，就可以在自动化等复杂任务方面实现可靠且良好的结果。

对于 AI 智能体是否会自动化乏味重复的工作，例如网络抓取、填表和数据录入？

作者：「是的，绝对会。」

那 AI 智能体是否会在没有人们干预的情况下自动预订假期？

作者：「至少在近期内不太可能。」

Founder Park 联合飞书及更多创新伙伴，，发起了一场新的「AGI 应用黑客松」，让人人都可以成为 AI 产品经理。体验过，上手过，在极限状态下创意冲刺过，才是真正拥抱过 AI！

新的黑客松来了！入围决赛就送 4090

转载原创文章请添加微信：founderparker

53AI，企业落地应用大模型首选服务商

产品：大模型应用平台+智能体定制开发+落地咨询服务

承诺：先做场景POC验证，看到效果再签署服务协议。零风险落地应用大模型，已交付160+中大型企业

160+中大型企业正在使用53AI

立即咨询预约演示

百度智能云邀53AI：共创AI新纪元，启航智能新时代

2024-05-27

钉钉恒星计划：53AI与百余位企业家及钉钉生态伙伴，共议“AI 浪潮下的新机遇”

2024-05-22

热点资讯

最强 GPT 免费使用！GPT4O 开启多模态新时代！

2024-05-14

全民AI时代：手把手教你用Ollama & AnythingLLM搭建AI知识库，无需编程，跟着做就行！

2024-04-26

【开源看AI】4.9K star！Khoj：完美融合本地文档和在线网页的AI第二大脑

2024-05-22

OLLama详细的 api 介绍不完全指南 python 直接调用 OLLama api 翻译助手演示

2024-04-12

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

2024-07-18

万字长文解析：大模型需要怎样的硬件算力

2024-03-30

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

2024-05-10

开源项目Composio：突破 AI 智能体开发的边界

2024-08-13

更改ollama模型存储路径

2024-04-25

全面对比dify、coze、streamlit、chainlit

2024-04-26

大家都在问

疯狂星期四Qwen2.5开源，通义成了最Open的AI?

2024-09-20

在长上下文LLM的时代，RAG是否仍然必要？

2024-09-20

【AI赋能】揭秘大模型微调：如何让机器智能跃升一个台阶？

2024-09-19

从案例分析到客户沟通：AI提示词如何优化律师工作流程？

2024-09-19

o1 能带我们走进 AGI 吗？

2024-09-19

如何微调（Fine-tuning）大语言模型？

2024-09-18

AI软件必须用GPU么？

2024-09-18

ChatGPT有三个快捷指令和三个模式，你知道吗？

2024-09-17

开箱即用的企业大模型应用平台

工作+AI

业务+AI

AIx业务

大模型咨询

大模型定制

相关资讯

160+中大型企业正在使用53AI

百度智能云邀53AI：共创AI新纪元，启航智能新时代

钉钉恒星计划：53AI与百余位企业家及钉钉生态伙伴，共议“AI 浪潮下的新机遇”

热点资讯

最强 GPT 免费使用！GPT4O 开启多模态新时代！

全民AI时代：手把手教你用Ollama & AnythingLLM搭建AI知识库，无需编程，跟着做就行！

【开源看AI】4.9K star！Khoj：完美融合本地文档和在线网页的AI第二大脑

OLLama详细的 api 介绍不完全指南 python 直接调用 OLLama api 翻译助手演示

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

万字长文解析：大模型需要怎样的硬件算力

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

开源项目Composio：突破 AI 智能体开发的边界

更改ollama模型存储路径

全面对比dify、coze、streamlit、chainlit

大家都在问

疯狂星期四Qwen2.5开源，通义成了最Open的AI?

在长上下文LLM的时代，RAG是否仍然必要？

【AI赋能】揭秘大模型微调：如何让机器智能跃升一个台阶？

从案例分析到客户沟通：AI提示词如何优化律师工作流程？

o1 能带我们走进 AGI 吗？

如何微调（Fine-tuning）大语言模型？

AI软件必须用GPU么？

ChatGPT有三个快捷指令和三个模式，你知道吗？

热门标签

开箱即用的企业大模型应用平台

工作+AI

业务+AI

AIx业务

大模型咨询

大模型定制

相关资讯

160+中大型企业正在使用53AI

百度智能云邀53AI：共创AI新纪元，启航智能新时代

钉钉恒星计划：53AI与百余位企业家及钉钉生态伙伴，共议“AI 浪潮下的新机遇”

热点资讯

最强 GPT 免费使用！GPT4O 开启多模态新时代！

全民AI时代：手把手教你用Ollama & AnythingLLM搭建AI知识库，无需编程，跟着做就行！

【开源看AI】4.9K star！Khoj：完美融合本地文档和在线网页的AI第二大脑

OLLama详细的 api 介绍 不完全指南 python 直接调用 OLLama api 翻译助手演示

GraphRAG+Ollama 本地部署，保姆教程，踩坑无数，闭坑大法

万字长文解析：大模型需要怎样的硬件算力

微调神器LLaMA-Factory官方保姆级教程来了，从环境搭建到模型训练评估全覆盖

开源项目Composio：突破 AI 智能体开发的边界

更改ollama模型存储路径

全面对比dify、coze、streamlit、chainlit

大家都在问

疯狂星期四Qwen2.5开源，通义成了最Open的AI?

在长上下文LLM的时代，RAG是否仍然必要？

【AI赋能】揭秘大模型微调：如何让机器智能跃升一个台阶？

从案例分析到客户沟通：AI提示词如何优化律师工作流程？

o1 能带我们走进 AGI 吗？

如何微调（Fine-tuning）大语言模型？

AI软件必须用GPU么？

ChatGPT有三个快捷指令和三个模式，你知道吗？

热门标签

OLLama详细的 api 介绍不完全指南 python 直接调用 OLLama api 翻译助手演示