我要投稿

Weavel Ape超过DSPy，或将成为最好用的提示（prompt）优化工具

发布日期：2024-09-17 21:06:40 浏览次数： 2093 作者：AI工程化

随着LLM应用的越来越多，工程师们面临的一大挑战是如何精准地设计出最优的prompt。这个过程往往需要通过不断的尝试和迭代来完成。加之大型模型的输出具有概率性，每次的输出结果都可能有所差异，这进一步增加了调试提示的难度。为了优化一段提示，工程师们可能需要投入数小时甚至更长的时间。因此，掌握如何撰写有效的提示以及如何对提示进行优化，已成为当前迫切且日益增长的需求。

之前，笔者也介绍过一些这一领域的工具，比如：PromptPerfect，DSPy等，可查看阅读：

Langchain创始人新项目Auto-Prompt Builder一键优化你的Prompt，再也不担心写不好Prompt了

DSPy（声明式自改进语言程序），面向大模型编程的新方法，克服当前LLM应用开发的诸多缺点

今天，介绍一款当前这一领域最强工具——Ape，它是由YC资助的创业公司Weavel开发的一款prompt优化工具，它在GSM 8 K基准测试中得分高达93%，超过BaseLLM的70%及DSPy的86%。

同时，它也可以自动生成评估代码，并使用LLM作为判断，或者自己设置评估指标。

Ape的核心理念非常简单：

好的输入 + 正确的引导 = 更好的提示。

APE的设计实现受到DSPy的影响，采用数据+迭代的方式进行prompt自我优化，得益于平台产品化的设计，整体使用门槛大大降低，易于上手。

它具备以下能力：

通过分析prompt和数据集生成评估代码
运行批量测试来评估prompt
从之前的测试中提取反馈和洞察
通过使用贝叶斯优化等统计方法找到最佳prompt
在改进prompt时考虑Human-in-loop的反馈

它的工作原理如下：

记录输入输出：仅需一行代码，即可开始记录LLM的调用。
数据集过滤：Ape将日志过滤成数据集。
生成评估代码：Ape使用LLM作为复杂任务的评估者。
持续优化：随着更多生产数据的加入，Ape会持续优化提升prompt性能。

虽然，APE内核已经被开源到github（https://github.com/weavel-ai/Ape），但目前缺乏使用帮助，集成使用可能还需要再等一段时间。当前可以在Weavel产品上体验APE，过程比较简单：

通过创建prompt，添加数据，开启优化三步就能完成prompt优化，训练数据除了上传外，也可以通过接口采集，同时APE提供了prompt版本化以及评估的功能，包含大量的评估方法，如下图。

APE相较于其他工具在能力层面已达到prompt工具的高级水平（prompt的工具分级金字塔详见：一文探秘LLM应用开发(23)-Prompt(相关工具)），这样很容易形成这样的迭代机制，进而保证prompt一直能够不劣化，这和小模型每日更新避免模型性能衰退逻辑十分相似。

数据+迭代的模式已经被验证是行之有效的prompt优化方法，以此思路启发，进一步构建一个“数据+迭代”的自学习LLM应用将是一个新的热点命题。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-17

提示词培训课—Part1

2025-04-16

这段Prompt提示词生成的自我介绍卡，让别人3年后还记得你

2025-04-16

思维链（Chain of Thought）是什么？有什么价值？怎么用？

2025-04-16

大模型Prompt工程：从理论到实践

2025-04-16

重磅！OpenAI 官方发布 GPT-4.1 最强提示词指南，AI 能力全面升级！

2025-04-15

提示词(prompt)那些事

2025-04-15

高级提示工程

2025-04-14

小白也能写出专业文生图Prompt，超棒的提示词框架+AI生图工具分享。

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

如何选择AI Agent框架？五种主流AI Agent框架对比

2024-08-20

一文讲透AI Prompt提示词工程 (上）

2024-06-29

Chat GPT不知怎么问？102种行业的Prompt提示词大全来了

2023-06-08

10分钟打造小红书？| 42个Cursor神级提示词（全网最新最全）

2024-09-17

更好的提示词？快试试这个方法来套取大模型的系统提示词吧

2024-06-27

使用ChatGPT显著提升学术写作水平的实用攻略，附顶级学术提示词指令

2024-06-26

提示词最佳实践（一）：Prompt框架

2024-07-09

玩转大模型的第一步——提示词(Prompt)工程【抛砖篇】

2024-07-12

豆包、kimi 这些大模型系统提示词里写了啥？(一)

2024-09-16

图解DSPy：Prompt的时代终结者？！

2024-06-14

大家都在问

思维链（Chain of Thought）是什么？有什么价值？怎么用？

2025-04-16

为什么提示工程，可以驾驭大模型？

2025-04-11

Claude 3.7 核心提示词曝光｜最懂提示词的大模型公司，现在怎么写 Prompt？

2025-02-25

我是如何基于 DeepSeek-R1 构建出高效学习Agent的？

2025-02-21

李继刚：AI都这么智能了，为什么还要研究写「提示词」？

2025-01-05

Claude 团队内部分享！什么时候该用Workflow和Agent，如何用简单模式构建有效的 LLM Agent ?

2025-01-04

李继刚 | 当我们讲Prompt时我们到底在说什么？

2024-12-15

AI对话的日常思考：当我们在讨论提示词时，到底在纠结什么？

2024-11-15

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

友情链接：

CopyRight © 2012-2024 深圳市博思协创网络科技有限公司版权所有

粤ICP备17114055号

广州：广州市华景路37号(华景软件园)暨南大学科技大厦6楼（整层）

深圳：深圳市福田区泰然四路29号天安创新科技广场一期A座1204

上海：上海市浦东新区金新路58号1602室

微信扫码
和创始人交个朋友

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部