我要投稿

Meta开源用于数学等复杂推理AI Agent—HUSKY

发布日期：2024-07-30 04:46:24 浏览次数： 2085 作者：AIGC开放社区

专注AIGC领域的专业社区，关注微软&OpenAI、百度文心一言、讯飞星火等大语言模型（LLM）的发展和应用落地，聚焦LLM的市场研究和AIGC开发者生态，欢迎关注！

Meta、华盛顿大学和阿伦AI实验室的研究人员联合开源了，专用于数学、表格等复杂推理的AI Agent—HUSKY。

与传统AI Agent不同的是，HUSKY采用了一个统一的行动空间，无论是数值计算、表格分析还是基于知识的推理，都能够通过一系列预定义的自动化行动来完成。这种统一性极大提升了AI Agent的泛化能力，使其能够跨领域解决多种难题。

此外，HUSKY还使用了一种迭代推理的方法，通过在行动生成和执行之间不断迭代，可以像人类那样分层次地拆解、解决难题，在处理超复杂任务时非常高效。

开源地址：https://github.com/agent-husky/Husky-v1

论文地址：https://arxiv.org/abs/2406.06469

行动生成相当于HUSKY的“大脑”。在这一阶段，行动生成器作为核心组件，承担着预测任务解决过程中下一步行动的部署计划。它接收输入的问题和已有的解决方案历史，通过精准的预测，确定接下来需要采取的步骤和相应的工具。

在预测过程中主要借鉴了GPT-4使用的"few-shot prompting"技术，无需额外训练就能帮助HUSKY能够通过少量示例快速学习并适应新任务。

完成行动部署后，HUSKY便开始进入执行阶段，通过一些特定的专家模型来执行具体任务。这些专家模型，包括代码生成器、数学推理器、查询生成器和常识推理器，分别对应不同的业务需求，相当于HUSKY的工具箱。

例如，当面临数值计算任务时，代码生成器将生成代码片段，由代码解释器执行；而在需要检索信息时，查询生成器则生成搜索查询，由搜索引擎执行来获取所需知识；需要执行复杂的微积分、几何、代数等复杂难题时，数学推理器便开始执行。

HUSKY不仅体现在单个模块的能力上，更在于模块间的协调与合作。行动生成器需要理解问题需求，预测出合理的行动和工具使用顺序；而专家模型则需精确执行这些行动，并将结果反馈给行动生成器。这种紧密的协作是HUSKY解决复杂问题的关键。

也就是说，HUSKY的行动生成与执行是一个不断迭代、反馈的闭环，在执行的过程中协同工作，不断生成和执行行动，同时更新解决方案状态。

这一迭代过程持续进行，直到行动生成器在解决方案历史中识别出最终答案，HUSKY便达到终端状态并返回最终结果。

研究人员对HUSKY在不同类型推理任务上的进行综合测试，包括数值推理、表格推理、知识基础推理以及混合工具推理任务等。

结果显示，在数值推理任务中，HUSKY展现出了卓越的推理和泛化能力，成功处理了从基础数学问题到高难度的竞赛数学题，涵盖了GSM-8K、MATH、Google DeepMind Mathematics和MathQA等数据集。

在表格推理任务中，HUSKY同样表现出色。成功处理了TabMWP、FinQA、TAT-QA和MultimodalQA等数据集。在HotpotQA、CWQ、Musique、Bamboolge和StrategyQA等数据集上，HUSKY同样展现了卓越的数据检索和查询能力。

本文素材来源HUSKY论文，如有侵权请联系删除

END

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-27

不到100行代码，实现一个简易通用智能LLM Agent

2025-04-27

看不懂GitHub代码？刚刚这个AI工具让全球每个GitHub项目开口说话

2025-04-27

使用MCP构建？注意安全漏洞

2025-04-27

开源大模型工具全景图！Hugging Face、OlmOCR 、Dify，开发者必藏的核心工具选型指南

2025-04-27

LLaMA Factory 框架深度解析

2025-04-26

Spring AI Alibaba搭建机票助手(实战篇)

2025-04-26

我在通用Agent上的探索设计初稿

2025-04-26

Ollama-Deep-Researcher-本地Mac结合魔搭社区模型搭建网页研究助手

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

Ollama 本地运行大模型(LLM)完全指南

2024-07-25

我把最近爆火的 DeepSeek-V3 接到了 Cursor！

2025-01-01

万字详解DeepSeek-R1，引爆AI圈的又一力作，大模型爆发势不可挡！

2025-01-21

太强了！10大开源大模型！

2024-05-06

QWEN2.5开源上新，14B/32B回归实测：这就是最强单卡本地模型！

2024-09-20

全民进入GPT-4时代：OpenAI强势推出GPT-4o mini！彻底取代GPT-3.5！

2024-07-20

如何免费使用 Claude AI？Claude使用指南！

2024-07-11

Qwen2 阿里最强开源大模型（Qwen2-7B）本地部署、API调用和WebUI对话机器人

2024-06-12

开源项目Composio：突破 AI 智能体开发的边界

2024-08-13

DeepSeek-V3 正式发布

2024-12-26

大家都在问

AI大模型火热，将 Hugging Face大模型转换为 GGUF 为何受关注？

2025-04-21

微软最新 Playwright MCP 服务器强势来袭？

2025-04-19

OpenAI开源的Codex CLI是什么？

2025-04-17

MCP，这个AI 开源协议有多大想象空间？

2025-04-15

Google ADK，知多少？

2025-04-13

一文看懂谷歌 A2A：它到底是个啥？为什么能带AI Agent 组队开黑？

2025-04-10

实测Llama 4，究竟是王者归来，还是廉颇老矣？

2025-04-07

4天开发，1700万美元融资：开源的Browser Use为啥这么火？

2025-04-03

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB