我要投稿

商汤大模型的「5o」交互，普通人如何和 AI 过一天？

发布日期：2024-07-10 17:53:48 浏览次数： 2403 作者：AI科技评论

与真实世界的实时交互，是推动 AI 2.0 时代超级时刻和应用爆发的一个核心。

在刚刚结束的堪称「AI 界春晚」的世界人工智能大会（WAIC 2024）上，「中国版GPT-4o」亮相，它是来自商汤科技发布的“日日新5o”——国内首个「流式交互」多模态大模型。

在商汤的演示下，日日新5o拥有像人一样的实时视觉能力，可以跟人进行流畅的视频交互——能听、能说、能看、无延时，它可以通过摄像头+语音实现和用户的实时交互，并获知用户所在的真实场景下的各种状态信息，打破了与AI交互的次元壁，实现了与AI的“视频通话”，已经具备真人聊天般的交互体验。

两个月前OpenAI推出了GPT-4o，以突破性的智能交互能力，彻底颠覆了我们对AI语音助手的认知，颠覆了过去的人机交互，给业界带来又一次震撼。

震撼之外，中国大模型界对GPT-4o的认知似乎并不如GPT-4那么统一，有人认为「在实现AGI的路上，GPT-4o并不重要」、有人评价「在技术突破上，GPT-4o没那么惊艳」；有人认为GPT-4o的发布是 AI 2.0 时代的标志性事件，会催生全新的应用平台和商业模式。

带来的共识是，多模态可能引领新的交互模式和产品创新，多模态大模型开始成为国内大模型竞争的下一个焦点。

然而，在国内GPT-4o似乎并未成为引领多模态竞争的产品形态时，两个月后商汤率先推出了「中国版GPT-4o」日日新5o大模型，商汤用行动力证明了对GPT-4o的判断。

正如商汤 CEO 徐立在WAIC 2024上所讲的：「行业要变化，交互模式一定是先行的」，解释了商汤为什么要做「中国版GPT-4o」，首创流式交互大模型。

大模型可以是每个人的

贴身AI全能助手

如果你拥有一个能看（现实世界）、能听（读懂指令）、能说（回答问题）的贴身 AI 助手，将会是一种什么体验？

这位贴身助手，拥有丰富的多领域知识，包括生活、学习、工作各方面的知识，关键还能看懂现实世界——摄像头就是它获取现实世界影像的眼睛，而视觉触及到的信息，它能立马进行分析、总结，通过实时对话，像面对面聊天一样，立即告诉你问题的答案，没有延迟和拒绝。

早上起来，准备出门，你想知道现在外面的天气应该做哪些准备，日日新5o可以准确地描述出外面的天气状况，并给出外出准备的建议：

走到一处很美的地方，你想拍照，但是不知道用什么姿势拍出来好看，日日新5o开始充当一个摄影助手，它会指导你如何根据当前景色摆姿势动作、注意光线等等技巧：

晚饭是一顿烧烤，大家一起搭起炭火炉、燃起炭火准备烧烤，日日新5o能准确地知道视频里的人们正在干嘛，而且还能告诉详细的户外烧烤注意事项：

你想知道每种食材分别要如何烧烤才好吃，此时日日新5o化身为一名拥有多年烹饪经验的烧烤大师，它能分辨出每种食材、要如何烤：

回到酒店，你看到一袋咖啡，询问日日新5o后它能识别出这是咖啡粉而不是速溶咖啡，并告诉你咖啡粉对应的冲泡步骤，宛如一个咖啡师：

日日新5o不仅拥有大量、多领域的生活方面的知识，在日常生活场景中分别充当了发型助手、摄影师、烧烤大师、咖啡师……在职场工作环境中，也是一把好手，比如能迅速地总结出这本书该页讲了什么知识。比人的反应、分析、总结速度快多了：

面对一张手写的字条或诗句，它也能立马回答出它的意思和出处：

还能根据前三个字，准确预测出整个成语是什么：

从以上可以看到，日日新5o具备非常丰富的多领域知识，相比其他AI助手，它能看、能听、能读，首创的实时流式交互方式，使其具备真人般的交流对话；能精准地分析、辨别、总结出所「看到」的环境信息，在我们的生活、学习、工作中可以扮演多种助手角色，完全可以充当一款 AI 全能助手。

重塑交互的意义

日日新5o能作为一款表现出色的 AI 全能助手，除了展示出了它对标GPT-4o的各种能力：能看到那个现实世界，包括人、物、文字等符号；能听懂用户的话语，并根据其中的指令对现实世界进行识别，再反馈给用户；能看书识字，概括总结所讲的内容……

最大的变革就是交互模式的变化：国内首个流式交互多模态大模型。商汤将流式交互融入到大模型中，给用户带来真人般的交流体验，让日日新5o系统更像人。

我们知道，在人工智能发展中，ChatGPT之所一炮而红，便是因为它开始展露出人类所具备的自主学习、分析、总结能力以及逻辑能力，而让大模型像人一样交流，正如引言所说，交互模式先行似乎并不是业界共识。

而商汤的日日新5o的发布，正是符合商汤对AI 2.0时代的判断，正如CEO徐立所说：行业要变化，交互模式一定是先行的。

在徐立看来，变化是指能定义AI 2.0时代的「超级时刻」，正如iPhone时刻定义了移动互联网的变化。而超级时刻需要一个超级应用，即便是像ChatGPT、Sora都还没有到超级时刻，是因为它们没有真正走进到一个行业的垂直应用中、引起广泛变化。

走向应用，商汤认为需要有几个核心的重点突破：

第一个就是实时的交互性能带来流畅的用户体验，这是推动超级时刻以及应用爆发的一个核心。

第二是构建高阶思维逻辑的合成数据，来提升模型的智力。

最后，不管是文本、图像、视频，如果对它没有可控性，那么它们作为一个工具，本身带来的效能提升就非常有限。

大模型本质上是做记忆的事情，记住世界的知识，就能回答的更准确，在徐立看来，它仅有的一点智力来自于对知识背后的高阶的思维逻辑的记忆，所以，在垂直行业里面怎么构造高阶思维逻辑的合成数据，往往是制胜的关键，并且是差异化的关键，也是中国人工智能之路的关键。

商汤最新发布的日日新5.5基座模型，便用了大量的合成、高阶思维链的数据，把模型能力平均提升了30%。

商汤CEO徐立认为，如果要推动人工智能超级时刻的到来，需要大模型可以展现出卓越的深度思考的能力。那么合成的人工数据，特别是高阶思维的数据往往是非常重要的。所以越是有应用的场景，才能形成更好的高质量的数据的一些核心。

过去垂直领域是依赖人去构建更加高级的思维链数据，但是商汤认为，往前一步，不应该依赖人，而是应该通过跟真实世界的交互形成执行数据，去做推理。

因此，基于基座模型日日新5.5，商汤研发了日日新5o流式交互多模态大模型，在摄像头不停地移动过程中、跟真实世界互动获取更多新的信息，去进行推理、再得出反馈。

日日新5o的各种功能离不开基座模型日日新5.5的支撑。今年4月发布的日日新5.0是国内首个对标GPT-4 Turbo的大模型，经过两个多月技术迭代，日日新5.5实现了多项功能升级，在数学推理、英文能力、指令跟随等能力上明显增强，交互效果和多项核心指标可比肩GPT-4o。

徐立认为，如果能把这种流式交互多模态大模型置入眼镜、手机、电脑等端侧设备，可能会推动一些应用的爆发。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-14

DupDub 插件登陆 Dify Marketplace，带来强大的音频 AI 能力

2025-04-14

Google Gemini 2.0 网页抓取真丝滑

2025-04-14

关于 GTP-4o 图片生成的10个赚钱方向

2025-04-14

Gemma3+Mistral-OCR+RAG：实现多模态文档问答系统

2025-04-11

成功率提高7倍！新方法一句话就能让AI秒出分子设计+合成步骤

2025-04-11

多模态视觉理解大模型推理优化

2025-04-09

99%的人不知道Claude的一句话生成SVG图片功能

2025-04-08

AI数字人领域重大突破：告别拼凑式合成，阿里OmniTalker能否开启音视频一体化新时代？

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

GPT-4 和 GPT-4o的主要区别

2024-09-12

ChatGPT记忆功能全解析：实用场景与操作指南

2024-06-14

面壁小钢炮 MiniCPM-V 2.6 部署指南

2024-08-06

Flowise AI 工作流进阶: 常用组件介绍+连 Notion 做知识库

2024-06-17

Qwen2-VL 全链路模型体验、下载、推理、微调实战！

2024-08-30

智谱开源新一代多模态大模型CogVLM2，性能媲美GPT-4V

2024-05-30

一文了解：最新版本 Llama 3.2

2024-10-07

周鸿祎发布纳米搜索，做世界第一的AI搜索

2024-11-28

深度解析Swarm Agent ：OpenAI 开源的多智能体协作框架

2024-10-16

深入解析Llama 3：开发者如何充分利用这一开源大模型

2024-04-21

大家都在问

AI数字人领域重大突破：告别拼凑式合成，阿里OmniTalker能否开启音视频一体化新时代？

2025-04-08

Midjourney V7全面测评：50组多风格提示词实测，是否还有领先优势?

2025-04-05

如何结合多模态RAG和异步调用实现大模型内容理解？

2025-03-30

Chat GPT文生图不用DALL·E模型了？

2025-03-26

如何构建多模态AI知识库？

2025-03-05

我为什么要卸载DeepSeek ？

2025-03-02

千问又放大招！720亿参数的视觉语言模型什么样？

2025-01-08

为什么生成式AI不擅长同时做两件事？

2024-12-13

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB