微信扫码
与创始人交个朋友
我要投稿
图片识别
今天同事丢给我一张图片格式的思维导图,让我参考思维导图的结构写一个大模型的建设方案,但这张图有些内容不符合我们的实际,需要对这张图做一些修改,可是没有源文件。于是想到了上一篇文章中的方法,把图片丢给GPT-4o,让它给识别并生成markdown格式的文本,然后利用Xmind进行自动生成。
整体还是比较准确的,如下图所示:
读规划图
识别效果挺好,还做了结构化提取。
猜谜语
老婆逛商场时,看到中国黄金在做一个看图猜谜语的活动,于是发给我让我猜。
还是想到了GPT-4o。。。于是丢给它
这是他的分析结果,对不对不知道,反正看起来挺有道理的,我是一个没猜出来。有谁知道吗,可以评论区留个言~
以上都是利用大模型的视觉能力,相当于有了眼睛。
AI写作
前段时间又接到一个任务,写一个大模型应用场景设计思路,整体听下来又是拍脑袋的活儿,没啥意思。按照宝玉老师的分类,普通人日常的写作分三种:日常沟通、公文和创作。公文类就是各种报告、总结、文档等等,这种公文套话多,格式固定,但是费时费力,现在绝大部分公文都可以用 AI 帮助协作了。
这个设计思路也属于这种公文类。还是老套路,整理好提示词,反复尝试几次,同时丢给不同的大模型。
通义的回答:
基于上面的改一改基本就能用了。
几点思考
随着大语言模型逐步像多模态大模型转变,模型拥有更多模态的能力,应用场景会越来越多。
目前AI写作、AI数据分析还是存在局限性,普通人要想用好AI写作,必须结合自己的数据,靠丢几篇文章和提示词很难让大模型写出比较好的效果。比如我毕业这么多年,电脑产生了这么多文件,但这些文件又不方便上传到联网的大模型,如果这个时候我的电脑或手机本地部署了大模型,能直接访问这些文件,把我的整个电脑变成一个知识库,这个知识库随着我的使用,不断更新,成为我的第二大脑,在使用写作类似功能时,部署在本地的大模型可以直接读取我本地的文件,这样大模型写的内容就会像我本人写的,同时又不上传到互联网大厂服务器上。
像Notion这种笔记软件已经有了AI写作功能,但只能访问笔记内的数据,如果能从操作系统层面直接访问本地文件是最好的。由于硬件的限制,现在AI PC部署的大模型能力有限,好消息是小参数量的大模型能力越来越强了,苹果等公司也做了一些探索。AI PC和AI智能手机应该能激发一波购买需求~
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-11-23
Pixtral Large:128K 上下文窗口 + 多模态融合,开启智能新视界!
2024-11-20
基于GPU的ANN检索
2024-11-20
打破文本边界:如何进行多模态RAG评估
2024-11-15
西湖大学&腾讯:一个多模态Web Agent的开源框架
2024-11-13
最复杂多智能体发布!百度推出“秒哒”和文心iRAG
2024-11-12
【RAG&多模态】多模态RAG-ColPali:使用视觉语言模型实现高效的文档检索
2024-11-11
开摆!谷歌AI视频上线!脚本、素材、剪片全稿定!
2024-11-11
文档OCR版式识别,兼顾速度与精度,YOLO当首选
2024-05-30
2024-09-12
2024-06-17
2024-08-06
2024-08-30
2024-04-21
2024-06-26
2024-07-07
2024-06-14
2024-07-21
2024-09-26
2024-09-26
2024-09-01
2024-07-15
2024-07-14
2024-07-10
2024-07-02
2024-06-29