我要投稿

最近用大模型的几点感想~

发布日期：2024-09-01 18:06:15 浏览次数： 1888 作者：CC的个人笔记

图片识别

今天同事丢给我一张图片格式的思维导图，让我参考思维导图的结构写一个大模型的建设方案，但这张图有些内容不符合我们的实际，需要对这张图做一些修改，可是没有源文件。于是想到了上一篇文章中的方法，把图片丢给GPT-4o,让它给识别并生成markdown格式的文本，然后利用Xmind进行自动生成。

整体还是比较准确的，如下图所示：

读规划图

识别效果挺好，还做了结构化提取。

猜谜语

老婆逛商场时，看到中国黄金在做一个看图猜谜语的活动，于是发给我让我猜。

还是想到了GPT-4o。。。于是丢给它

这是他的分析结果，对不对不知道，反正看起来挺有道理的，我是一个没猜出来。有谁知道吗，可以评论区留个言~

以上都是利用大模型的视觉能力，相当于有了眼睛。

AI写作

前段时间又接到一个任务，写一个大模型应用场景设计思路，整体听下来又是拍脑袋的活儿，没啥意思。按照宝玉老师的分类，普通人日常的写作分三种：日常沟通、公文和创作。公文类就是各种报告、总结、文档等等，这种公文套话多，格式固定，但是费时费力，现在绝大部分公文都可以用 AI 帮助协作了。

这个设计思路也属于这种公文类。还是老套路，整理好提示词，反复尝试几次，同时丢给不同的大模型。

通义的回答：

基于上面的改一改基本就能用了。

几点思考

随着大语言模型逐步像多模态大模型转变，模型拥有更多模态的能力，应用场景会越来越多。

目前AI写作、AI数据分析还是存在局限性，普通人要想用好AI写作，必须结合自己的数据，靠丢几篇文章和提示词很难让大模型写出比较好的效果。比如我毕业这么多年，电脑产生了这么多文件，但这些文件又不方便上传到联网的大模型，如果这个时候我的电脑或手机本地部署了大模型，能直接访问这些文件，把我的整个电脑变成一个知识库，这个知识库随着我的使用，不断更新，成为我的第二大脑，在使用写作类似功能时，部署在本地的大模型可以直接读取我本地的文件，这样大模型写的内容就会像我本人写的，同时又不上传到互联网大厂服务器上。

像Notion这种笔记软件已经有了AI写作功能，但只能访问笔记内的数据，如果能从操作系统层面直接访问本地文件是最好的。由于硬件的限制，现在AI PC部署的大模型能力有限，好消息是小参数量的大模型能力越来越强了，苹果等公司也做了一些探索。AI PC和AI智能手机应该能激发一波购买需求~