微信扫码
与创始人交个朋友
我要投稿
开发者Matt Palmer最近分享了一个演示:在浏览器中直接运行Whisper模型,无需任何API调用。
在Matt分享的视频中,我们可以看到Whisper模型在浏览器环境下流畅运行,实时将语音转换为文字。
这种本地化的AI处理方式不仅提高了响应速度,还避免了数据传输过程中可能存在的隐私风险。
Matt特别感谢了@xenovacom和@huggingface提供的transformersjs库,这个强大的工具使得在浏览器中运行复杂的AI模型成为可能。
transformersjs是Hugging Face团队开发的JavaScript库,它允许开发者在浏览器或Node.js环境中使用各种预训练模型,包括Whisper这样的语音识别模型。
但故事并未就此结束。@_akhaliq补充道,开发者还可以结合Gradio lite和transformers js来构建更复杂的应用。Gradio lite是一个轻量级的库,允许开发者快速创建基于机器学习模型的交互式Web应用。
这种组合为开发者提供了一个强大的工具集:
无服务器部署:应用可以完全在客户端运行,无需后端服务器。
灵活的UI设计:Gradio提供了简洁的API来设计用户界面。
多样化的模型支持:不仅限于语音识别,还可以轻松集成图像分类、文本分析等多种AI任务。
对于想要尝试这项技术的开发者,可以参考Gradio官方提供的指南。以下是一个简单的示例代码:
import gradio as gr
from transformers_js_py import pipeline
pipe = await pipeline('sentiment-analysis')
demo = gr.Interface.from_pipeline(pipe)
demo.launch()
这段代码展示了如何在浏览器中创建一个情感分析应用。通过修改pipeline的类型,开发者可以轻松切换到其他AI任务,如图像分类或语音识别。
这也标志着AI应用开发正在向着更加轻量化、隐私友好的方向发展。
它不仅降低了开发和部署的门槛,还为终端用户提供了更快速、更安全的AI体验。
随着浏览器性能的不断提升和Web技术的持续进步,以及AI 模型不断瘦身,前端开发也可以本地玩转AI 大模型了!
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-11-23
Pixtral Large:128K 上下文窗口 + 多模态融合,开启智能新视界!
2024-11-20
基于GPU的ANN检索
2024-11-20
打破文本边界:如何进行多模态RAG评估
2024-11-15
西湖大学&腾讯:一个多模态Web Agent的开源框架
2024-11-13
最复杂多智能体发布!百度推出“秒哒”和文心iRAG
2024-11-12
【RAG&多模态】多模态RAG-ColPali:使用视觉语言模型实现高效的文档检索
2024-11-11
开摆!谷歌AI视频上线!脚本、素材、剪片全稿定!
2024-11-11
文档OCR版式识别,兼顾速度与精度,YOLO当首选
2024-05-30
2024-09-12
2024-06-17
2024-08-06
2024-08-30
2024-04-21
2024-06-26
2024-07-07
2024-06-14
2024-07-21
2024-09-26
2024-09-26
2024-09-01
2024-07-15
2024-07-14
2024-07-10
2024-07-02
2024-06-29