微信扫码
添加专属顾问
我要投稿
百聆是强大的开源 AI 语音对话助手,时延低,功能全。这是小贤看到的关于语音助手最好的推荐,没有之一。
核心内容:
1. 百聆的技术核心与功能亮点
2. 百聆适用的多种应用场景
3. 百聆的主要功能及技术原理
百聆(Bailing)是一款开源的语音对话助手,基于语音识别(ASR)、语音活动检测(VAD)、大语言模型(LLM)和语音合成(TTS)技术,能够与用户进行自然的语音对话。百聆的端到端时延低至800ms,无需GPU即可运行,适用于各种边缘设备和低资源环境。
百聆通过模块化设计,支持记忆功能、工具调用和任务管理,提供高质量的语音对话体验。其核心目标是在低资源环境下实现类GPT-4o的对话效果,适用于智能家居、个人助理、车载系统等多种场景。
git clone https://github.com/wwbin2017/bailing.git
cd bailing
pip install -r requirements.txt
config/config.yaml
文件,配置ASR、LLM等相关参数。SenseVoiceSmall
模型到 models/SenseVoiceSmall
目录。deepseek
的 api_key
并配置到项目中。cd server
python server.py # 启动后端服务
python main.py
启动后,系统会等待语音输入,通过FunASR将语音转为文本,silero-vad进行语音活动检测,deepseek生成回复,最后通过edge-tts将文本转换为语音输出。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-05-12
一款辅助Cursor的开源神器,直接在浏览器选中元素调用AI Composer!
2025-05-12
豆包电脑版不讲武德降维打击本地部署AI知识库的开源选手
2025-05-12
JManus - 面向 Java 开发者的开源通用智能体
2025-05-12
阿里直接硬刚Google!
2025-05-12
字节跳动开源扣子coze、飞书工作流引擎!FlowGram.AI
2025-05-12
已经狂揽了15.2k!Cursor 的开源平替 Void 来了!
2025-05-12
微软出手开源 UFO²,系统级自主智能体如何引爆企业级 AI 应用?
2025-05-11
字节大模型应用开发框架 Eino 全解(一)|结合 RAG 知识库案例分析框架生态
2024-07-25
2025-01-01
2025-01-21
2024-05-06
2024-09-20
2024-07-20
2024-07-11
2024-06-12
2024-12-26
2024-08-13
2025-05-12
2025-04-30
2025-04-29
2025-04-28
2025-04-28
2025-04-28
2025-04-21
2025-04-19