我要投稿

开源的语音识别模型总结

发布日期：2024-08-26 18:17:23 浏览次数： 5466 作者：技术视野

开源的语音识别模型总结：

Whisper：

特点：Whisper 是由 OpenAI 开发的通用语音识别模型（ASR），具有高达 95% 的准确率，能够执行多语言语音识别、语音翻译和语言识别。它在大量多样化的音频数据集上进行训练，具有惊人的准确性。
使用：Whisper 已经被 OpenAI 开源，可以在 Google Colab 中运行，也可以在本地使用 x86 架构的计算机运行。对于 Windows 用户，可以下载编译好的 WhisperDesktop.zip 图形界面版使用。
开源链接：https://github.com/openai/whisper.git

SenseVoice：

特点：SenseVoice 是阿里云通义千问开源的语音基座模型，专注于高精度多语言语音识别、情感辨识和音频事件检测。它支持超过 50 种语言，识别效果优于 Whisper 模型，推理延迟极低。
使用：SenseVoice 提供了便捷的微调脚本与策略，方便用户根据业务场景修复长尾样本问题。支持多并发请求，支持的客户端语言有 Python、C++、HTML、Java 与 C# 等。
阿里巴巴通义实验室开源FunAudioLLM，革新人机语音交互
开源链接：https://github.com/FunAudioLLM/SenseVoice

Vosk：

特点：Vosk 是最紧凑、最轻量级的语音转文本引擎之一，可以在多种设备上离线运行，包括 Android、iOS 和 Raspberry Pi。它支持 20 多种语言或方言，包括英语、中文、葡萄牙语、波兰语、德语等。
使用：Vosk 提供了小型语言模型，不占用太多空间，响应速度快，可以连续将语音转换为文本。
开源链接：https://alphacephei.com/vosk/index.zh

Athena：

特点：Athena 是一个基于序列到序列的语音转文本开源引擎，适合研究人员和开发人员的端到端语音处理需求。模型可以处理自动语音识别（ASR）、语音合成、语音检测和关键字定位等任务。
使用：Athena 所有语言模型都基于 TensorFlow 实现，不依赖于 Kaldi，有自己的 Python 特征提取器。
开源链接：https://github.com/athena-team/athena

ESPnet：

特点：ESPnet 是一个基于 Apache 2.0 许可证发布的开源语音转文本软件，提供端到端语音处理功能，涵盖 ASR、翻译、语音合成、增强和日志化等任务。它采用 Pytorch 作为其深度学习框架，并遵循 Kaldi 数据处理风格。
使用：ESPnet 支持多语言，可以将其与现成的预训练模型一起使用，或根据需求创建自己的模型。
开源链接：https://gitee.com/nanbowang/masr

Tensorflow ASR：

特点：Tensorflow ASR 是一个使用 TensorFlow 2.0 作为深度学习框架来实现各种语音处理的语音转文本开源引擎。它支持使用特定的模型，如 Conformer、ContextNet、DeepSpeech2 和 Jasper 。
使用：Tensorflow ASR 在处理语音转文本时，语言模型具备较高准确性和效率。可以将模型转换为 TFlite 格式，使其轻量且易于部署。
开源链接：https://github.com/TensorSpeech/TensorFlowASR

MASR：

特点：MASR 是一个中文语音识别项目，使用门控卷积神经网络（Gated Convolutional Network），网络结构类似于 Facebook 在 2016 年提出的 Wav2letter。MASR 提供的预训练模型的识别效果是个人开源项目中最好的。
使用：MASR 使用起来相对容易，适合个人项目和研究使用。
开源链接：https://github.com/espnet/espnet

除此之外，例如paddlepaddle,paraformer以及modelscope平台上的一些直接可用的语音识别模型都可以使用。

综合使用体验来看，各有优缺点，具体要根据每个人的需求来判断，我自己最常使用的是senseVoice 和Whisper的结合。SenseVoce有时无法识别，就利用Whisper 做修正。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-17

OpenAI Codex CLI: 终端中的智能编码助手

2025-04-17

无需运维！Dify+Ollama 点选式搭建DeepSeek大模型，太绝了!!!

2025-04-17

OpenAI发布o3与o4-mini，还开源两个项目

2025-04-17

OpenAI开源的Codex CLI是什么？

2025-04-17

社区供稿 | 3700 次预训练总结超参规律，开源海量实验，告别盲猜

2025-04-17

好用的开源Agent框架概览与比较分析

2025-04-17

OpenAI开源超火Agent，5小时破5000颗星，霸榜Github

2025-04-17

复刻小智AI，ESP32-S3搭建Arduino+ESP-SR+ESP-TTS开发环境踩坑记录

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

我把最近爆火的 DeepSeek-V3 接到了 Cursor！

2025-01-01

Ollama 本地运行大模型(LLM)完全指南

2024-07-25

万字详解DeepSeek-R1，引爆AI圈的又一力作，大模型爆发势不可挡！

2025-01-21

太强了！10大开源大模型！

2024-05-06

QWEN2.5开源上新，14B/32B回归实测：这就是最强单卡本地模型！

2024-09-20

全民进入GPT-4时代：OpenAI强势推出GPT-4o mini！彻底取代GPT-3.5！

2024-07-20

Qwen2 阿里最强开源大模型（Qwen2-7B）本地部署、API调用和WebUI对话机器人

2024-06-12

如何免费使用 Claude AI？Claude使用指南！

2024-07-11

开源项目Composio：突破 AI 智能体开发的边界

2024-08-13

DeepSeek-V3 正式发布

2024-12-26

大家都在问

OpenAI开源的Codex CLI是什么？

2025-04-17

MCP，这个AI 开源协议有多大想象空间？

2025-04-15

Google ADK，知多少？

2025-04-13

一文看懂谷歌 A2A：它到底是个啥？为什么能带AI Agent 组队开黑？

2025-04-10

实测Llama 4，究竟是王者归来，还是廉颇老矣？

2025-04-07

4天开发，1700万美元融资：开源的Browser Use为啥这么火？

2025-04-03

为什么大模型本地部署后“没了下文”？

2025-04-03

阿里搞了个大新闻！这AI能听会看还会实时唠嗑，科幻片都不敢这么拍？

2025-04-03

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

友情链接：

CopyRight © 2012-2024 深圳市博思协创网络科技有限公司版权所有

粤ICP备17114055号

广州：广州市华景路37号(华景软件园)暨南大学科技大厦6楼（整层）

深圳：深圳市福田区泰然四路29号天安创新科技广场一期A座1204

上海：上海市浦东新区金新路58号1602室

微信扫码
和创始人交个朋友

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部