微信扫码
与创始人交个朋友
我要投稿
SpeechLLM 是一种多模态语言模型 (LLM),专门用于分析和预测对话中说话者的元数据。这种先进的模型集成了语音编码器,可将语音信号转换为有意义的语音表示。这些嵌入与文本指令相结合,然后由 LLM 处理以生成预测。
该模型输入16 KHz的语音音频文件,并预测以下内容:
SpeechActivity:音频信号是否包含语音(True/False)
文字记录:音频的 ASR 文字记录
发言者的性别(女/男)
演讲者的年龄(青年/中年/老年)
说话者的口音(非洲/美洲/凯尔特/欧洲/大洋洲/南亚/东南亚)
说话者的情绪(快乐/悲伤/愤怒/无所谓/沮丧)
Github:https://github.com/skit-ai/SpeechLLM
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-09-18
阿里8B模型拿下多页文档理解新SOTA,324个视觉token表示一页,缩减80%
2024-09-16
Mac上运行微软最新Phi-3.5-mini大模型+开发Agent
2024-09-12
GPT-4 和 GPT-4o的主要区别
2024-09-10
使用 Dify 和 AI 大模型理解视频内容:Qwen 2 VL 72B
2024-09-10
语音识别大赛五连冠!开会就能用!
2024-09-09
独家丨科大讯飞多模态:都说端到端好,看谁有本事先做出来
2024-09-08
国内首个多模型AI搜索引擎,专门为AI设计的搜索引擎
2024-09-07
语音驱动嘴型与面部动画生成算法大盘点
2024-06-17
2024-07-11
2024-06-17
2024-08-06
2024-04-21
2024-08-30
2024-06-26
2024-07-11
2024-07-15
2024-07-07
2024-09-01
2024-07-31
2024-07-25
2024-07-19
2024-07-15
2024-07-15
2024-07-14
2024-07-14