# 低延迟语音处理

Ultravox V0 3
MIT
Ultravox 是一个基于 Llama3.1-8B-Instruct 和 Whisper-small 的多模态语音大语言模型,能够同时处理语音和文本输入。
音频生成文本 Transformers 英语
U
FriendliAI
20
1
Ultravox V0 5 Llama 3 3 70b
MIT
Ultravox是基于Llama3.3-70B和Whisper构建的多模态语音大语言模型,支持语音和文本输入,适用于语音代理、翻译等场景。
音频生成文本 Transformers 支持多种语言
U
fixie-ai
3,817
26
Ultravox V0 4 1 Llama 3 3 70b
MIT
Ultravox是一个基于Llama3.3-70B-Instruct和whisper-large-v3-turbo构建的多模态语音大语言模型,能够同时处理语音和文本输入。
音频生成文本 Transformers 支持多种语言
U
fixie-ai
26
10
Ultravox V0 4 1 Mistral Nemo
MIT
Ultravox 是一个基于 Mistral-Nemo 和 Whisper 的多模态模型,可同时处理语音和文本输入,适用于语音代理、语音翻译等任务。
音频生成文本 Transformers 支持多种语言
U
fixie-ai
1,285
25
Ultravox V0 4
MIT
Ultravox 是一款基于 Llama3.1-8B-Instruct 和 Whisper-medium 的多模态语音大语言模型,能够同时处理语音和文本输入。
音频生成文本 Transformers 支持多种语言
U
fixie-ai
1,851
48
Ultravox V0 3
MIT
Ultravox 是一个基于 Llama3.1-8B-Instruct 和 Whisper-small 构建的多模态语音大语言模型,能够同时处理语音和文本输入。
文本生成音频 Transformers 英语
U
fixie-ai
48.30k
17
Postmalone
一个用于实时语音转换的模型,能够实现高质量的语音风格转换
语音合成 Transformers
P
sail-rvc
1,679
1
Ai Light Dance Stepmania Ft Wav2vec2 Large Xlsr 53 V1
Apache-2.0
该模型是基于wav2vec2-large-xlsr-53在GARY109/AI_LIGHT_DANCE - ONSET-STEPMANIA2数据集上微调得到的自动语音识别模型。
语音识别 Transformers
A
gary109
48
0
AIbase
智启未来,您的人工智能解决方案智库
© 2025AIbase