Speech
由 NVIDIA-NeMo 研发
NVIDIA NeMo Speech 是专为语音研究与 PyTorch 开发者打造的开源工具包,专注于语音识别 (ASR)、语音合成 (TTS) 和语音大语言模型 (Speech LLM)。它基于 PyTorch 构建,旨在帮助用户高效创建、定制并部署语音 AI 模型。NeMo Speech 提供丰富的预训练模型(如 Nemotron 和 MagpieTTS),支持极低延迟的流式推理与多语言处理,并与 NVIDIA GPU 生态深度集成以实现高性能加速。
- 语音识别与合成 (ASR & TTS)
- 语音大语言模型 (Speech LLM) 研发
- 低延迟流式推理能力
- 多语言与多模态支持
- NVIDIA GPU 与 CUDA 深度加速
desktopweb