SOURCE // NEWS

阿里发布CosyVoice Studio:国内首个一站式AI语音Agent平台

阿里发布CosyVoice Studio:国内首个一站式AI语音Agent平台

8月7日,阿里巴巴正式推出国内首个一站式AI语音生产力平台CosyVoice Studio。该平台基于自研语音大模型Qwen-Audio打造。在全球权威AI评测平台Artificial Analysis上,该模型斩获语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一。#CosyVoice Studio集成了语音键盘、音频创作工具以及语音智能体三大核心功能,全面满足企业与个人用户的多维语音需求。

随着大模型技术的演进,人机交互正从文字输入向端到端语音Agent转变。CosyVoice语音键盘在传统语音转文字(ASR)的基础上,深度集成了语义理解与文本生成能力。在日常交流中,它能自动过滤口语填充词并纠正口误,实现结构化文本输出。在专业场景下,它支持数字、公式等特殊文本的智能转写,并提供“随记”模式,支持长达6小时的持续录音、多发言人声纹识别及自动章节生成,大幅提升会议与访谈效率。

作为平台的出彩功能,CosyAgent是一款低门槛的AI Agent搭建工具。企业或个人用户通过自然语言,即可快速创建具备企业专属知识库、工具调用(Tool Calling)和实时语音对话能力的智能体,并支持Prompt与Workflow的深度配置,完美契合智能客服、电话营销等企业级业务场景。

此外,音频内容创作工具CosyCreative内置上千种高仿真音色并支持声音复刻。用户只需输入文档、网页链接或单句文本,即可快速生成多角色对话播客或有声书。目前,CosyVoice客户端已在全平台上线并提供免费使用,而CosyAgent和CosyCreative则采取白名单邀请制向企业用户开放。

AgentUpdate 深度解析

阿里此次推出 CosyVoice Studio,标志着 AI 语音技术从传统的单点感知(转写、合成)正式迈向认知级“端到端语音 Agent”阶段。相比于 OpenAI GPT-4o 的语音交互,阿里通过引入工作流(Workflow)深度配置与工具调用,试图在 B 端落地场景中建立差异化优势。语音 Agent 的核心痛点在于高并发下的超低延迟与上下文语义理解,CosyVoice 基于 #Qwen-Audio 的多模态能力,有效降低了声音处理与文本推理之间的“双阶段延迟”。长远来看,该平台的推出将极大加速车载、智能家居以及企业客服等场景的 Agent 化进程。当语音交互不再局限于简单的指令接收,而是具备反向推理与复杂工具链调用能力时,真正的无感知人机协同时代也将加速到来。