SOURCE // NEWS

谷歌发布Gemini 3.8音频模型,支持用提示词定制专属人声

谷歌发布Gemini 3.8音频模型,支持用提示词定制专属人声

谷歌近日推出了两款全新的文本转语音模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。这两款新模型将语音生成技术从静态预设升级为动态的创意工作室。它们旨在帮助创作者、开发者和企业构建更丰富、更具表现力的音频体验,同时在 Gemini Notebook 和 Google Vids 等谷歌生态产品中实现更好的用户互动。

Gemini 3.8 Flash TTS 专为深度创意指导和角色设计而生。通过自然语言提示词,用户可以从零开始创建全新的声音,非常适合游戏角色配音、沉浸式有声书、播客以及互动式媒体。开发者不仅可以控制台词表现,还能对表演指令、语速、方言转换和语气停顿进行像素级的精细微调。

而另一款模型 Gemini 3.8 Flash-Lite TTS 则专为高吞吐量和极致性价比而优化。它非常适合大规模视频配音、音频内容创作,以及对语气、语速有精细要求的表现型语音智能体(Voice Agents)。这些新成员加入了快速壮大的 #Gemini 音频家族,在此之前,该家族已拥有 3.5 Live Translate、3.5 Transcribe 和 3.8 Live 等先进模型。

依托这些新模型,声音库的丰富度已从原有的 30 种预设声音跨越到无限的可能。在 Gemini 3.8 Flash TTS 的支持下,用户不仅可以创建独特的品牌代言人,还能在支持的 100 多种语言和方言中定制角色。无论是为一只戏剧化的喷火巨龙定制低沉咆哮,还是为带有地方口音的旁白设计独特腔调,都可以通过简单的文字描述轻松实现。

AgentUpdate 深度解析

Gemini 3.8 #TTS 模型的发布,标志着 AI 语音交互正在从“机械的信息播报”向“具备情感共鸣的拟真智能体”跨越。相较于 ElevenLabs 或 OpenAI 的同类技术,谷歌将自然语言 Prompt 深度融入人声设计,赋予了开发者前所未有的控制自由度。对 AI Agent 生态而言,多模态实时交互的核心痛点一直在于拟真度与情绪张力。3.8 Flash 系列所提供的精细方言、语气和情绪微调,将使未来的语音智能体具备更强的“呼吸感”和场景融入能力。这将极大降低高品质虚拟人、智能客服及交互式游戏 NPC 的开发门槛,加速智能体在垂直商业场景中的真实落地。