Google 跨开发者平台发布了 Gemini 3.1 Flash TTS,其中包含用于精细语音控制的新音频标签,并支持 70 多种语言。
Google 于 2026 年 4 月 15 日推出了 Gemini 3.1 Flash TTS,使其最具表现力的文本转语音模型可通过 Gemini API 和 Google AI Studio 向开发者提供,企业可通过 Vertex AI 提供,Workspace 用户可通过 Google Vids 提供。
该模型在人工分析 TTS 排行榜上的 Elo 评分为 1,211,该排行榜通过数千次比较来跟踪人类的盲目偏好。该基准测试还将 3.1 Flash TTS 置于“最具吸引力的象限”中,用于平衡语音质量与成本,这一指标对于大规模运行语音应用程序的公司来说非常重要。
音频标签改变游戏
这里最突出的功能是音频标签。开发人员现在可以将自然语言命令直接嵌入到文本输入中,以控制声音风格、节奏和句子中的表达。可以将其视为通过脚本注释指导配音演员,而不是录制多个镜头。
Google AI Studio 现在提供该公司所谓的“导演椅”设置,其中包含三个主要控件。场景方向让开发人员可以定义环境上下文,以便 AI 声音在对话过程中保持角色特征。扬声器级别设置允许投射具有特定节奏、音调和重音参数的独特音频配置文件。内联标签可以即时覆盖这些设置,这对于单行内的情感转变很有用。
一旦配置在 Playground 中发挥作用,开发人员就可以将它们导出为 Gemini API 代码,以便跨平台进行一致的部署。
覆盖全球 70 多种语言
该模型支持 70 多种语言,并具有与英语相同的风格和重音控制。对于构建本地化语音体验的公司来说,这意味着一次 API 调用就可以处理从圣保罗到首尔的市场,而无需牺牲表达能力。
内置原生多扬声器对话,无需将单独的语音生成拼接在一起进行对话。早期测试人员强调这对于有声读物制作和交互式内容特别有用。
内置 SynthID 水印
每个音频输出都带有 SynthID 水印,这是一种融入音频的难以察觉的签名,可以检测人工智能生成的内容。谷歌将其定位为错误信息保护措施,尽管它也为担心内容真实性的企业提供来源跟踪。
此次发布是继 Google 在 3 月份发布 Gemini 3.1 系列之后发布的。 Flash-Lite 于 3 月 3 日上市,针对低延迟、大容量应用程序。 Flash Live 于 3 月 26 日发布,具有双向音频流和实时语音代理的中断处理功能。
开发者可以立即在 Google AI Studio Playground 中开始测试,并通过 Vertex AI 控制台进行企业访问。获得“有吸引力的象限”称号的定价结构表明,Google 正在将其定位于生产工作负载,而不仅仅是实验。
