导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

Google 推出 Gemini 3.1 Flash TTS,带有用于 AI 语音控制的音频标签

Google 跨开发者平台发布了 Gemini 3.1 Flash TTS,其中包含用于精细语音控制的新音频标签,并支持 70 多种语言。

Google Launches Gemini 3.1 Flash TTS with Audio Tags for AI Voice Control

Google 于 2026 年 4 月 15 日推出了 Gemini 3.1 Flash TTS,使其最具表现力的文本转语音模型可通过 Gemini API 和 Google AI Studio 向开发者提供,企业可通过 Vertex AI 提供,Workspace 用户可通过 Google Vids 提供。

该模型在人工分析 TTS 排行榜上的 Elo 评分为 1,211,该排行榜通过数千次比较来跟踪人类的盲目偏好。该基准测试还将 3.1 Flash TTS 置于“最具吸引力的象限”中,用于平衡语音质量与成本,这一指标对于大规模运行语音应用程序的公司来说非常重要。

音频标签改变游戏

这里最突出的功能是音频标签。开发人员现在可以将自然语言命令直接嵌入到文本输入中,以控制声音风格、节奏和句子中的表达。可以将其视为通过脚本注释指导配音演员,而不是录制多个镜头。

Google AI Studio 现在提供该公司所谓的“导演椅”设置,其中包含三个主要控件。场景方向让开发人员可以定义环境上下文,以便 AI 声音在对话过程中保持角色特征。扬声器级别设置允许投射具有特定节奏、音调和重音参数的独特音频配置文件。内联标签可以即时覆盖这些设置,这对于单行内的情感转变很有用。

一旦配置在 Playground 中发挥作用,开发人员就可以将它们导出为 Gemini API 代码,以便跨平台进行一致的部署。

覆盖全球 70 多种语言

该模型支持 70 多种语言,并具有与英语相同的风格和重音控制。对于构建本地化语音体验的公司来说,这意味着一次 API 调用就可以处理从圣保罗到首尔的市场,而无需牺牲表达能力。

内置原生多扬声器对话,无需将单独的语音生成拼接在一起进行对话。早期测试人员强调这对于有声读物制作和交互式内容特别有用。

内置 SynthID 水印

每个音频输出都带有 SynthID 水印,这是一种融入音频的难以察觉的签名,可以检测人工智能生成的内容。谷歌将其定位为错误信息保护措施,尽管它也为担心内容真实性的企业提供来源跟踪。

此次发布是继 Google 在 3 月份发布 Gemini 3.1 系列之后发布的。 Flash-Lite 于 3 月 3 日上市,针对低延迟、大容量应用程序。 Flash Live 于 3 月 26 日发布,具有双向音频流和实时语音代理的中断处理功能。

开发者可以立即在 Google AI Studio Playground 中开始测试,并通过 Vertex AI 控制台进行企业访问。获得“有吸引力的象限”称号的定价结构表明,Google 正在将其定位于生产工作负载,而不仅仅是实验。