G v2 来了:更快、更富表现力的 AI 语音,还支持音频标签

我们将 G v1 升级为 G v2——这是我们在 AI 语音质量上迄今为止最大的一次飞跃。G v2 由 Google 全新的 Gemini 3.1 Flash TTS 模型驱动,取代了初代版本背后的 Gemini 2.5 Flash 和 Pro 引擎。带来的结果是:语音更自然、更富表现力,语言覆盖范围大幅拓宽,并且新增了一种逐字引导朗读的方式。
最棒的是,你的使用方式完全不变。在提供商切换开关里选择 G v2,挑一个音色,然后生成即可——你现有的积分照常使用,毫无差别。
G v2 的全新功能
一个更出色的单一模型
G v1 运行在两个层级上——更快的 Flash 模型和质量更高的 Pro 模型。G v2 将一切整合到了 Gemini 3.1 Flash TTS 上,这是一款专门打造的语音引擎,能以 Flash 级别的速度交付 Pro 级别的质量。在独立的 Artificial Analysis TTS 排行榜上——该榜单汇集了数千次盲测人类听感偏好——它跻身于目前最自然的模型之列。一个模型,低延迟,顶级输出。
实现逐字控制的音频标签
这是本次的重磅功能。除了你已经熟悉的纯英文朗读指令外,G v2 还能理解内联音频标签——这些用方括号括起来的提示可以直接插入文本中,在句子中途引导朗读:
Welcome back! [excited] You won't believe what happened next. [whispers] It was completely silent... [laughs]
标签涵盖情绪([excited]、[curious]、[frustrated])、节奏([slow]、[fast]、[long pause])以及非语言声音([laughs]、[sighs]、[whispers])。这里没有固定的清单——模型会尽力解读你放进方括号里的任何内容,所以你可以随脚本所需尽情发挥创意。
70 多种语言
G v2 支持 70 多种语言及地区变体——覆盖范围几乎是 G v1 的三倍。它甚至能在同一段文字中处理多语言切换,并为棘手的技术术语提供发音指引,让多语言和混合语言内容无需手动拼接也能听起来恰到好处。
更出色的多人对话
多人模式依然保留,并且比以往更出色。为每位说话者分配不同的音色,一次性生成自然的双人对话——非常适合播客、访谈和故事。G v2 能让每个角色的音色保持一致,并且在轮流发言的衔接上比以前更自然。
如何使用 G v2
- 切换到 G v2——在右侧面板的提供商切换开关中(紧挨着 AZ v1)点击 G v2 按钮。
- 选择模式——旁白用单人模式,对话用多人模式。
- 挑选音色——浏览、按名称或风格搜索并选择。在多人模式下,为每位说话者分配一个音色。
- 添加引导(可选)——写一条纯英文朗读指令、插入内联音频标签,或两者并用。
- 生成——几秒钟内即可得到你的音频。
价格保持不变
G v2 沿用你现有的积分余额,每字符 2 积分——与 G v1 相比毫无变化。免费账户每月包含 10,000 积分,而且你的积分在 G v2 和 AZ v1 上通用,所以你可以按项目需要混用不同引擎。
G v2 与 AZ v1:何时该用哪个
两个引擎都依然完整可用:
- 选择 G v2:当你需要自然、富有表现力的旁白、多人对话、用音频标签实现逐字控制,或者广泛的多语言覆盖时。
- 选择 AZ v1:当你需要 500 多种音色或 SSML 级别的控制时。
立即开始
G v2 现已面向所有注册用户上线。前往 simpleTTS.ai Studio,切换到 G v2,亲自试试全新的音频标签吧。你现有的积分立即可用。
我们迫不及待想听听你的作品。


