← 文章 / AI技术
The Decoder 4小时前 · 2026-09-24 15:25:47 · 2 阅读

谷歌发布 Flash TTS 模型:用文字描述从零设计 AI 语音

图片描述

核心要点

  • 谷歌发布了 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款新型语音合成模型,支持超过 100 种语言。Flash TTS 可通过文本描述创建全新语音,其语音克隆功能则能基于 30 秒音频样本构建语音档案。
  • Flash TTS 主要面向播客、有声书和游戏角色等创意应用场景;Flash-Lite TTS 则专为大规模低成本语音生成设计,适用于配音、音频内容及语音智能体。
  • 两款模型均支持为每句台词添加舞台指示、双声部对话以及笑声、叹息等非语言声音。它们将通过 Gemini API 和 Google AI Studio 推出,Gemini Enterprise API 的访问权限也将随后开放。

谷歌推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款新型语音生成模型。Flash TTS 能通过文本描述创建全新语音,两款模型均支持 100 多种语言,并允许用户为单句对话添加舞台指示。

据谷歌介绍,Gemini 3.8 Flash TTS 专为游戏角色、有声书和播客等创意项目设计;Gemini 3.8 Flash-Lite TTS 则聚焦于大规模低成本语音生成,服务于配音、音频内容及语音智能体等场景。

Flash TTS 允许用户通过文本描述创建语音

借助 Gemini 3.8 Flash TTS,用户可以从零开始设计语音。谷歌表示,文本提示可定义特定角色、口音及发声特质,涵盖广泛的语言和方言。对于不想从头开始的用户,谷歌提供包含 2000 多种预设语音的资源库,其中包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。

语音克隆功能可基于 30 秒音频样本构建语音档案。使用此功能时,被克隆者必须录制一段口头的同意声明,且录音中的声音需与样本一致。Gemini 音频模型生成的每一段音频都带有不可听见的 SynthID 水印,以辅助识别 AI 生成的语音,据谷歌介绍

Google 还宣布了"Voice Remixing"(语音混音)功能,用户可以调整语音库中声音的音色、音高、语速和口音,但目前尚未上线。

脚本指令让用户掌控对话和表达方式

这两款模型都允许用户为每句台词编写指令,也可以让模型自行解读脚本提示。Google 表示,模型可以生成数小时的音频,且几乎不会出现"说话人漂移"(speaker drift),也就是说声音随时间变化极小。

据该公司介绍,双语音模式可以基于单份脚本生成对话,同时保持两个声音各自独立。用户还可以在脚本中标注笑声、叹气以及"嗯哼"之类的语气词,把反应和停顿精确安排在想要的位置。

在我自己的两次测试中,我使用了一个预设声音,并通过风格提示词让它模仿一位说英语时带浓重德国口音、一脸不耐烦的柏林人。风格控制确实生成了颇具说服力的口音和语调,但两次测试都出现过背景中的高频尖啸声。其中一次测试里,声音在片段末尾还发生了变化。




风格提示词:一位来自柏林的德语母语男性,以英语为外语说话,带有浓重、不容错认的德国口音。他显然不是英语母语者:他按德语方式发音英语单词,把德语的节奏和语调套用在英语句子上。"Th"发成"z"或"d"("ze"、"sink"、"dat"),"w"发成"v"("vat"、"vell"),词尾辅音变得更硬("goot"、"bat"表示"bad")。"r"是喉音、含混的,绝不是英语的"r"。元音扁平短促,缺乏美式或英式英语的柔和感。

嗓音带鼻音且略显紧绷,音域居中,带着沙哑的颤音和类似 Kermit 的抖动,但更粗粝、不像木偶。听起来像一个凌晨两点疲惫不堪的柏林人。

表达方式:语速快、简短、断断续续。他在寻找英语单词时会短暂停顿,有时直接生硬地插入德语单词而不翻译。偶尔会出现恼怒的音调上扬。语气干涩、讽刺、无动于衷,还带着点不耐烦——烦的是他竟然不得不解释这些事,更烦的是还得用英语解释。

谷歌称其新模型在 Hume AI 的文本转语音基准测试的多数类别中表现领先 | 图源:Google

谷歌开始推出两款模型,企业级 API 访问随后上线

谷歌正通过 Gemini APIGoogle AI Studio 推出这两款模型。Flash TTS 也可在 Gemini Notebook 中使用,而 Flash-Lite TTS 则可在 Google Vids 中获取。谷歌表示,两款模型随后将通过 Gemini Enterprise API 提供访问权限。

AgoraLiveKitPipecat 以及 Vercel 等开发者平台已支持通过 Gemini API 进行集成。谷歌尚未列出新模型的地区节点,尽管此前的 TTS 模型提供欧盟数据支持

根据谷歌的说法,免费层的数据将用于改进其产品,而付费层的数据不会。 付费价格以每百万美元 token 计价,输入计入文本 token 费用,输出计入音频 token 费用。

计费项 Flash TTS(截至 2026 年底) Flash TTS(2027 年起) Flash-Lite TTS(截至 2026 年底) Flash-Lite TTS(2027 年起)
文本输入 0.50 美元 1.00 美元 0.50 美元 1.00 美元
音频输出 9.00 美元 18.00 美元 6.00 美元 12.00 美元

谷歌指出,1 秒生成音频相当于 25 个音频 token,因此 1 小时音频约对应 90,000 个 token。这意味着,到 2026 年底,1 小时音频输出使用 Flash TTS 需 0.81 美元,使用 Flash-Lite TTS 则需 0.54 美元。自 2027 年 1 月 1 日起,价格将上调至 1.62 美元和 1.08 美元,文本输入费用另计。

原始来源: The Decoder

评论 (0)