← 文章 / AI技术
Simon Willison 2小时前 · 2026-09-24 11:21:29 · 2 阅读

Gemini 3.8 TTS 语音合成测试场

工具 Gemini 3.8 TTS Playground — 一个交互式测试场,可试用 Google 的 Gemini 3.8 文本转语音 API:既能生成单声旁白,也能编排多角色对话,支持预览生成的音频,并查看请求与响应的细节。合成设置可以保存到可收藏的 URL 方便分享,只需填入你自己的 Gemini API key 即可生成高质量语音。

Google 今天发布了两款新的 Gemini 文本转语音模型gemini-3.8-flash-ttsgemini-3.8-flash-lite-tts

这两个模型内置了 2000 多种声音,还可以用“你本人或你有权使用的声音的 30 秒音频样本”创建自定义音色。

我用 GPT-6 Astra vibe coding 了这个自带 key 的测试场界面,利用的是底层 Gemini API 开放的 CORS 策略。

一个用于创作多角色文本转语音对话的 Web 应用截图,左侧是创作面板,右侧是连接和内部机制面板。左侧面板:“01 创作”,带有“加载示例”按钮。“创作设置已保存至 URL,便于书签或分享。您的 API 密钥除外。” 切换开关:“单声”和“对话”(当前选中“对话”)。“声优阵容”区域,带有“+ 添加声优”按钮。声优“Gus”,音色“Puck”,带有一个移除 × 按钮。声优“Pearl”,音色“Kore”,带有一个移除 × 按钮。“为每位声优赋予独特名称和音色。输入即可在已加载的目录中通过音色 ID、名称或语言进行搜索。”“对话”区域,带有“+ 添加台词”按钮。“台词 01”带上有、下和 × 按钮;声优下拉框“Gus”;演绎风格“兴奋且爱八卦”;文本“Pearl,你听到了吗?一群鸟里有一半刚刚收拾东西搬去了 Pacifica 码头!” “台词 02”带上有、下和 × 按钮;声优下拉框“Pearl”;演绎风格“冷静且漠不关心”;文本“我听到了。说实话,Gus,我看不出有什么吸引力。我们在 Pillar Point 港口已经拥有我们需要的一切。” 右侧面板:“连接”,带有“直接 API”徽章。“Gemini API 密钥”字段显示为掩码圆点,并带有“显示”按钮。“已加载 2,089 种音色。在任何音色字段中输入即可搜索。”“您的密钥仅保留在此页面内存中,并直接发送给 Google。它绝不会被保存到浏览器存储中。”“模型”下拉框“gemini-3.8-flash-tts”。“使用您的 Gemini API 账户和配额。”“内部机制”面板,展开的“▼ 请求 JSON”部分显示 JSON 代码片段、一个“复制 JSON”按钮,以及展开的“▼ 响应详情”部分显示 JSON 代码片段。

该 API 的一个显著特性是,它使得定义由多个角色参与的完整对话变得非常容易,每个角色都可以拥有不同的音色和音色风格指令。

这是一段简短的演示,内容是两只鹈鹕辩论是否应该搬到Pacifica 码头。我让 Claude 4.5 Opus 撰写脚本,并生成了一个使用工具渲染该脚本的 URL

您的浏览器不支持音频元素。

使用 Gemini 3.8 Flash TTS(而非更廉价的 Flash-Lite)生成 1 分 18 秒的音频仅耗时约 20 秒,成本为 2.74 美分。

原始来源: Simon Willison

评论 (0)