Google 推出 Gemini 3.5 Transcribe:更精准的智能语音转文本模型
我们最新推出的语音转文本模型,专为精准、智能的实时转录而设计。
Diego Melendo Casado
Gemini 音频工程高级总监
Luke Leonhard
Gemini 音频幕僚长,谨代表 Gemini 音频团队
分享
您的浏览器不支持音频元素。
收听文章 [[duration]] 分钟 本内容由 Google AI 生成。生成式 AI 属实验性功能 音色 语速 音色 语速 0.75X 1X 1.5X 2X今天,我们推出 Gemini 3.5 Transcribe——迄今最精准的语音转文本模型,专为智能语音交互而设计。传统语音识别模型难以应对背景噪音、复杂术语和口语不流畅的清理,而 Gemini 3.5 Transcribe 能将原始音频直接转化为准确、润色过且格式规整的文本。
在 Gemini 应用和 Android 等产品中,消费者已经通过 Android 上的 Rambler 以及 macOS 版 Gemini 应用等新语音功能,用上了这款转录模型。现在,开发者可以在 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 中,用 Gemini 3.5 Transcribe 构建类似的能力。
我们打造 3.5 Transcribe,是为了让它无缝融入你的开发工作流——无论你是在构建语音智能体、实时字幕工具,还是通话后分析管道。该模型通过两套独立的 API 提供:
- 实时流式传输:通过 Live API 使用
gemini-3.5-transcribe-live,为交互式语音应用提供亚秒级延迟的连续双向流式传输。 - 录音音频处理:通过 Interactions API 使用
gemini-3.5-transcribe,为录音、会议、通话记录等内容提供带说话人归属和词级时间戳的转录。
获得更精准、更智能的转录
Gemini 3.5 Transcribe 旨在捕捉你自然的说话风格,从而更好地理解你的意图、识别自定义词汇,让你用语音即可执行任务。
- 智能转录:无缝处理自我更正(比如“我们周二见——不对,周三见”),去除填充词(“嗯”“啊”),并自动为文本排版。
- 函数调用:模型可通过函数调用把复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。目前已在 Gemini macOS 应用中可用。
- 更精准的转录:据 Artificial Analysis 测量,流式场景平均字错误率(WER)为 4.0%,非流式场景为 2.6%。它在嘈杂的真实环境中表现强劲,能准确捕捉邮政编码、订单号等字母数字实体。
- 自定义词汇:通过无缝适配你提供的自定义词汇,识别专业术语和独特拼写。
- 全球语言支持:自动检测并转录 85 种以上的语言,从容应对地区口音和多样化方言。
- 多说话人识别:为录音音频中的语音准确标注说话人并附带时间戳,最多支持三位说话人(三位以上说话人的支持为实验性功能)。
Gemini 3.5 Transcribe 支持实时语言切换与流畅的流式转录
观看 Gemini 3.5 Transcribe 如何凭智能转录能力清理语音中的不流畅之处。
3.5 Transcribe 提供带多说话人归属和词级时间戳的转录。
Gemini 3.5 Transcribe 的表现相较我们上一代转录模型 Chirp 3 是一次重大飞跃,带来新能力、更优的字错误率和显著改善的延迟。据 Artificial Analysis 测量,仅最终转录的输出时间就缩短了 70%。在一组主流语言和地区的 FLEURS 基准测试中,该模型展现出精准的多语言表现,超越 Chirp 3:流式模式 WER 达 5.50%,非流式场景达 5.04%。
体验智能转录与高级听写
除了 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform,3.5 Transcribe 还超越了标准语音转文本的范畴,让在 Google 生态中的工作体验更自然、更直观。它把情境感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,轻松捕捉细微语义、意图和行内编辑。
- 在 Android 的 Gboard 上,借助新的 Rambler 功能,3.5 Transcribe 能把口述的想法转化为格式规整的文本,并过滤填充词。你还可以用语音进行编辑、纠正拼写错误、更改写作风格。
- 在 Google Antigravity 上,经你许可后,3.5 Transcribe 会结合屏幕上下文与聊天记录,确保对文件名、智能体思路和活动文档的转录精准无误。
- 在 Google AI Studio 中,你可以在 Build 模式下使用 3.5 Transcribe,用语音即兴构建应用。
- 在 macOS 版 Gemini 应用中,3.5 Transcribe 不仅把你随性的自然口语转录成干净规整的文本,还支持与屏幕上下文无缝配合的语音指令,驱动复杂工作流。通过在后台调用其他 Gemini 模型承担繁重工作,只需开口,就能轻松总结本地文件、跨应用复用文本,或在光标处直接生成图像。
- Chrome 即将支持这一功能,届时你可以在任何网页输入框里开口即输入——用语音更自然轻松地口述回复、起草帖子,或调用 Chrome 中的 Gemini。
在 macOS 版 Gemini 应用中,Gemini 3.5 Transcribe 让你仅凭语音即可分析文件、生成图像和搜索。
看看 Gemini 3.5 Transcribe 如何在 Android 上通过 Rambler 自动去除填充词、清理口语表达。
Gemini 3.5 Transcribe 利用 Google Antigravity 上的屏幕上下文,确保转录的准确性。
看看早期评价
借助 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,让开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后打理复杂的实时媒体流基础设施,让开发者得以专注于打磨用户体验。
vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,称赞其出色的延迟、准确性和广泛的语言支持。
立即开始使用 3.5 Transcribe
- 开发者:已在 Google AI Studio 的 Gemini API 和 Google Antigravity 开启公开预览。
- 企业:已通过 Gemini Enterprise Agent Platform 开启公开预览,即将登陆 Gemini Enterprise for Customer Experience。
- 普通用户:macOS 版 Gemini 应用已支持英语,Android 上的 Rambler 已在部分国家和地区语言中推出,Chrome 即将支持。
在收件箱获取 Google 最新资讯
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等内容。
完成。还差最后一步。
请查收邮箱以确认订阅。
你也可以使用其他电子邮箱地址订阅。
你的信息将依照 Google 隐私政策使用。你可随时取消订阅。
发布于: