Gemini 3.5 Transcribe:智能语音转录
今天,我们推出 Gemini 3.5 Transcribe。这是目前精准度最高的语音转文本模型,专为智能语音交互打造。传统语音识别模型往往难以应对背景噪声、复杂术语和口语中的不流畅表达,而 Gemini 3.5 Transcribe 能将原始音频直接转换为准确、 polished 且格式规范的文本。
在 Gemini 应用和 Android 等产品中,消费者已经通过这款转录模型体验到全新的语音功能,例如 Android 手机上的 Rambler,以及 macOS 版 Gemini 应用中的相关功能。现在,开发者也可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform,使用 Gemini 3.5 Transcribe 构建类似能力。
我们打造 3.5 Transcribe 时,就考虑到了开发者的现有工作流。无论你是在开发语音代理、实时字幕工具,还是通话后分析流程,都能轻松集成。该模型提供两套独立的 API:
- 实时流式转录:通过使用
gemini-3.5-transcribe-live的 Live API,为交互式语音应用提供持续的双向流式传输,延迟低于一秒。 - 预录音频处理:通过使用
gemini-3.5-transcribe的 Interactions API,转录录音、会议内容、通话记录等,并提供说话人标注和逐词时间戳。
更精准、更智能的转录
Gemini 3.5 Transcribe 能捕捉自然的说话方式,更好地理解用户意图、识别自定义词汇,让你可以直接通过语音执行任务。
- 智能转录:能够自然处理自我纠正(例如“我们周二见——不,周三见”),删除填充词(如“嗯”和“呃”),并自动为文本设置格式。
- Function calling:模型可以通过函数调用,将复杂任务(例如图像生成和文件分析)交给其他 Gemini 模型处理。目前已在 Gemini macOS 应用中提供。
- 更精准的转写:根据 Artificial Analysis 的测评,流式场景的平均词错误率(Word Error Rate,WER)为 4.0%,非流式场景为 2.6%。即使面对嘈杂的真实环境,也能保持出色表现,准确识别邮政编码、订单号等字母数字组合。
- 自定义词汇:模型可以无缝适配你提供的自定义词汇,准确识别专业术语和特殊拼写。
- 全球语言支持:自动识别并转写 85 种以上语言,同时自然应对不同地区口音和多样方言。
- 多说话人识别:对于预录音频,模型可以准确区分最多三位说话人,并提供时间戳(支持三位以上说话人仍处于实验阶段)。
Gemini 3.5 Transcribe 支持实时切换语言,并可无缝进行流式转写
观看 Gemini 3.5 Transcribe 如何利用智能转写功能,自动清理语音中的不流畅表达。
3.5 Transcribe 支持区分多位说话人,并提供词级时间戳。
Gemini 3.5 Transcribe 的性能相比此前的转写模型 Chirp 3 实现了重大提升:不仅带来全新能力、更低的词错误率,还显著降低了延迟。根据 Artificial Analysis 的测评,最终转写结果的生成时间提升了 70%。在涵盖多种主流语言和地区的 FLEURS 基准测试中,该模型展现出精准的多语言表现,全面超越 Chirp 3;流式场景的 WER 达到 5.50%,非流式场景则为 5.04%。
体验智能转写与高级听写功能
除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,3.5 Transcribe 还超越了标准语音转文字功能,让跨 Google 的工作体验更加自然直观。它将上下文感知理解直接融入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常场景,轻松捕捉细微差别、意图和即时编辑。- 在 Android 的 Gboard 上,通过新功能 Rambler,3.5 Transcribe 能将口语转化为格式规范的文本,并过滤掉填充词。你还可以用语音进行编辑、纠正拼写和更改写作风格。
- 在 Google Antigravity 上,3.5 Transcribe 会结合屏幕上下文和聊天记录(经你授权),确保在文件名、代理思考和活跃文档中的转录精准无误。
- 在 Google AI Studio 的 Build 模式中,你可以通过语音即时编写代码。
- 在 macOS 的 Gemini 应用中,3.5 Transcribe 不仅将自然口语转录为格式清晰的文本,还支持语音命令,可与屏幕上下文无缝配合以驱动复杂工作流。模型在后台调用其他 Gemini 模型处理繁重任务,让你只需用语音就能轻松总结本地文件、跨应用重用文本,或在光标处直接生成图像。
- Chrome 即将推出此功能,你可以在任何网页输入框中语音打字——只需用声音就能自然轻松地口述回复、起草帖子或向 Chrome 中的 Gemini 提示。
Gemini 3.5 Transcribe lets you analyze files, generate images, and search in the Gemini app on macOS using just your voice.
See how Gemini 3.5 Transcribe uses Rambler on Android to automatically remove filler words and clean up speech.
Gemini 3.5 Transcribe leverages screen context on Google Antigravity to ensure accurate transcription accuracy.
Read the early reviews
借助 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,让开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理着复杂的实时媒体流基础设施,让开发者可以专注于打磨用户体验。 vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,称赞其低延迟、高准确度和广泛的语言支持。
立即开始使用 3.5 Transcribe
- 面向开发者:已通过 Google AI Studio 中的 Gemini API 和 Google Antigravity 开放预览。
- 面向企业:已通过 Gemini Enterprise Agent Platform 开放预览,并将很快登陆 Gemini Enterprise for Customer Experience。
- 面向所有用户:目前已在 macOS 版 Gemini 应用(英语)中提供;Android 版 Rambler 已在部分国家和语言中上线,并即将登陆 Chrome。