← 文章 / AI技术
Hacker News 3小时前 · 2026-08-28 20:01:54 · 1 阅读

Google 推出 Gemini 3.5 Transcribe:更精准的智能语音转文本模型

我们最新推出的语音转文本模型,专为精准、智能的实时转录而设计。


Diego Melendo Casado

Gemini 音频工程高级总监

Luke Leonhard

Gemini 音频幕僚长,谨代表 Gemini 音频团队

分享
Text "Gemini 3.5 Transcribe" next to the Gemini spark, all on a blue background

您的浏览器不支持音频元素。

收听文章 [[duration]] 分钟 本内容由 Google AI 生成。生成式 AI 属实验性功能 音色 语速 音色 语速 0.75X 1X 1.5X 2X

今天,我们推出 Gemini 3.5 Transcribe——迄今最精准的语音转文本模型,专为智能语音交互而设计。传统语音识别模型难以应对背景噪音、复杂术语和口语不流畅的清理,而 Gemini 3.5 Transcribe 能将原始音频直接转化为准确、润色过且格式规整的文本。

在 Gemini 应用和 Android 等产品中,消费者已经通过 Android 上的 Rambler 以及 macOS 版 Gemini 应用等新语音功能,用上了这款转录模型。现在,开发者可以在 Google AI Studio 的 Gemini APIGemini Enterprise Agent Platform 中,用 Gemini 3.5 Transcribe 构建类似的能力。

我们打造 3.5 Transcribe,是为了让它无缝融入你的开发工作流——无论你是在构建语音智能体、实时字幕工具,还是通话后分析管道。该模型通过两套独立的 API 提供:

  • 实时流式传输:通过 Live API 使用 gemini-3.5-transcribe-live,为交互式语音应用提供亚秒级延迟的连续双向流式传输。
  • 录音音频处理:通过 Interactions API 使用 gemini-3.5-transcribe,为录音、会议、通话记录等内容提供带说话人归属和词级时间戳的转录。

获得更精准、更智能的转录

Gemini 3.5 Transcribe 旨在捕捉你自然的说话风格,从而更好地理解你的意图、识别自定义词汇,让你用语音即可执行任务。

  • 智能转录:无缝处理自我更正(比如“我们周二见——不对,周三见”),去除填充词(“嗯”“啊”),并自动为文本排版。
  • 函数调用:模型可通过函数调用把复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。目前已在 Gemini macOS 应用中可用。
  • 更精准的转录:据 Artificial Analysis 测量,流式场景平均字错误率(WER)为 4.0%,非流式场景为 2.6%。它在嘈杂的真实环境中表现强劲,能准确捕捉邮政编码、订单号等字母数字实体。
  • 自定义词汇:通过无缝适配你提供的自定义词汇,识别专业术语和独特拼写。
  • 全球语言支持:自动检测并转录 85 种以上的语言,从容应对地区口音和多样化方言。
  • 多说话人识别:为录音音频中的语音准确标注说话人并附带时间戳,最多支持三位说话人(三位以上说话人的支持为实验性功能)。

Gemini 3.5 Transcribe 支持实时语言切换与流畅的流式转录

观看 Gemini 3.5 Transcribe 如何凭智能转录能力清理语音中的不流畅之处。

3.5 Transcribe 提供带多说话人归属和词级时间戳的转录。

Gemini 3.5 Transcribe 的表现相较我们上一代转录模型 Chirp 3 是一次重大飞跃,带来新能力、更优的字错误率和显著改善的延迟。据 Artificial Analysis 测量,仅最终转录的输出时间就缩短了 70%。在一组主流语言和地区的 FLEURS 基准测试中,该模型展现出精准的多语言表现,超越 Chirp 3:流式模式 WER 达 5.50%,非流式场景达 5.04%。

Graph of streaming speech recognition accuracy Graph of streaming speech recognition accuracy

体验智能转录与高级听写

除了 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform,3.5 Transcribe 还超越了标准语音转文本的范畴,让在 Google 生态中的工作体验更自然、更直观。它把情境感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,轻松捕捉细微语义、意图和行内编辑。

  • 在 Android 的 Gboard 上,借助新的 Rambler 功能,3.5 Transcribe 能把口述的想法转化为格式规整的文本,并过滤填充词。你还可以用语音进行编辑、纠正拼写错误、更改写作风格。
  • 在 Google Antigravity 上,经你许可后,3.5 Transcribe 会结合屏幕上下文与聊天记录,确保对文件名、智能体思路和活动文档的转录精准无误。
  • 在 Google AI Studio 中,你可以在 Build 模式下使用 3.5 Transcribe,用语音即兴构建应用。
  • 在 macOS 版 Gemini 应用中,3.5 Transcribe 不仅把你随性的自然口语转录成干净规整的文本,还支持与屏幕上下文无缝配合的语音指令,驱动复杂工作流。通过在后台调用其他 Gemini 模型承担繁重工作,只需开口,就能轻松总结本地文件、跨应用复用文本,或在光标处直接生成图像。
  • Chrome 即将支持这一功能,届时你可以在任何网页输入框里开口即输入——用语音更自然轻松地口述回复、起草帖子,或调用 Chrome 中的 Gemini。

在 macOS 版 Gemini 应用中,Gemini 3.5 Transcribe 让你仅凭语音即可分析文件、生成图像和搜索。

看看 Gemini 3.5 Transcribe 如何在 Android 上通过 Rambler 自动去除填充词、清理口语表达。

Gemini 3.5 Transcribe 利用 Google Antigravity 上的屏幕上下文,确保转录的准确性。

看看早期评价

借助 Gemini Live API,AgoraFishjamLangChainLiveKitPipecatVercelVision Agents 等开发者平台,让开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后打理复杂的实时媒体流基础设施,让开发者得以专注于打磨用户体验。

vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,称赞其出色的延迟、准确性和广泛的语言支持。

vivo testimonial IntelliTek testimonial Lingopal testimonial Stream testimonial Agora testimonial fishjam testimonial

立即开始使用 3.5 Transcribe

在收件箱获取 Google 最新资讯

订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等内容。

完成。还差最后一步。

请查收邮箱以确认订阅。

你也可以使用其他电子邮箱地址订阅。

你的信息将依照 Google 隐私政策使用。你可随时取消订阅。

发布于:
原始来源: Hacker News

评论 (0)