vercel 6小时前 · 2026-10-04 11:04:09 · 7 阅读
Gemini 3.8 文本转语音模型现已在 AI Gateway 上可用
Google 的 Gemini 3.8 Flash-Lite TTS 和 Gemini 3.8 Flash TTS 现已登陆 AI Gateway。
这两款模型都能将文本转换为超过 100 种语言的语音,支持长篇旁白、语调控制以及双人对白。
google/gemini-3.8-flash-lite-tts针对大批量语音生成做了优化,可控制语气、语速和逐句朗读效果。google/gemini-3.8-flash-tts针对富有表现力的语音生成和自定义角色设计做了优化,可控制表演提示、语速、口音和对话反应。
要生成语音,只需把模型 ID 传给 AI SDK(7 及以上版本):
1import { generateSpeech } from 'ai';2import { gateway } from '@ai-sdk/gateway';3import { writeFile } from 'node:fs/promises';4
5const result = await generateSpeech({6 model: gateway.speechModel('google/gemini-3.8-flash-lite-tts'),7 text: 'Welcome to the audio edition.',8 voice: 'Kore',9 instructions: 'Warm, relaxed, and speaking slowly',10 outputFormat: 'wav',11});12
13await writeFile('speech.wav', result.audio.uint8Array);使用 Gemini 3.8 Flash-Lite TTS 生成 WAV 文件。
欢迎在模型 playground 中试用 Flash-Lite TTS 或 Flash TTS。配置方法、双人对白及更多示例请参阅文本转语音指南。
原始来源: vercel