搭配方案
共 14 条Agent指定OpenAI大模型gpt-4.1-mini驱动对话回答
可导入ElevenLabs等外部声音作为Agent语音
TTS为可选组件,D-ID允许导入ElevenLabs等外部声音作为Agent语音
组合STT、LLM、TTS等六组件构成实时对话数字人,通过WebRTC低延迟视频回答
限制 client_key 只能在指定域名下建立会话
将数字人以小挂件嵌入网站进行视频对话
将实时对话数字人以小挂件嵌入网站,供访客视频对话
通过官方 SDK 编写前端实时会话代码
路线B用官方SDK把Agent做成可编程服务,适合开发者;浏览器前端需用client key和SDK建立实时会话。
指定 OpenAI 作为 Agent 的大语言模型
D-ID负责提供数字人化身,OpenAI负责提供大语言模型。
把实时对话数字人做成可编程服务
路线 B 用 curl 和官方 SDK 把与 Studio 相同的实时对话数字人做成可编程服务,适合开发者,两条路线底层是同一套能力。
为 Agent 导入 ElevenLabs 外部声音
D-ID 的文字转语音可选 ElevenLabs,为 Agent 导入外部声音。
新建一个专属数字人化身
创建Agent需选形象,若官方库存化身不满意,可用照片或视频新建专属化身。
检索上传资料片段后组织回答
D-ID提供知识库,模型先检索资料片段,再基于内容组织答案。
让整条对话链路实时流式传输,延迟很低
D-ID 的实时代理通过 WebRTC 流式交付,整条问答链路实时流式传输,体验接近视频通话
为数字人回答提供文字转语音能力
D-ID提供数字人化身,ElevenLabs或Azure提供文字转语音。
为实时代理提供大语言模型,处理用户提问
实时代理管线中LLM负责处理用户提问,官方列OpenAI、Google为可选提供方,故搭配GPT Mini与Gemini Flash充当对话大脑。