搭配方案

共 14 条

Agent指定OpenAI大模型gpt-4.1-mini驱动对话回答

✓ 实时流式传输,延迟很低✓ 可指定背后用哪个大模型 ✕ 按说话时间计费✕ credit耗尽会停止响应

可导入ElevenLabs等外部声音作为Agent语音

TTS为可选组件,D-ID允许导入ElevenLabs等外部声音作为Agent语音

✓ 可选内置声音、克隆声音或导入外部声音

组合STT、LLM、TTS等六组件构成实时对话数字人,通过WebRTC低延迟视频回答

✓ WebRTC实时流式传输,延迟很低✓ 体验接近视频通话 ✕ 每条回复按说话时间计费✕ credit耗尽时Agent会停止响应
D-ID + 列出的域名

限制 client_key 只能在指定域名下建立会话

✓ 只能建会话,改不了删不了 Agent✓ 实现官方说的安全边界 ✕ 仅限列出的域名下使用
D-ID + 你的网站

将数字人以小挂件嵌入网站进行视频对话

将实时对话数字人以小挂件嵌入网站,供访客视频对话

✓ 延迟很低,体验接近视频通话✓ 访客点开即可视频对话 ✕ credit耗尽时Agent停止响应✕ 浏览器前端不能直接用管理Key
D-ID + @d-id/client-sdk

通过官方 SDK 编写前端实时会话代码

路线B用官方SDK把Agent做成可编程服务,适合开发者;浏览器前端需用client key和SDK建立实时会话。

✓ 可编程控制,适合开发者✓ 官方SDK简化前端实时会话 ✕ 需Node.js环境✕ 前端需签发client key,管理Ke

指定 OpenAI 作为 Agent 的大语言模型

D-ID负责提供数字人化身,OpenAI负责提供大语言模型。

D-ID + curl+ @d-id/client-sdk

把实时对话数字人做成可编程服务

路线 B 用 curl 和官方 SDK 把与 Studio 相同的实时对话数字人做成可编程服务,适合开发者,两条路线底层是同一套能力。

✓ 不写代码与编程控制可先A后B落地✓ WebRTC 流式传输延迟低 ✕ credit 耗尽 Agent 会停止响✕ 管理 Key 不能直接放浏览器前端

为 Agent 导入 ElevenLabs 外部声音

D-ID 的文字转语音可选 ElevenLabs,为 Agent 导入外部声音。

✓ 支持导入外部声音
D-ID + 一张照片或一段视频

新建一个专属数字人化身

创建Agent需选形象,若官方库存化身不满意,可用照片或视频新建专属化身。

✓ 无需代码即可新建专属化身 ✕ 官方库存化身可能不合意时才用✕ Agent按说话时间计费,credit耗
D-ID + 公司资料、产品 FAQ、帮助文档

检索上传资料片段后组织回答

D-ID提供知识库,模型先检索资料片段,再基于内容组织答案。

✓ 可优先引用自有文档✓ 支持PDF、TXT、PPTX ✕ 一个知识库最多5份文档✕ 不建议依赖表格和图片
D-ID + WebRTC WebRTC

让整条对话链路实时流式传输,延迟很低

D-ID 的实时代理通过 WebRTC 流式交付,整条问答链路实时流式传输,体验接近视频通话

✓ 延迟很低✓ 体验接近视频通话 ✕ Agent 按 15 秒区间计费✕ credit 耗尽会停止响应
D-ID + ElevenLabs ElevenLabs + Azure

为数字人回答提供文字转语音能力

D-ID提供数字人化身,ElevenLabs或Azure提供文字转语音。

为实时代理提供大语言模型,处理用户提问

实时代理管线中LLM负责处理用户提问,官方列OpenAI、Google为可选提供方,故搭配GPT Mini与Gemini Flash充当对话大脑。

✓ LLM可随时查询知识库✓ 通过WebRTC流式传输延迟低 ✕ credit耗尽时Agent会停止响应✕ 长回复按15秒区间多耗credit