All models

digitalhuman

digitalhumanVideo
12 Credits
Get your API key
digitalhuman

用人物图片或视频制作唇形同步口播

digitalhuman 是面向人物口播制作的数字人视频服务,可从人脸图片或视频出发,制作唇形同步的讲话视频。创作入口提供音频、文本和声音标识等输入,结果以视频地址及任务信息交付。它适合已有角色形象和讲述内容的制作流程,重点在人物表达,而不是凭空生成任意场景。

数字人模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
人脸图片或人脸视频驱动的唇形同步视频
人物输入
image_url、video_url
讲述输入
audio_url、text、voice_id
生成控制
guidance、steps、seam_fix、speed
任务处理
async 异步选项、callback_url 回调地址
结果交付
视频 URL、任务状态、成片时长与宽高字段

以上为 digitalhuman 的创作能力与调用字段,成片尺寸和时长以实际结果为准。

核心能力

了解 digitalhuman 能为你的工作带来什么。

让已有形象开口讲述

以人脸图片或人物视频作为创作起点,围绕讲述内容制作唇形同步视频。适合已经确定出镜形象、不想每次重新拍摄的项目。其核心是人物口播,脚本、背景设计和后期包装仍应在制作流程中单独安排。

围绕声音组织内容

入口提供音频地址,也提供文本和声音标识字段,便于围绕现成录音或口播稿组织任务。使用时应先明确采用哪种讲述材料,避免把所有字段同时填入视为通用做法;具体输入组合应通过小样验证后再批量使用。

适配任务化生产

生成结果包含任务标识、状态和视频地址,适合接入内容生产流程。异步选项与回调地址可用于安排结果接收;公开 MCP 工具还提供任务轮询、批量获取和删除能力,让生成与后续整理能够分开处理。

适用场景

从具体任务出发,找到模型发挥作用的位置。

课程知识点口播

准备讲师形象素材与分段讲稿或录音,为每个知识点制作人物讲述片段。交付视频可继续用于课程剪辑、添加字幕和插入演示画面。先验证专业词的发音与口型,再处理整套内容,更便于保持成片一致性。

产品说明短片

将产品功能说明整理为口播内容,配合固定讲解者形象制作介绍视频。输出的人物讲述片段可与产品截图、操作演示和品牌素材组合。它负责数字人表达,不应把界面操作、字幕或完整宣传片包装视为自动附带能力。

固定角色系列内容

围绕同一人物素材持续提交不同的讲述内容,制作栏目开场、公告或知识分享片段。生成后保存任务标识与视频地址,便于归档和后期选片。批量开展前先用代表性内容试做,检查声音、人物表现和剪辑适配程度。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

有明确讲述者时选择

如果任务是让指定人物形象讲解一段内容,digitalhuman 的图片或视频输入与唇形同步方式更贴合需求。如果目标是复杂镜头运动、环境变化或多角色剧情,应优先考虑场景生成类视频能力;不要把人物口播与通用视频生成当成同一种创作方式。

先定素材,再定工作流

已有录音时,可围绕音频地址组织任务;以文稿为起点时,可试用文本与声音标识的组合。需要定制声音,可结合 MCP 的声音克隆功能另行准备。不要按旧 engine 字段把服务理解为不同性能档位,应以实际人物素材和讲述效果决定制作方案。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 输入以人脸图片或视频为核心,不等于任意图片都能形成稳定口播。建议先测试所选人物素材,检查口部表现、遮挡区域和画面连续性,再用于正式内容;多人同框或复杂动作也不宜直接按单人讲述流程处理。
  • engine 与 resolution 字段已标记弃用,不建议依赖它们规划新项目的版本或画质。成片可从响应中读取实际宽高与时长;有固定交付尺寸时,应把后期裁切、缩放和验收纳入制作流程。
  • 声音克隆属于配套 MCP 功能,不能把生成接口中的 audio_url 直接当作克隆样本入口。使用人物形象与声音前应取得相应授权,并区分参考声音准备、讲述音频制作和数字人视频生成三个环节。

常见问题

解答使用 digitalhuman 时的常见疑问。

digitalhuman 是通用文生视频模型吗?

它主要用于基于人脸图片或视频的唇形同步口播。文本字段用于讲述内容,不应理解为可以仅凭场景描述生成任意视频。若要制作复杂环境、镜头或剧情,应选择更匹配的创作方式。

人物素材必须是视频吗?

不必限定为视频,数字人创作也支持从人脸图片开始。入口分别提供 image_url 与 video_url,可按素材类型准备。首次使用建议先做短内容试片,确认人物表现,再沿用相同素材组织后续任务。

可以使用自己的录音或文稿吗?

入口提供 audio_url,也有 text 和 voice_id 字段,可围绕录音或文稿组织创作。两类路径不宜未经验证就混用;先选定讲述方式,测试对应素材组合,再将成功的配置用于连续制作。

能直接在生成请求中克隆声音吗?

配套 MCP 工具支持通过短参考音频克隆声音,但视频生成入口没有专用的克隆样本字段。应先单独完成声音准备,再安排口播生成;不要将人物驱动音频与声音克隆参考素材混为一谈。

生成后怎样取得视频?

通过 POST /digital-human/videos 提交任务,响应提供视频地址及任务相关字段。采用异步流程时,可结合回调或 MCP 任务查询获取进展,并根据返回状态判断是否已有可用结果,再下载视频用于后期制作。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 digitalhuman 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。