用于口型同步视频的 AI Talking Avatar API

使用 model: ai-talking-avatar 将一张肖像和一条语音轨转换为口型同步的说话视频。提交一个异步 GoEnhance API 任务,保存返回的 img_uuid,然后轮询或使用回调来获取完成状态。
获取 API 密钥
AI Talking Avatar API 制作:专业录音棚中的主讲人

将肖像和语音输入合并到一次请求中

针对 AI Talking Avatar API 请求的正面肖像采集
为音频驱动的说话头像视频进行录音
提交前请验证精确的模型名称、媒体 URL、文件大小、音频时长和分辨率。

AI Talking Avatar API 能力与限制

精确的模型标识符

将 <code>model</code> 设置为 <code>ai-talking-avatar</code>;此必填值选择说话头像工作流。

必填的肖像 URL

传入 <code>image_url</code> 作为公共肖像 URI,大小不超过 10MB,面部清晰可见且无遮挡。

必填的语音 URL

传入 <code>audio_url</code> 作为公共语音音频,时长为 3-60 秒,大小不超过 50MB。

可选的表演提示词

使用 <code>prompt</code> 描述期望的说话表现;文档中的默认值为 <code>person talking</code>。

两种分辨率选项

选择 <code>540p</code> 或 <code>720p</code>。文档中的默认值为 <code>540p</code>。

回调或轮询

提供 HTTPS 回调,或保存 <code>img_uuid</code> 并轮询任务详情端点以获取完成状态。
定价按测量的音频时长计算。30 秒片段在 540p 下消耗 15 token,在 720p 下消耗 30 token。

AI Talking Avatar API 定价

540p 定价

每音频秒 0.5 token,按文档中 $0.02 token 价值计算,相当于每秒 $0.01。

720p 定价

每音频秒 1 token,按文档中 $0.02 token 价值计算,相当于每秒 $0.02。

按测量音频计费

GoEnhance 在扣除 token 前测量传输的音频;费用为测量秒数乘以所选费率。

通过六个步骤集成 GoEnhance API

1. 创建 API 密钥
1

1. 创建 API 密钥

创建 GoEnhance API 密钥,并在经过身份验证的 API 请求中随请求发送。
2. 校验源媒体
2

2. 校验源媒体

检查肖像的可见性和大小,然后确认语音文件是公开可访问的、时长为 3-60 秒、且不超过 50MB。
3. 构建请求
3

3. 构建请求

设置 model: ai-talking-avatar,添加 image_urlaudio_url,然后选择可选的提示词和分辨率。
4. 提交任务
4

4. 提交任务

通过 POST 将 JSON body 发送到 https://api.goenhance.ai/api/v1/videos/generations。不要发送 duration 字段。
5. 持久化并跟踪
5

5. 持久化并跟踪

保存返回的 img_uuid,然后轮询 GET /api/v1/jobs/detail 或接收回调事件。
6. 处理终态
6

6. 处理终态

以幂等方式处理成功和失败,校验返回的视频,并将重试与重复提交分开处理。
围绕已授权的肖像和音频输入,构建基于同意的出镜人、培训、本地化和创作者工作流。

数字人视频的开发者用例

本地化出镜人视频

将已获批准的出镜人肖像与本地化语音轨配对,用于产品介绍视频和区域营销活动。

培训内容管线

基于已授权的肖像和准备好的解说词生成人物讲话片段,用于内部学习材料。

个性化欢迎引导

为产品流程创建基于用户同意的欢迎片段,无需自建自定义口型同步渲染技术栈。

创作者旁白工具

在创作者产品中加入“肖像+音频”生成能力,同时异步跟踪每个请求。

营销活动视频变体

生成经批准的语音和分辨率变体,用于审核、本地化及下游视频编辑。

自动化内容队列

将任务 ID 和回调接入批量编排,不阻塞应用请求线程。
常见请求、定价、媒体限制、任务状态和集成问题的解答。

AI Talking Avatar API 常见问题

使用 AI Talking Avatar API 构建