用於唇形同步影片的 AI Talking Avatar API

使用 model: ai-talking-avatar 將一張人像與一段語音軌道轉換為唇形同步的說話影片。以非同步方式提交 GoEnhance API 任務,保存回傳的 img_uuid,然後輪詢或使用回呼來取得完成狀態。
取得 API 金鑰
講者在專業錄音室中進行 AI Talking Avatar API 製作

在單一請求中連接人像與語音輸入

AI Talking Avatar API 請求所需的正向人像拍攝
錄製音訊以驅動說話頭像影片的錄音時段
提交前請驗證精確的模型名稱、媒體 URL、檔案大小、音訊長度與解析度。

AI Talking Avatar API 功能與限制

確切的模型識別碼

將 <code>model</code> 設為 <code>ai-talking-avatar</code>;這個必要值會選取 talking-avatar 工作流程。

必填的人像 URL

以公開人像 URI 的形式傳遞 <code>image_url</code>,大小不超過 10MB,且臉部清晰可見、無遮擋。

必填的語音 URL

以公開語音音訊的形式傳遞 <code>audio_url</code>,長度為 3-60 秒且不超過 50MB。

選用的表演提示詞

使用 <code>prompt</code> 描述期望的說話表演;文件記載的預設值為 <code>person talking</code>。

兩種解析度選項

選擇 <code>540p</code> 或 <code>720p</code>。文件記載的預設值為 <code>540p</code>。

回呼或輪詢

提供 HTTPS 回呼,或保存 <code>img_uuid</code> 並輪詢任務詳細端點以取得完成狀態。
定價依量測的音訊長度而定。一段 30 秒的片段在 540p 下需 15 tokens,在 720p 下需 30 tokens。

AI Talking Avatar API 定價

540p 定價

每音訊秒 0.5 token,以文件記載的每 token $0.02 計算,等於每秒 $0.01。

720p 定價

每音訊秒 1 token,以文件記載的每 token $0.02 計算,等於每秒 $0.02。

量測音訊計費

GoEnhance 會在扣除 token 前量測傳輸的音訊;費用為量測秒數乘以所選費率。

用六個步驟整合 GoEnhance API

1. 建立 API 金鑰
1

1. 建立 API 金鑰

建立 GoEnhance API 金鑰,並在已驗證的 API 請求中一併送出。
2. 驗證來源媒體
2

2. 驗證來源媒體

檢查人像是否清楚可見及其尺寸,並確認語音檔案為公開、長度 3-60 秒、且不超過 50MB。
3. 建構請求
3

3. 建構請求

設定 model: ai-talking-avatar,加入 image_urlaudio_url,再選擇選用的提示詞與解析度。
4. 提交任務
4

4. 提交任務

將 JSON 主體 POST 至 https://api.goenhance.ai/api/v1/videos/generations。請勿傳送 duration 欄位。
5. 儲存並追蹤
5

5. 儲存並追蹤

儲存回傳的 img_uuid,然後輪詢 GET /api/v1/jobs/detail 或接收回呼事件。
6. 處理最終狀態
6

6. 處理最終狀態

以冪等方式處理成功與失敗,驗證回傳的影片,並將重試與重複提交分開處理。
圍繞已授權的人像與音訊輸入,建立考量同意機制的講者、訓練、本地化與創作者工作流程。

人像說話影片的開發者使用案例

在地化主講人影片

將已核准的主講人人像與本地化的語音音軌搭配,用於產品介紹影片與區域行銷活動。

訓練內容管線

從授權人像與準備好的旁白產生講話片段,用於內部學習教材。

個人化引導

為產品流程建立以同意為基礎的歡迎短片,而不需建置自訂的嘴型同步算圖堆疊。

創作者旁白工具

將人像加音訊的生成功能加入創作者產品,並以非同步方式追蹤每個請求。

行銷活動影片變體

產生已核准的語音與解析度變體,供審查、本地化與後續影片剪輯使用。

自動化內容佇列

將任務 ID 與回呼連接到批次協調流程,且不阻塞應用程式的請求執行緒。
針對常見請求、定價、媒體限制、任務狀態與整合問題的解答。

AI Talking Avatar API 常見問題

使用 AI Talking Avatar API 建置

AI Talking Avatar API 定價與整合 | GoEnhance