リップシンク動画向け AI Talking Avatar API

1 枚のポートレートと 1 つの音声トラックを、model: ai-talking-avatar を使ってリップシンク付きトーキング動画に変換します。GoEnhance API の非同期タスクを送信し、返された img_uuid を保存してから、完了までポーリングするかコールバックを使用します。
API キーを取得
AI Talking Avatar API 制作におけるプロのレコーディングスタジオのプレゼンター

1 つのリクエストでポートレートと音声入力を接続します。

AI トーキングアバター API リクエスト用の正面を向いたポートレート撮影
音声駆動のトーキングアバター動画用のボイスレコーディングセッション
送信前に、正確なモデル名、メディア URL、ファイルサイズ、音声の長さ、解像度を検証します。

AI Talking Avatar API の機能と制限

正確なモデル識別子

<code>model</code> を <code>ai-talking-avatar</code> に設定します。この必須値によって、トーキングアバターのワークフローが選択されます。

必須のポートレート URL

<code>image_url</code> に、顔がはっきり見えて遮蔽物のない、10MB 以下の公開ポートレート URI を指定します。

必須の音声 URL

<code>audio_url</code> に、3〜60 秒、50MB 以下の公開発話音声を指定します。

オプションのパフォーマンスプロンプト

<code>prompt</code> を使用して、希望する発話パフォーマンスを記述します。ドキュメント上のデフォルトは <code>person talking</code> です。

2 つの解像度オプション

<code>540p</code> または <code>720p</code> を選択します。ドキュメント上のデフォルトは <code>540p</code> です。

コールバックまたはポーリング

HTTPS コールバックを指定するか、<code>img_uuid</code> を保存して、完了までジョブ詳細エンドポイントをポーリングします。
料金は計測された音声の長さに基づきます。30 秒のクリップは、540p では 15 トークン、720p では 30 トークンです。

AI Talking Avatar API の料金

540p の料金

音声 1 秒あたり 0.5 トークン。ドキュメント記載のトークン価値 $0.02 で、1 秒あたり $0.01 に相当します。

720p の料金

音声 1 秒あたり 1 トークン。ドキュメント記載のトークン価値 $0.02 で、1 秒あたり $0.02 に相当します。

計測音声に基づく課金

GoEnhance はトークンを差し引く前に、転送された音声を計測します。コストは、計測された秒数に選択したレートを掛けた値です。

GoEnhance API を統合する6つのステップ

1. API キーを作成
1

1. API キーを作成

GoEnhance API キーを作成し、認証済み API リクエストに含めて送信してください。
2. ソースメディアの検証
2

2. ソースメディアの検証

人物画像の視認性とサイズを確認し、音声ファイルが公開済みで、3〜60秒、50MB以下であることを確認してください。
3. リクエストの構築
3

3. リクエストの構築

model: ai-talking-avatar を設定し、image_urlaudio_url を追加して、任意のプロンプトと解像度を選択します。
4. タスクの送信
4

4. タスクの送信

https://api.goenhance.ai/api/v1/videos/generations に JSON ボディを POST してください。duration フィールドは送信しないでください。
5. 永続化と追跡
5

5. 永続化と追跡

返された img_uuid を保存し、GET /api/v1/jobs/detail をポーリングするか、コールバックイベントを受信します。
6. 終端状態の処理
6

6. 終端状態の処理

成功と失敗を冪等に処理し、返された動画を検証し、リトライは重複送信と分けて管理します。
許可を得た人物画像と音声入力を中心に、同意を考慮したプレゼンター、トレーニング、ローカライズ、クリエイター向けワークフローを構築します。

トーキングアバター動画の開発者向けユースケース

ローカライズされたプレゼンター動画

承認済みのプレゼンター画像とローカライズされた音声トラックを組み合わせ、製品説明動画や地域キャンペーンに活用します。

トレーニングコンテンツパイプライン

許可を得た人物画像と準備済みのナレーションから、社内学習教材向けのトーキングヘッドセグメントを生成します。

パーソナライズされたオンボーディング

カスタムのリップシンクレンダリングスタックを構築せずに、製品フロー向けの同意に基づくウェルカムクリップを作成します。

クリエイター向けナレーションツール

すべてのリクエストを非同期で追跡しながら、クリエイター向けプロダクトに人物画像+音声の生成機能を追加します。

キャンペーン動画のバリエーション

レビュー、ローカライズ、後続の動画編集に使う、承認済みの音声と解像度のバリエーションを生成します。

自動化されたコンテンツキュー

アプリケーションのリクエストスレッドをブロックせずに、タスク ID とコールバックをバッチオーケストレーションに接続します。
一般的なリクエスト、料金、メディア制限、タスクステータス、インテグレーションに関する質問への回答です。

AI トーキングアバター API FAQ

AI トーキングアバター API での開発

AI Talking Avatar API の料金と連携 | GoEnhance