API d'avatar parlant IA pour vidéo avec synchronisation labiale

Transformez un portrait et une piste vocale en une vidéo parlante synchronisée labiale avec model: ai-talking-avatar. Soumettez une tâche asynchrone à l'API GoEnhance, stockez le img_uuid renvoyé, puis interrogez ou utilisez des rappels pour savoir quand elle est terminée.
Obtenir la clé API
Présentateur dans un studio d'enregistrement professionnel pour la production de l'API AI Talking Avatar.

Connectez les entrées portrait et parole en une seule requête

Capture de portrait de face pour une requête API d'avatar parlant IA
Session d'enregistrement vocal pour vidéo d'avatar parlant pilotée par l'audio
Vérifiez le nom exact du modèle, les URL des médias, les tailles de fichiers, la durée audio et la résolution avant la soumission.

Capacités et limites de l'API AI Talking Avatar

Identifiant exact du modèle

Définissez <code>model</code> sur <code>ai-talking-avatar</code> ; cette valeur obligatoire sélectionne le flux de travail de l'avatar parlant.

URL de portrait requise

Passez <code>image_url</code> comme une URI de portrait public ne dépassant pas 10 Mo, avec un visage visible et non obstrué.

URL de parole requise

Transmettez <code>audio_url</code> comme audio de discours public d’une durée de 3 à 60 secondes et ne dépassant pas 50 Mo.

Invite de performance facultative

Utilisez <code>prompt</code> pour décrire la performance de parole souhaitée ; la valeur par défaut documentée est <code>person talking</code>.

Deux options de résolution

Choisissez <code>540p</code> ou <code>720p</code>. La valeur par défaut documentée est <code>540p</code>.

Rappel ou interrogation

Fournissez un rappel HTTPS ou conservez <code>img_uuid</code> et interrogez le point de terminaison des détails du travail pour savoir quand il est terminé.
La tarification suit la durée audio mesurée. Un clip de 30 secondes coûte 15 tokens en 540p ou 30 tokens en 720p.

Tarification de l'API AI Talking Avatar

Tarification 540p

0,5 token par seconde audio, soit $0.01 par seconde à la valeur de jeton documentée de $0.02.

Tarification 720p

1 token par seconde audio, soit $0.02 par seconde, selon la valeur de token documentée de $0.02.

Facturation basée sur l'audio mesuré

GoEnhance mesure l’audio transféré avant de déduire les tokens ; le coût est mesuré en secondes multipliées par le taux sélectionné.

Intégrez l'API GoEnhance en six étapes

1. Créez une clé API
1

1. Créez une clé API

Créez une clé API GoEnhance et envoyez-la avec votre requête API authentifiée.
2. Validez le média source
2

2. Validez le média source

Vérifiez la visibilité et la taille du portrait, puis confirmez que le fichier audio est public, dure de 3 à 60 secondes et ne dépasse pas 50 Mo.
3. Construisez la requête
3

3. Construisez la requête

Définissez model: ai-talking-avatar, ajoutez image_url et audio_url, puis choisissez un prompt et une résolution facultatifs.
4. Soumettez la tâche
4

4. Soumettez la tâche

Envoyez le corps JSON via POST à https://api.goenhance.ai/api/v1/videos/generations. N'envoyez pas de champ duration.
5. Enregistrez et suivez
5

5. Enregistrez et suivez

Enregistrez le img_uuid renvoyé, puis interrogez GET /api/v1/jobs/detail ou recevez les événements de callback.
6. Gérez les états terminaux
6

6. Gérez les états terminaux

Traitez les succès et les échecs de manière idempotente, validez la vidéo renvoyée, et conservez les tentatives distinctes des soumissions en double.
Construisez des workflows de présentateur, de formation, de localisation et de créateur respectueux du consentement autour d'entrées portrait et audio autorisées.

Cas d'utilisation développeur pour les vidéos d'avatar parlant

Vidéos de présentateurs localisées

Associez des portraits de présentateurs approuvés à des pistes vocales localisées pour les vidéos explicatives de produits et les campagnes régionales.

Pipelines de contenu de formation

Générez des segments de tête parlante à partir de portraits autorisés et d'une narration préparée pour les supports de formation internes.

Onboarding personnalisé

Créez des clips de bienvenue fondés sur le consentement pour les flux produit, sans développer de pile de rendu de synchronisation labiale personnalisée.

Outils de narration pour créateurs

Ajoutez la génération portrait-plus-audio aux produits créateurs tout en suivant chaque requête de manière asynchrone.

Variantes de vidéos de campagne

Produisez des variantes de parole et de résolution approuvées pour la révision, la localisation et le montage vidéo en aval.

Files d'attente de contenu automatisées

Connectez les identifiants de tâche et les callbacks à l'orchestration par lots sans bloquer le thread de requête de l'application.
Réponses aux questions courantes concernant les requêtes, la tarification, les limites de médias, le statut des tâches et l'intégration.

FAQ de l'API AI Talking Avatar

Développez avec l'API AI Talking Avatar

Tarification et intégration de l'API AI Talking Avatar | GoEnhance