API Avatar Parlante AI per Video con Sincronizzazione Labiale

Trasforma un ritratto e una traccia vocale in un video parlante con sincronizzazione labiale usando model: ai-talking-avatar. Invia un'attività API asincrona GoEnhance, salva l'img_uuid restituito, quindi esegui il polling o utilizza i callback per il completamento.
Ottieni Chiave API
Presentatore in uno studio di registrazione professionale per la produzione con API Avatar Parlante AI

Collega gli input di ritratto e parlato in un'unica richiesta

Acquisizione di un ritratto frontale per una richiesta API avatar parlante AI
Sessione di registrazione vocale per video con avatar parlante basato su audio
Convalida il nome esatto del modello, gli URL multimediali, le dimensioni dei file, la durata dell'audio e la risoluzione prima dell'invio.

Funzionalità e limiti dell'API Avatar Parlante AI

Identificatore esatto del modello

Imposta <code>model</code> su <code>ai-talking-avatar</code>; questo valore obbligatorio seleziona il flusso di lavoro per avatar parlante.

URL ritratto obbligatorio

Inserisci <code>image_url</code> come URI del ritratto pubblico non superiore a 10MB con un volto visibile e non ostruito.

URL parlato obbligatorio

Inserisci <code>audio_url</code> come audio parlato pubblico di durata compresa tra 3 e 60 secondi e non superiore a 50MB.

Prompt opzionale per la performance

Usa <code>prompt</code> per descrivere la performance vocale desiderata; il valore predefinito documentato è <code>person talking</code>.

Due opzioni di risoluzione

Scegli <code>540p</code> o <code>720p</code>. Il valore predefinito documentato è <code>540p</code>.

Callback o polling

Fornisci un callback HTTPS o conserva l'<code>img_uuid</code> ed esegui il polling dell'endpoint dei dettagli del lavoro per il completamento.
La fatturazione si basa sulla durata misurata dell'audio. Una clip di 30 secondi costa 15 token a 540p o 30 token a 720p.

Prezzi dell'API per avatar parlanti AI

Prezzi 540p

0,5 token per secondo audio, pari a 0,01 $ al secondo al valore del token documentato di 0,02 $.

Prezzi 720p

1 token per secondo audio, pari a 0,02 $ al secondo al valore del token documentato di 0,02 $.

Fatturazione basata sull'audio misurato

GoEnhance misura l'audio trasferito prima di detrarre i token; il costo è dato dai secondi misurati moltiplicati per la tariffa selezionata.

Integra l'API GoEnhance in sei passaggi

1. Crea una chiave API
1

1. Crea una chiave API

Crea una chiave API GoEnhance e inviala con la tua richiesta API autenticata.
2. Convalida i file multimediali di origine
2

2. Convalida i file multimediali di origine

Controlla la visibilità e le dimensioni del ritratto, quindi conferma che il file vocale sia pubblico, di durata compresa tra 3 e 60 secondi e non superiore a 50 MB.
3. Crea la richiesta
3

3. Crea la richiesta

Imposta model: ai-talking-avatar, aggiungi image_url e audio_url, quindi scegli un prompt e una risoluzione opzionali.
4. Invia l'attività
4

4. Invia l'attività

Invia il corpo JSON tramite POST a https://api.goenhance.ai/api/v1/videos/generations. Non inviare un campo relativo alla durata.
5. Salva e monitora
5

5. Salva e monitora

Salva l'img_uuid restituito, quindi esegui il polling di GET /api/v1/jobs/detail o ricevi eventi di callback.
6. Gestisci gli stati terminali
6

6. Gestisci gli stati terminali

Elabora successi e fallimenti in modo idempotente, convalida il video restituito e mantieni i tentativi separati dalle invii duplicati.
Crea flussi di lavoro per presentatori, formazione, localizzazione e creator basati sul consenso, utilizzando ritratti e input audio autorizzati.

Casi d'uso per sviluppatori per video con avatar parlanti

Video di presentatori localizzati

Abbina ritratti di presentatori approvati con tracce vocali localizzate per spiegazioni di prodotti e campagne regionali.

Pipeline di contenuti formativi

Genera segmenti di presentatori parlanti da ritratti autorizzati e narrazioni preparate per materiali di apprendimento interni.

Onboarding personalizzato

Crea clip di benvenuto basate sul consenso per i flussi di prodotto senza dover creare uno stack di rendering personalizzato per il lip-sync.

Strumenti di narrazione per creator

Aggiungi la generazione di ritratti con audio ai prodotti per creator, monitorando ogni richiesta in modo asincrono.

Varianti video per campagne

Produci varianti approvate di parlato e risoluzione per revisione, localizzazione e montaggio video a valle.

Code di contenuti automatizzate

Collega ID attività e callback all'orchestrazione batch senza bloccare il thread di richiesta dell'applicazione.
Risposte a domande comuni su richieste, prezzi, limiti multimediali, stato delle attività e integrazione.

FAQ sull'API Avatar Parlante AI

Sviluppa con l'API Avatar Parlante AI

Prezzi e Integrazione API Avatar Parlante AI | GoEnhance