Gemini Enterprise offre un'API che ti consente di generare podcast basati su documenti di origine. L'output è molto simile ai podcast che gli utenti finali possono generare dai propri notebook.
La generazione di podcast tramite l'API è adatta per i job batch in cui potresti avere decine o centinaia di libri, articoli o corsi e vuoi generare un podcast per ognuno.
L'API Podcast è un'API autonoma. Ciò significa che non hai bisogno di un notebook Gemini Notebook Enterprise, di una licenza Gemini Enterprise o di un datastore. Tutto ciò di cui hai bisogno è un progetto abilitato Google Cloud e il ruolo Utente API Podcast.
Input
L'input per l'API è un array di elementi context. Si tratta del materiale di origine da cui viene generato il podcast. L'input può essere sotto forma di testo, immagini, audio e video. Il contenuto totale dell'array di contesto deve essere inferiore a 100.000 token.
Per un elenco dei tipi supportati, consulta le specifiche tecniche per immagini, documenti, video e audio in questa pagina su Gemini 2.5 Flash.
Output
L'output dell'API è il podcast in formato MP3.
Prima di iniziare
Prima di poter generare un podcast utilizzando l'API, devi disporre di quanto segue:
Un Google Cloud progetto con l'API Discovery Engine abilitata. Consulta Creare un progetto e abilitare l' API.
Il ruolo Identity and Access Management (IAM) di Utente API Podcast (
roles/discoveryengine.podcastApiUser). Per informazioni generali sulla concessione dei ruoli, consulta Configurare Gemini Notebook Enterprise.
Generare un podcast dall'input di contesto
Utilizza il seguente comando per generare un podcast chiamando il metodo podcast.
L'input è un array di oggetti multimediali come testo, immagini, clip audio e video.
REST
Per generare ed esportare un podcast:
Esegui il seguente comando curl:
curl -X POST \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json" \ "https://discoveryengine.googleapis.com/v1/projects/PROJECT_ID/locations/global/podcasts" \ -d '{ "podcastConfig": { "focus": "FOCUS", "length": "LENGTH", "languageCode": "LANGUAGE_CODE" }, "contexts": [ { "text": "TEXT_CONTENT" }, { "inlineData": { "mimeType": "MIME_TYPE", "data": "BASE64_ENCODED_DATA" } } ], "title": "PODCAST_TITLE", "description": "PODCAST_DESCRIPTION" }'Sostituisci quanto segue:
PROJECT_ID: l'ID progetto.FOCUS: un prompt in cui suggerisci l' argomento del podcast.LENGTH: sono disponibili due opzioni:SHORT(in genere 4-5 minuti)STANDARD(in genere circa 10 minuti, ma può essere più breve con set di dati più piccoli)
LANGUAGE_CODE: facoltativo. Specifica il codice lingua per il podcast. Utilizza i tag di lingua definiti da BCP47. Se il codice lingua non viene fornito, il podcast viene generato in inglese.TEXT_CONTENT: il contenuto di testo da includere.inlineData: un oggetto per i contenuti multimediali non di testo.MIME_TYPE: il tipo MIME dei dati blob (ad esempio, "image/png").BASE64_ENCODED_DATA: i byte non elaborati codificati in base64 dei dati multimediali.PODCAST_TITLE: un titolo per il podcast. Può essere per uso interno oppure puoi scegliere di mostrarlo agli utenti finali.PODCAST_DESCRIPTION: una descrizione del podcast. Può essere per uso interno oppure puoi scegliere di mostrarlo ai tuoi utenti finali.
La generazione di un podcast richiede alcuni minuti.
Prendi nota del nome dell'operazione; ti servirà per scaricare il podcast al passaggio 4. Nell'esempio precedente, il nome dell'operazione è
projects/123456/locations/global/operations/create-podcast-54321.(Facoltativo) Esegui il polling dello stato dell'operazione di creazione del podcast. Consulta Visualizzare i dettagli di un'operazione a lunga esecuzione.
Al termine dell'operazione, esegui il seguente comando curl per scaricare il podcast:
curl -v \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ "https://discoveryengine.googleapis.com/v1/OPERATION_NAME:download?alt=media" \ --output FILENAME.mp3 -L
Sostituisci quanto segue:
OPERATION_NAME: il nome dell'operazione che hai annotato al passaggio 2.FILENAME: un nome file per il podcast.
Questo comando scarica il podcast in un file MP3 nella directory locale.
Conformità
L'API Podcast non è conforme alle chiavi di crittografia gestite dal cliente, CMEK per Gemini Enterprise.