Configurare la lingua e la voce

Questo documento descrive come configurare le risposte vocali sintetizzate e il rilevamento di attività vocale nell'API Gemini Live. Puoi configurare le risposte in una varietà di voci e lingue HD, nonché le impostazioni di rilevamento dell'attività vocale per consentire agli utenti di interrompere il modello.

Impostare la lingua e la voce

I modelli audio nativi come gemini-live-2.5-flash-native-audio possono passare da una lingua all'altra in modo naturale durante la conversazione. Puoi anche limitare le lingue in cui parla specificandole nelle istruzioni di sistema.

La voce è configurata nel campo voice_name per tutti i modelli.

Il seguente esempio di codice mostra come configurare la lingua e la voce.

from google.genai.types import LiveConnectConfig, SpeechConfig, VoiceConfig, PrebuiltVoiceConfig

config = LiveConnectConfig(
  response_modalities=["AUDIO"],
  speech_config=SpeechConfig(
    voice_config=VoiceConfig(
        prebuilt_voice_config=PrebuiltVoiceConfig(
            voice_name=voice_name,
        )
    ),
    language_code="en-US",
  ),
)

Voci supportate

L'API Gemini Live supporta le seguenti 30 opzioni vocali nel campo voice_name:

Zephyr -- Bright
Kore -- Firm
Orus -- Firm
Autonoe -- Bright
Umbriel -- Easy-going
Erinome -- Clear
Laomedeia -- Upbeat
Schedar -- Even
Achird -- Friendly
Sadachbia -- Lively
Puck -- Upbeat
Fenrir -- Excitable
Aoede -- Breezy
Enceladus -- Breathy
Algieba -- Smooth
Algenib -- Gravelly
Achernar -- Soft
Gacrux -- Mature
Zubenelgenubi -- Casual
Sadaltager -- Knowledgeable
Charon -- Informative
Leda -- Youthful
Callirrhoe -- Easy-going
Iapetus -- Clear
Despina -- Smooth
Rasalgethi -- Informative
Alnilam -- Firm
Pulcherrima -- Forward
Vindemiatrix -- Gentle
Sulafat -- Warm

Lingue supportate

L'API Gemini Live supporta le seguenti lingue:

Lingua Codice BCP-47
Arabo (egiziano) ar-EG
Bengalese (Bangladesh) bn-BD
Olandese (Paesi Bassi) nl-NL
Inglese (India) Bundle en-IN e hi-IN
Inglese (USA) en-US
Francese (Francia) fr-FR
Tedesco (Germania) de-DE
Hindi (India) hi-IN
Indonesiano (Indonesia) id-ID
Italiano (Italia) it-IT
Giapponese (Giappone) ja-JP
Coreano (Corea) ko-KR
Marathi (India) mr-IN
Polacco (Polonia) pl-PL
Portoghese (Brasile) pt-BR
Rumeno (Romania) ro-RO
Russo (Russia) ru-RU
Spagnolo (USA) es-US
Tamil (India) ta-IN
Telugu (India) te-IN
Thailandese (Thailandia) th-TH
Turco (Turchia) tr-TR
Ucraino (Ucraina) uk-UA
Vietnamita (Vietnam) vi-VN

Configurare il rilevamento dell'attività vocale

Il rilevamento di attività vocale (VAD) consente al modello di riconoscere quando una persona sta parlando. Questo è essenziale per creare conversazioni naturali, perché consente a un utente di interrompere il modello in qualsiasi momento.

Quando il VAD rileva un'interruzione, la generazione in corso viene annullata ed eliminata. Nella cronologia della sessione vengono conservate solo le informazioni già inviate al client. Il server invia quindi un messaggio BidiGenerateContentServerContent per segnalare l'interruzione. Il server elimina quindi tutte le chiamate di funzione in attesa e invia un messaggio BidiGenerateContentServerContent con gli ID delle chiamate annullate.

Python

config = {
    "response_modalities": ["audio"],
    "realtime_input_config": {
        "automatic_activity_detection": {
            "disabled": False, # default
            "start_of_speech_sensitivity": "low",
            "end_of_speech_sensitivity": "low",
            "prefix_padding_ms": 20,
            "silence_duration_ms": 100,
        }
    }
}
      

Passaggi successivi