Gemini 2.5 Flash dengan Gemini Live API

Gemini 2.5 Flash dengan fitur audio native Gemini Live API adalah fungsi audio native canggih kami untuk Gemini Live API. Selain fitur Gemini Live API standar, model ini mencakup:

  • Kualitas audio yang ditingkatkan: Nikmati kualitas audio yang ditingkatkan secara signifikan sehingga terasa seperti berbicara dengan seseorang.
  • Kualitas dan kemampuan adaptasi suara yang ditingkatkan: Audio native Gemini Live API memberikan interaksi suara yang lebih kaya dan alami dengan 30 suara HD dalam 24 bahasa.
  • Memperkenalkan Audio Proaktif: (Pratinjau) Jika Audio Proaktif diaktifkan, model hanya akan merespons jika relevan. Model akan membuat transkrip teks dan respons audio secara proaktif hanya untuk kueri yang diarahkan ke perangkat, dan tidak akan merespons kueri yang tidak diarahkan ke perangkat.
  • Memperkenalkan Dialog Afektif: Model yang menggunakan audio native Gemini Live API dapat memahami dan merespons ekspresi emosional pengguna dengan tepat untuk percakapan yang lebih bernuansa.
  • Peningkatan kemampuan interupsi: Interupsi Gemini dengan lebih alami dan andal, bahkan di lingkungan yang bising.
  • Pemanggilan fungsi yang andal: Kami telah meningkatkan tingkat pemicu, sehingga Gemini dapat berhasil menjalankan fungsi yang Anda tentukan untuk mendukung kasus penggunaan Anda.
  • Transkripsi yang akurat: Akurasi transkripsi audio ke teks telah ditingkatkan secara signifikan. Untuk mendapatkan hasil yang lebih baik, Anda dapat memberikan petunjuk bahasa untuk memandu model ke bahasa yang benar. Untuk mengetahui informasi selengkapnya, lihat Mengaktifkan transkripsi audio untuk sesi.
  • Dukungan multibahasa yang lancar: Berbicara dengan Gemini dalam beberapa bahasa, dan Gemini akan beralih di antara bahasa tersebut dengan mudah tanpa konfigurasi awal. Bahasa tidak lagi menjadi penghalang.

Untuk mengetahui informasi selengkapnya tentang Gemini Live API, lihat:

Coba di Agent Studio Harga

ID Model gemini-live-2.5-flash-native-audio
Modalitas
Text Input and output
Image Input only
Audio Input and output
Video Input only
Batas token Jendela konteks 128K
Token output maksimum 64K
Sesi serentak maksimum 1000
Kemampuan
Alat
Opsi pemakaian
Spesifikasi teknis Gambar
  • Jumlah gambar maksimum per perintah: 3.000
  • Ukuran file maksimum per file untuk data inline atau upload langsung melalui konsol: 7 MB
  • Ukuran file maksimum per file dari Google Cloud Storage: 30 MB
  • Jenis MIME yang didukung:
    image/png, image/jpeg, image/webp, image/heic, image/heif
Video
  • Resolusi standar: 768 x 768
  • Jenis MIME yang didukung:
    video/x-flv, video/quicktime, video/mpeg, video/mpegs, video/mpg, video/mp4, video/webm, video/wmv, video/3gpp
Audio
  • Durasi percakapan maksimum: Default 10 menit yang dapat diperpanjang.
  • Format input audio yang diperlukan: Audio PCM 16-bit mentah pada 16 kHz, little-endian
  • Format output audio yang diperlukan: Audio PCM 16-bit mentah pada 24 kHz, little-endian
  • Jenis MIME yang didukung:
    audio/x-aac, audio/flac, audio/mp3, audio/m4a, audio/mpeg, audio/mpga, audio/mp4, audio/ogg, audio/pcm, audio/wav, audio/webm
Default parameter
  • Sensitivitas awal ucapan: Rendah
  • Sensitivitas akhir ucapan: Tinggi
  • Pengisi awalan: 0
  • Ukuran konteks maksimum: 128K
Region yang didukung

Ketersediaan model

  • Amerika Serikat: us-central1, us-east1, us-east4, us-east5, us-south1, us-west1, us-west4
  • Eropa: europe-central2, europe-north1, europe-southwest1, europe-west1, europe-west4, europe-west8
Versi
  • gemini-live-2.5-flash-native-audio
    • Tahap peluncuran: GA
    • Tanggal rilis: 12 Desember 2025
    • Tanggal penghentian: 13 Desember 2026
Kontrol keamanan Prediksi online
  • Residensi data
  • CMEK
  • VPC-SC
  • AXT
Lihat Kontrol keamanan untuk mengetahui informasi selengkapnya.