Gemini 2.5 Flash dengan Gemini Live API

Gemini 2.5 Flash dengan fitur audio native Gemini Live API menampilkan fungsi audio native canggih kami untuk Gemini Live API. Selain fitur Gemini Live API standar, model ini mencakup:

  • Kualitas audio yang ditingkatkan: Nikmati kualitas audio yang ditingkatkan secara signifikan sehingga terasa seperti berbicara dengan orang lain.
  • Kualitas dan kemampuan adaptasi suara yang ditingkatkan: API Gemini Live audio native memberikan interaksi suara yang lebih kaya dan alami dengan 30 suara HD dalam 24 bahasa.
  • Memperkenalkan Audio Proaktif: (Pratinjau) Jika Audio Proaktif diaktifkan, model hanya akan merespons jika relevan. Model ini menghasilkan transkrip teks dan respons audio secara proaktif hanya untuk kueri yang ditujukan ke perangkat, dan tidak merespons kueri yang tidak ditujukan ke perangkat.
  • Memperkenalkan Affective Dialog: Model yang menggunakan audio asli Gemini Live API dapat memahami dan merespons ekspresi emosional pengguna dengan tepat untuk percakapan yang lebih bernuansa.
  • Interupsi yang lebih baik: Menginterupsi Gemini secara lebih alami dan andal, bahkan di lingkungan yang bising.
  • Panggilan fungsi yang andal: Kami telah meningkatkan rasio pemicuan, sehingga Gemini dapat berhasil menjalankan fungsi yang Anda tentukan untuk mendukung kasus penggunaan Anda.
  • Transkripsi yang akurat: Akurasi transkripsi audio-ke-teks telah ditingkatkan secara signifikan. Untuk hasil yang lebih baik, Anda dapat memberikan petunjuk bahasa untuk memandu model ke bahasa yang benar. Untuk mengetahui informasi selengkapnya, lihat Mengaktifkan transkripsi audio untuk sesi.
  • Dukungan multibahasa yang lancar: Berbicara dengan Gemini dalam beberapa bahasa, dan Gemini akan beralih di antara bahasa tersebut dengan mudah tanpa konfigurasi awal. Bahasa tidak lagi menjadi penghalang.

Untuk mengetahui informasi selengkapnya tentang Gemini Live API, lihat:

Coba di Agent Studio Lihat harga

ID Model gemini-live-2.5-flash-native-audio
Modalities
Text Input dan output
Image Input saja
Audio Input dan output
Video Input saja
Batas token Jendela konteks 128 RB
Token output maksimum 64K
Sesi serentak maksimum 1000
Kemampuan
Alat
Opsi pemakaian
Spesifikasi teknis Gambar
  • Jumlah maksimum gambar per perintah: 3.000
  • Ukuran file maksimum per file untuk data inline atau upload langsung melalui konsol: 7 MB
  • Ukuran file maksimum per file dari Google Cloud Storage: 30 MB
  • Jenis MIME yang didukung:
    image/png, image/jpeg, image/webp, image/heic, image/heif
Video
  • Resolusi standar: 768 x 768
  • Jenis MIME yang didukung:
    video/x-flv, video/quicktime, video/mpeg, video/mpegs, video/mpg, video/mp4, video/webm, video/wmv, video/3gpp
Audio
  • Durasi percakapan maksimum: Default 10 menit yang dapat diperpanjang.
  • Format input audio yang diperlukan: Audio PCM 16-bit mentah pada 16 kHz, little-endian
  • Format output audio yang diperlukan: Audio PCM 16-bit mentah pada 24 kHz, little-endian
  • Jenis MIME yang didukung:
    audio/x-aac, audio/flac, audio/mp3, audio/m4a, audio/mpeg, audio/mpga, audio/mp4, audio/ogg, audio/pcm, audio/wav, audio/webm
Default parameter
  • Sensitivitas awal ucapan: Rendah
  • Sensitivitas akhir ucapan: Tinggi
  • Padding awalan: 0
  • Ukuran konteks maks: 128 K
Region yang didukung

Ketersediaan model

  • Amerika Serikat: us-central1, us-east1, us-east4, us-east5, us-south1, us-west1, us-west4
  • Eropa: europe-central2, europe-north1, europe-southwest1, europe-west1, europe-west4, europe-west8
Versi
  • gemini-live-2.5-flash-native-audio
    • Tahap peluncuran: GA
    • Tanggal rilis: 12 Desember 2025
    • Tanggal penghentian: 13 Desember 2026
Kontrol keamanan Prediksi online
  • Residensi data
  • CMEK
  • VPC-SC
  • AXT
Lihat Kontrol keamanan untuk mengetahui informasi selengkapnya.