Pengantar konektor dan penyimpanan data

Konektor mendapatkan data dari sumber data Google dan pihak ketiga ke Gemini Enterprise, dan menyimpannya di penyimpanan data khusus. Dokumen ini memberikan ringkasan tentang konektor tersebut. Memusatkan data Anda di Gemini Enterprise akan meningkatkan aksesibilitas data, fungsi penelusuran, dan kemampuan analisis.

Gambar ringkasan yang menunjukkan cara konektor mendapatkan data ke Gemini Enterprise.
Ringkasan konektor

Konsep konektor dan penyimpanan data

Penyimpanan data
Setiap sumber data mendukung serangkaian jenis entity. Misalnya, Jira Cloud memiliki entity seperti masalah, lampiran, komentar, dan log kerja, yang unik untuk sumber data. Gemini Enterprise membuat penyimpanan data terpisah untuk setiap entity. Oleh karena itu, saat Anda membuat penyimpanan data menggunakan Google Cloud konsol, Anda akan mendapatkan kumpulan penyimpanan data yang mewakili entity data yang diserap ini.
Penggabungan data versus penyerapan (pengindeksan)
Penggabungan data mengambil informasi langsung dari sumber data yang ditentukan. Karena data tidak disalin ke dalam indeks Gemini Enterprise, Anda tidak perlu khawatir tentang penyimpanan data storage. Namun, karena data tidak diindeks, kualitas penelusuran mungkin lebih rendah.Penyerapan data (pengindeksan) menyalin data ke dalam indeks Gemini Enterprise.

Hal ini dapat meningkatkan kualitas penelusuran. Namun, proses ini menggunakan lebih banyak penyimpanan dan waktu.

Jika konektor mendukung penggabungan data dan penyerapan data, pilih metode koneksi data yang Anda inginkan.
Data tidak terstruktur
Format data yang didukung khusus untuk sumber data dan jenis entity. Jika konten dalam entity disimpan dalam format tidak terstruktur—seperti PDF, HTML, DOCX, PPTX, XLSX, dan XLSM—penyimpanan data tidak terstruktur akan dibuat oleh Gemini Enterprise. Untuk mengetahui informasi selengkapnya dan jenis file yang didukung, lihat Penelusuran tidak terstruktur.
Data terstruktur
Format data yang didukung khusus untuk sumber data dan jenis entity. Jika konten dalam entity disimpan dalam format terstruktur, penyimpanan data terstruktur akan dibuat oleh Gemini Enterprise. Untuk mengetahui informasi selengkapnya, lihat Penelusuran terstruktur.
Skema data
Skema data menentukan struktur data. Saat Anda mengimpor data terstruktur data menggunakan Gemini Enterprise, sistem akan otomatis mendeteksi skema. Anda dapat menggunakan skema yang terdeteksi otomatis atau menentukan skema menggunakan API. Untuk mengetahui informasi selengkapnya, lihat Menyediakan atau mendeteksi skema secara otomatis.
Region penyimpanan data
Saat menyerap data, Anda harus memilih region tempat Anda ingin menyimpan data, seperti global, AS, atau Uni Eropa. Untuk mengetahui informasi selengkapnya, lihat Komitmen residensi data dan pemrosesan regional ML. Data yang disimpan di region AS atau Uni Eropa memerlukan enkripsi data. Enkripsi default adalah dengan, tetapi sebagai alternatif, Anda dapat menggunakan kunci enkripsi yang dikelola pelanggan. Google-owned and Google-managed encryption key
Sinkronisasi data

Sinkronisasi data mengambil dan memperbarui data identitas data (seperti peran, izin, dan pengguna) serta data entity (seperti data terkait dengan sumber data tertentu) dari sumber data asli. Untuk mengetahui informasi selengkapnya, lihat Jenis dan jadwal sinkronisasi data.

Jenis dan jadwal sinkronisasi data

Sinkronisasi data mengambil data entity, data identitas, atau keduanya, dan memperbarui konten penyimpanan data di Gemini Enterprise.

Jenis sinkronisasi

Penyimpanan data di Gemini Enterprise menggunakan dua jenis sinkronisasi data penting:

  • Sinkronisasi penuh mengambil seluruh status aplikasi atau layanan pihak ketiga. Hal ini mencakup penambahan, pembaruan, dan penghapusan. Sinkronisasi penuh menggantikan konten penyimpanan data yang ada.

  • Sinkronisasi inkremental secara berkala mengambil data entity yang telah ditambahkan atau diperbarui sejak sinkronisasi terakhir. Sinkronisasi ini tidak menyinkronkan data identitas atau penghapusan data entity.

Anda dapat menjadwalkan sinkronisasi penuh secara terpisah untuk jenis data berikut:

  • Sinkronisasi entity mengambil data yang khusus untuk sumber data pihak ketiga. Misalnya, penyimpanan data untuk sistem seperti Jira dapat menyinkronkan masalah, log kerja, komentar, dan lampiran. Sinkronisasi entity tidak menyertakan informasi identitas.

  • Sinkronisasi identitas mengambil data tentang akun pengguna yang terkait dengan grup ACL.

Interaksi antara sinkronisasi identitas dan sinkronisasi penuh

Untuk memahami cara sinkronisasi identitas individual berjalan dengan sinkronisasi penuh, pertimbangkan skenario contoh yang mencakup dua halaman: page_1, yang ditautkan ke grup ACL group_1; dan page_2, yang ditautkan ke grup ACL group_2.

  1. Sinkronisasi identitas awal berjalan, dan mengambil informasi tentang grup group_1 dan group_2.

    • Asumsikan bahwa group_1 berisi pengguna user_1.

    • Asumsikan bahwa group_2 berisi pengguna user_2.

    Sinkronisasi identitas ini menetapkan pemetaan berikut:

    • user_1 dipetakan ke group_1.

    • user_2 dipetakan ke group_2.

  2. Bersamaan dengan sinkronisasi identitas, sinkronisasi penuh berjalan, mengambil page_1 dan page_2.

    Sinkronisasi penuh ini menetapkan pemetaan berikut:

    • user_1 memiliki akses ke page_1 (melalui group_1).

    • user_2 memiliki akses ke page_2 (melalui group_2).

Jadwal sinkronisasi

Untuk setiap penyimpanan data, Anda dapat memilih frekuensi untuk berbagai jenis sinkronisasi:

  • Sinkronisasi penuh semua data identitas dan data entity dapat dijadwalkan secara bersamaan setiap 3 jam, 6 jam, 12 jam, 1 hari, atau 3 hari.

  • Sinkronisasi penuh independen dari semua data identitas, dan sinkronisasi penuh independen dari semua data entity, dapat dijadwalkan secara terpisah menggunakan salah satu frekuensi sinkronisasi kustom berikut:

    • Data entity: Setiap 3 jam, 6 jam, 12 jam, 1 hari, 3 hari, 5 hari, dan setiap 7 hari.

    • Data identitas: Setiap 30 menit, 1 jam, 3 jam, 6 jam, 12 jam, 1 hari, 3 hari, 5 hari, dan setiap 7 hari.

  • Sinkronisasi inkremental data entity yang diperbarui atau ditambahkan dapat dijadwalkan setiap 3 jam, 6 jam, 12 jam, 1 hari, 3 hari, 5 hari, atau setiap 7 hari. Secara default, sinkronisasi inkremental dilakukan setiap 3 jam.

Rekomendasi frekuensi

Pilih frekuensi sinkronisasi data yang selaras dengan volume data yang diambil dan kueri per detik (QPS) yang direkomendasikan.

Tabel berikut menunjukkan jumlah data yang biasanya diambil untuk sinkronisasi satu, tiga, lima, dan tujuh hari. Jumlah data sebenarnya dapat bervariasi bergantung pada sumber data dan konfigurasinya.

QPS Volume data untuk sinkronisasi 1 hari Volume data untuk sinkronisasi 3 hari Volume data untuk sinkronisasi 5 hari Volume data untuk sinkronisasi 7 hari
5 432 ribu 1,296 juta 2,16 juta 3 juta
10 864 ribu 2,592 juta 4,32 juta 6 juta
20 1,7 juta 5,1 juta 8,5 juta 11,9 juta
50 4,3 juta 12,9 juta 21,5 juta 30,1 juta
100 8,6 juta 25,8 juta 43 juta 60,2 juta

Menjeda dan melanjutkan sinkronisasi

Anda dapat menjeda dan melanjutkan sinkronisasi penuh dan sinkronisasi inkremental:

  • Saat Anda menjeda jenis sinkronisasi, penyimpanan data akan membatalkan sinkronisasi yang sedang berlangsung dari jenis tersebut dan berhenti menjadwalkan sinkronisasi baru dari jenis tersebut.

  • Saat Anda melanjutkan jenis sinkronisasi, penyimpanan data akan menjadwalkan sinkronisasi baru berdasarkan waktu sinkronisasi terjadwal terakhir, tetapi tidak melanjutkan sinkronisasi yang sebelumnya terganggu.

Misalnya, jika Anda menjeda sinkronisasi penuh saat sinkronisasi penuh sedang berlangsung, penyimpanan data akan membatalkan sinkronisasi tersebut. Jika Anda kemudian melanjutkan sinkronisasi penuh, penyimpanan data akan otomatis menjadwalkan sinkronisasi penuh baru sesuai dengan jadwal sinkronisasi penuh.

Sumber data Google

Anda dapat terhubung ke sumber data Google, seperti BigQuery, Spanner, dan Google Drive.

Checklist untuk sumber data Google

Sebelum mengirim data ke Gemini Enterprise, lihat checklist berikut:

Sumber data Google yang didukung

Google Drive Gmail Google Kalender Penelusuran orang
Ikon untuk Google Drive. Ikon untuk Gmail. Ikon untuk Google Kalender. Ikon untuk Penelusuran orang.

Sumber data pihak ketiga

Penyimpanan data pihak ketiga menyerap data aplikasi pihak ketiga ke Gemini Enterprise.

Checklist untuk sumber data pihak ketiga

Sebelum menghubungkan sumber data pihak ketiga ke Gemini Enterprise, lihat checklist berikut:

  • Cakupan dan izin tertentu harus dikonfigurasi untuk sumber data tertentu. Administrator aplikasi pihak ketiga harus meninjau kredensial yang diperlukan untuk menghubungkan sumber data dan menyiapkan autentikasi serta izin. Untuk mengetahui informasi tentang cakupan dan izin tertentu, lihat dokumentasi sumber data pihak ketiga masing-masing.

  • Siapkan kontrol akses untuk penyimpanan data Anda. Untuk mengetahui informasi selengkapnya, lihat Identitas dan izin

  • Tentukan apakah data harus digabungkan atau diserap (diindeks).

  • Jika data diserap, pastikan resource tidak dibatasi untuk kredensial pengguna yang Anda gunakan untuk menyerap data ke sumber data.

  • Tentukan seberapa sering data harus disinkronkan.

  • Jika Anda menggunakan kunci enkripsi yang dikelola pelanggan (CMEK), buat kunci multi-region dan satu region. Untuk mengetahui informasi selengkapnya, lihat Mendaftarkan kunci satu region untuk penyimpanan data pihak ketiga.

  • Jika Anda memiliki informasi identitas pribadi (PII) dan ingin menggunakan pelengkapan otomatis untuk saran kueri, lihat melindungi dari kebocoran PII.

  • Jika Anda ingin traffic keluar dari penyimpanan data berasal dari kumpulan alamat IP tetap (misalnya, untuk mengizinkannya dalam daftar di sistem sumber), dan jika penyimpanan data mendukungnya, lihat Mengonfigurasi egress IP statis.

Sumber data pihak ketiga yang didukung

Microsoft Entra ID Microsoft OneDrive Microsoft Outlook Microsoft SharePoint
Ikon untuk Microsoft Entra ID. Ikon untuk OneDrive. Ikon untuk Microsoft Outlook. Ikon untuk SharePoint.
Jira Cloud Confluence Cloud ServiceNow
Ikon untuk Jira Cloud. Ikon untuk Confluence Cloud. Ikon untuk ServiceNow.