Konektor mendapatkan data dari sumber data Google dan pihak ketiga ke Gemini Enterprise, dan menyimpannya di penyimpanan data khusus. Dokumen ini memberikan ringkasan tentang konektor tersebut. Memusatkan data Anda di Gemini Enterprise akan meningkatkan aksesibilitas data, fungsi penelusuran, dan kemampuan analisis.
Konsep konektor dan penyimpanan data
Penyimpanan data |
| Setiap sumber data mendukung serangkaian jenis entity. Misalnya, Jira Cloud memiliki entity seperti masalah, lampiran, komentar, dan log kerja, yang unik untuk sumber data. Gemini Enterprise membuat penyimpanan data terpisah untuk setiap entity. Oleh karena itu, saat Anda membuat penyimpanan data menggunakan Google Cloud konsol, Anda akan mendapatkan kumpulan penyimpanan data yang mewakili entity data yang diserap ini. |
Penggabungan data versus penyerapan (pengindeksan) |
| Penggabungan data mengambil
informasi langsung dari sumber data yang ditentukan. Karena data tidak disalin ke dalam
indeks Gemini Enterprise, Anda tidak perlu khawatir tentang penyimpanan data
storage. Namun, karena data tidak diindeks, kualitas penelusuran mungkin lebih rendah.Penyerapan data (pengindeksan) menyalin data ke dalam indeks Gemini Enterprise. Hal ini dapat meningkatkan kualitas penelusuran. Namun, proses ini menggunakan lebih banyak penyimpanan dan waktu. Jika konektor mendukung penggabungan data dan penyerapan data, pilih metode koneksi data yang Anda inginkan. |
Data tidak terstruktur |
| Format data yang didukung khusus untuk sumber data dan jenis entity. Jika konten dalam entity disimpan dalam format tidak terstruktur—seperti PDF, HTML, DOCX, PPTX, XLSX, dan XLSM—penyimpanan data tidak terstruktur akan dibuat oleh Gemini Enterprise. Untuk mengetahui informasi selengkapnya dan jenis file yang didukung, lihat Penelusuran tidak terstruktur. |
Data terstruktur |
| Format data yang didukung khusus untuk sumber data dan jenis entity. Jika konten dalam entity disimpan dalam format terstruktur, penyimpanan data terstruktur akan dibuat oleh Gemini Enterprise. Untuk mengetahui informasi selengkapnya, lihat Penelusuran terstruktur. |
Skema data |
| Skema data menentukan struktur data. Saat Anda mengimpor data terstruktur data menggunakan Gemini Enterprise, sistem akan otomatis mendeteksi skema. Anda dapat menggunakan skema yang terdeteksi otomatis atau menentukan skema menggunakan API. Untuk mengetahui informasi selengkapnya, lihat Menyediakan atau mendeteksi skema secara otomatis. |
Region penyimpanan data |
| Saat menyerap data, Anda harus memilih region tempat Anda ingin menyimpan data, seperti global, AS, atau Uni Eropa. Untuk mengetahui informasi selengkapnya, lihat Komitmen residensi data dan pemrosesan regional ML. Data yang disimpan di region AS atau Uni Eropa memerlukan enkripsi data. Enkripsi default adalah dengan, tetapi sebagai alternatif, Anda dapat menggunakan kunci enkripsi yang dikelola pelanggan. Google-owned and Google-managed encryption key |
Sinkronisasi data |
Sinkronisasi data mengambil dan memperbarui data identitas data (seperti peran, izin, dan pengguna) serta data entity (seperti data terkait dengan sumber data tertentu) dari sumber data asli. Untuk mengetahui informasi selengkapnya, lihat Jenis dan jadwal sinkronisasi data. |
Jenis dan jadwal sinkronisasi data
Sinkronisasi data mengambil data entity, data identitas, atau keduanya, dan memperbarui konten penyimpanan data di Gemini Enterprise.
Jenis sinkronisasi
Penyimpanan data di Gemini Enterprise menggunakan dua jenis sinkronisasi data penting:
Sinkronisasi penuh mengambil seluruh status aplikasi atau layanan pihak ketiga. Hal ini mencakup penambahan, pembaruan, dan penghapusan. Sinkronisasi penuh menggantikan konten penyimpanan data yang ada.
Sinkronisasi inkremental secara berkala mengambil data entity yang telah ditambahkan atau diperbarui sejak sinkronisasi terakhir. Sinkronisasi ini tidak menyinkronkan data identitas atau penghapusan data entity.
Anda dapat menjadwalkan sinkronisasi penuh secara terpisah untuk jenis data berikut:
Sinkronisasi entity mengambil data yang khusus untuk sumber data pihak ketiga. Misalnya, penyimpanan data untuk sistem seperti Jira dapat menyinkronkan masalah, log kerja, komentar, dan lampiran. Sinkronisasi entity tidak menyertakan informasi identitas.
Sinkronisasi identitas mengambil data tentang akun pengguna yang terkait dengan grup ACL.
Interaksi antara sinkronisasi identitas dan sinkronisasi penuh
Untuk memahami cara sinkronisasi identitas individual berjalan dengan sinkronisasi penuh, pertimbangkan skenario contoh yang mencakup dua halaman: page_1, yang ditautkan ke grup ACL group_1; dan page_2, yang ditautkan ke grup ACL group_2.
Sinkronisasi identitas awal berjalan, dan mengambil informasi tentang grup
group_1dangroup_2.Asumsikan bahwa
group_1berisi penggunauser_1.Asumsikan bahwa
group_2berisi penggunauser_2.
Sinkronisasi identitas ini menetapkan pemetaan berikut:
user_1dipetakan kegroup_1.user_2dipetakan kegroup_2.
Bersamaan dengan sinkronisasi identitas, sinkronisasi penuh berjalan, mengambil
page_1danpage_2.Sinkronisasi penuh ini menetapkan pemetaan berikut:
user_1memiliki akses kepage_1(melaluigroup_1).user_2memiliki akses kepage_2(melaluigroup_2).
Jadwal sinkronisasi
Untuk setiap penyimpanan data, Anda dapat memilih frekuensi untuk berbagai jenis sinkronisasi:
Sinkronisasi penuh semua data identitas dan data entity dapat dijadwalkan secara bersamaan setiap 3 jam, 6 jam, 12 jam, 1 hari, atau 3 hari.
Sinkronisasi penuh independen dari semua data identitas, dan sinkronisasi penuh independen dari semua data entity, dapat dijadwalkan secara terpisah menggunakan salah satu frekuensi sinkronisasi kustom berikut:
Data entity: Setiap 3 jam, 6 jam, 12 jam, 1 hari, 3 hari, 5 hari, dan setiap 7 hari.
Data identitas: Setiap 30 menit, 1 jam, 3 jam, 6 jam, 12 jam, 1 hari, 3 hari, 5 hari, dan setiap 7 hari.
Sinkronisasi inkremental data entity yang diperbarui atau ditambahkan dapat dijadwalkan setiap 3 jam, 6 jam, 12 jam, 1 hari, 3 hari, 5 hari, atau setiap 7 hari. Secara default, sinkronisasi inkremental dilakukan setiap 3 jam.
Rekomendasi frekuensi
Pilih frekuensi sinkronisasi data yang selaras dengan volume data yang diambil dan kueri per detik (QPS) yang direkomendasikan.
Tabel berikut menunjukkan jumlah data yang biasanya diambil untuk sinkronisasi satu, tiga, lima, dan tujuh hari. Jumlah data sebenarnya dapat bervariasi bergantung pada sumber data dan konfigurasinya.
| QPS | Volume data untuk sinkronisasi 1 hari | Volume data untuk sinkronisasi 3 hari | Volume data untuk sinkronisasi 5 hari | Volume data untuk sinkronisasi 7 hari |
|---|---|---|---|---|
| 5 | 432 ribu | 1,296 juta | 2,16 juta | 3 juta |
| 10 | 864 ribu | 2,592 juta | 4,32 juta | 6 juta |
| 20 | 1,7 juta | 5,1 juta | 8,5 juta | 11,9 juta |
| 50 | 4,3 juta | 12,9 juta | 21,5 juta | 30,1 juta |
| 100 | 8,6 juta | 25,8 juta | 43 juta | 60,2 juta |
Menjeda dan melanjutkan sinkronisasi
Anda dapat menjeda dan melanjutkan sinkronisasi penuh dan sinkronisasi inkremental:
Saat Anda menjeda jenis sinkronisasi, penyimpanan data akan membatalkan sinkronisasi yang sedang berlangsung dari jenis tersebut dan berhenti menjadwalkan sinkronisasi baru dari jenis tersebut.
Saat Anda melanjutkan jenis sinkronisasi, penyimpanan data akan menjadwalkan sinkronisasi baru berdasarkan waktu sinkronisasi terjadwal terakhir, tetapi tidak melanjutkan sinkronisasi yang sebelumnya terganggu.
Misalnya, jika Anda menjeda sinkronisasi penuh saat sinkronisasi penuh sedang berlangsung, penyimpanan data akan membatalkan sinkronisasi tersebut. Jika Anda kemudian melanjutkan sinkronisasi penuh, penyimpanan data akan otomatis menjadwalkan sinkronisasi penuh baru sesuai dengan jadwal sinkronisasi penuh.
Sumber data Google
Anda dapat terhubung ke sumber data Google, seperti BigQuery, Spanner, dan Google Drive.
Checklist untuk sumber data Google
Sebelum mengirim data ke Gemini Enterprise, lihat checklist berikut:
Siapkan kontrol akses untuk sumber data Anda. Untuk mengetahui informasi selengkapnya, lihat Identitas dan izin.
Tentukan apakah data harus digabungkan atau diserap (diindeks).
Tentukan seberapa sering data harus disinkronkan.
Jika Anda menggunakan kunci enkripsi yang dikelola pelanggan (CMEK), buat kunci multi-region. Untuk mengetahui informasi selengkapnya, lihat Mendaftarkan kunci satu region untuk sumber data pihak ketiga.
Jika Anda memiliki informasi identitas pribadi (PII) dan ingin menggunakan pelengkapan otomatis untuk saran kueri, lihat melindungi dari kebocoran PII.
Sumber data Google yang didukung
| Google Drive | Gmail | Google Kalender | Penelusuran orang |
|
|
|
|
|
Sumber data pihak ketiga
Penyimpanan data pihak ketiga menyerap data aplikasi pihak ketiga ke Gemini Enterprise.
Checklist untuk sumber data pihak ketiga
Sebelum menghubungkan sumber data pihak ketiga ke Gemini Enterprise, lihat checklist berikut:
Cakupan dan izin tertentu harus dikonfigurasi untuk sumber data tertentu. Administrator aplikasi pihak ketiga harus meninjau kredensial yang diperlukan untuk menghubungkan sumber data dan menyiapkan autentikasi serta izin. Untuk mengetahui informasi tentang cakupan dan izin tertentu, lihat dokumentasi sumber data pihak ketiga masing-masing.
Siapkan kontrol akses untuk penyimpanan data Anda. Untuk mengetahui informasi selengkapnya, lihat Identitas dan izin
Tentukan apakah data harus digabungkan atau diserap (diindeks).
Jika data diserap, pastikan resource tidak dibatasi untuk kredensial pengguna yang Anda gunakan untuk menyerap data ke sumber data.
Tentukan seberapa sering data harus disinkronkan.
Jika Anda menggunakan kunci enkripsi yang dikelola pelanggan (CMEK), buat kunci multi-region dan satu region. Untuk mengetahui informasi selengkapnya, lihat Mendaftarkan kunci satu region untuk penyimpanan data pihak ketiga.
Jika Anda memiliki informasi identitas pribadi (PII) dan ingin menggunakan pelengkapan otomatis untuk saran kueri, lihat melindungi dari kebocoran PII.
Jika Anda ingin traffic keluar dari penyimpanan data berasal dari kumpulan alamat IP tetap (misalnya, untuk mengizinkannya dalam daftar di sistem sumber), dan jika penyimpanan data mendukungnya, lihat Mengonfigurasi egress IP statis.
Sumber data pihak ketiga yang didukung
| Microsoft Entra ID | Microsoft OneDrive | Microsoft Outlook | Microsoft SharePoint |
|
|
|
|
|
| Jira Cloud | Confluence Cloud | ServiceNow | |
|
|
|
|