התכונה 'גישה לנתונים בענן' מאפשרת לשלוח שאילתות לנתונים שמאוחסנים אצל ספקי ענן אחרים ישירות מ- Google Cloud בלי להעביר קבצים או ליצור צינורות ETL מורכבים באמצעות Cross-Cloud Interconnect.
היכולת הזו היא חלק מborderless Lakehouse, והיא מאפשרת לכם לבצע ניתוח מאוחד ולהחיל AI על מערכי הנתונים המבוזרים שלכם באמצעות BigQuery, סביבות עצמאיות של Apache Spark או Managed Service for Apache Spark.
בנוסף לשאילתות אנליטיות, אפשר להשתמש בנתונים המאוחדים כדי לקבל תובנות מבוססות-AI ולנהל את הנתונים:
- ניתוח נתונים בשיחה: אפשר ליצור סוכנים מיוחדים שמבוססים על מקורות הנתונים המדויקים שלכם, כולל טבלאות חוצות עננים, כדי לנתח נתונים בעננים שונים מתוך שיחה אחת.
- Knowledge Catalog: אפשר להשתמש בתכונות של Knowledge Catalog כדי ליצור פרופילים של נתונים ולקבל תובנות ממקורות נתונים מאוחדים.
תרחישים לדוגמה
Lakehouse תומך בכמה תרחישי שימוש מרכזיים לגישה לנתונים בכמה ספקי ענן:
- העברת נתונים מופחתת מאפשרת לשלוח שאילתות לנתונים שמאוחסנים בסביבות ענן אחרות ישירות, וכך מפשטת את הגישה לנתונים ואת העיבוד שלהם.
- ניתוח נתונים מאוחד מאפשר לכם לבצע ניתוח נתונים מתקדם עם תכונות עקביות ואופטימיזציה של חומרה בכל הנתונים שלכם, בלי קשר למיקום שלהם.
- התכונה 'AI ו-ML ללא גבולות' מאפשרת להחיל מודלים של AI, סוכנים אוטונומיים ולמידת מכונה ישירות על הנתונים המרוחקים בלי להעביר אותם.
איך ניגשים לנתונים בענן אחר
שאילתות ב-Lakehouse שולפות נתונים מרחוק באמצעות התהליך הבא:
- גילוי מטא-נתונים: Google CloudLakehouse מתחבר לקטלוגים מרוחקים של Apache Iceberg REST, כמו Databricks Unity או AWS Glue. Lakehouse מגלה את הנתונים בלי להעתיק קבצים. בהתאם לספק הקטלוג המרוחק, Lakehouse מבצע אימות בצורה מאובטחת באמצעות Secret Manager או איחוד אסימונים של OpenID Connect עם Google כספק הזהויות (איחוד אסימונים של OIDC).
- העברה מאובטחת: ניתוב התנועה דרך חיבור פרטי (לדוגמה, Dedicated CCI או Partner Interconnect) מפחית באופן משמעותי את עלויות העברת הנתונים בהשוואה לאינטרנט הציבורי, ומאפשר לחזות את זמן האחזור בצורה מדויקת.
- ביצוע אופטימלי: כששאילתות קוראות נתונים מעננים מרוחקים, Lakehouse שומר באופן זמני במטמון את פלחי הנתונים האלה באופן מקומי בתוך Google Cloud באחסון ייעודי. שאילתות עוקבות משתמשות במטמון המקומי, וכך נמנעות חלק ניכר מהחיובים על תעבורת נתונים יוצאת בין עננים.
קטלוגים נתמכים
Lakehouse תומך בשאילתות של נתונים מהספקים הבאים של קטלוגים מרוחקים:
- Databricks Unity Catalog: נתמך ב-Amazon Web Services (AWS) וב-Google Cloud.
- AWS Glue: נתמך ב-Amazon Web Services (AWS).
- Snowflake Horizon Catalog: נתמך ב-Amazon Web Services (AWS) וב- Google Cloud.
- SAP Business Data Cloud (BDC): נתמך באמצעות המחבר SAP BDC.
מושגי ליבה
בקטע הזה מתוארים הרכיבים העיקריים שנדרשים לשימוש בתכונה של גישה לנתונים בין עננים.
שכבת מטא-נתונים
שכבת המטא-נתונים מתחברת לנקודות קצה מרוחקות של קטלוג REST של Apache Iceberg כדי לסנכרן מטא-נתונים של משאבי Iceberg (מרחב שמות, טבלה) על סמך מרווח רענון. Lakehouse מבצע אימות מאובטח באמצעות פרטי כניסה של OAuth שמאוחסנים ב-Secret Manager או ב-OIDC token federation.
שכבת התעבורה
שכבת התעבורה מאפשרת ל-BigQuery ולמנועי קוד פתוח לשלוח שאילתות לנתונים באמצעות המטא-נתונים המסונכרנים משכבת המטא-נתונים. בסוגים מסוימים של קטלוגים מרוחקים, Lakehouse תומך בשאילתות של נתונים באינטרנט הציבורי או בחיבור פרטי ייעודי.
בוחרים את שיטת ההעברה שתואמת לדרישות הארכיטקטורה והאבטחה שלכם:
בבעלות הלקוח (CCI)
אפשר להגדיר את BigQuery כך שיבצע שאילתות על נתונים שמאוחסנים בקטגוריות של Amazon S3 ב-Amazon Web Services (AWS) באמצעות חיבור פרטי של Cross-Cloud Interconnect, באמצעות Dedicated Cross-Cloud Interconnect או Partner Cross-Cloud Interconnect.
היתרונות של שימוש בחיבור פרטי בין רשתות:
- אבטחה משופרת: הנתונים עוברים דרך חיבור לרשת פרטית בין Google Cloud ל-AWS, וכך נמנעת גישה דרך האינטרנט הציבורי.
- עלויות מופחתות: יכול להיות שתשלמו פחות על תעבורת נתונים יוצאת מ-AWS בהשוואה לתעבורת נתונים יוצאת לאינטרנט, במיוחד אם משלבים את זה עם קיבולת החיבור הפרטי.
- ביצועים עקביים: זמן טעינה ורוחב פס צפויים יותר ברשת בהשוואה לאינטרנט הציבורי.
סקירה כללית של הארכיטקטורה
כדי להפעיל שאילתות פרטיות, צריך להגדיר נתיב מ-BigQuery לקטגוריית AWS Amazon S3 דרך חיבור פרטי. רכיב מרכזי ב Google Cloudענן וירטואלי פרטי (VPC) הוא מאזן עומסים פנימי (ILB). ה-ILB מחלק את הבקשות מ-BigQuery לנקודות הקצה הפרטיות של Amazon S3 ב-AWS VPC, שמוקצות באמצעות AWS PrivateLink.
שימוש במאזן עומסים פנימי (ILB) עם כמה ממשקי רשת אלסטיים (ENI) כבק-אנד הוא חיוני לאיזון עומסים, למדרגיות ולזמינות גבוהה. זה רלוונטי גם אם משתמשים ב-Dedicated CCI או ב-Partner Interconnect.
תהליך העבודה של שאילתות פרטיות מתבצע באופן הבא:
- BigQuery משתמש בחיבור שהוגדר עם שירות Service Directory.
- Service Directory מזהה את שם השירות ככתובת ה-IP הפנימית של Google Cloud ILB.
- מאזן העומסים הפנימי מקבל את הבקשות מ-BigQuery ומפיץ אותן למערכות עורפיות שהוגדרו.
- העורפים של איזון העומסים הפנימי הם קבוצות של נקודות קצה ברשת (NEGs) של קישוריות היברידית, וכל אחת מהן מצביעה על כתובת ה-IP הפרטית של ENI ב-AWS VPC.
- התנועה זורמת מ-ILB, דרך NEGs, דרך חיבור פרטי, אל AWS ENIs.
- ממשקי הרשת של AWS, שהם חלק מנקודת קצה (endpoint) של ממשק Amazon S3 VPC (AWS PrivateLink), מספקים גישה פרטית לשירות Amazon S3.
אינטרנט ציבורי (ללא CCI)
אם לא מגדירים חיבור פרטי בין רשתות, שאילתות לקטלוג המרוחק עוברות דרך האינטרנט הציבורי כברירת מחדל.
כששולחים שאילתות לנתונים דרך האינטרנט הציבורי, חשוב להביא בחשבון את ההשלכות הבאות:
- הצפנה רגילה: בקשות לגישה לנתונים והעברות נתונים מוצפנות בזמן ההעברה באמצעות פרוטוקולי TLS רגילים באינטרנט הציבורי.
- עלויות של תעבורת נתונים יוצאת (egress): על העברת נתונים חלים חיובים סטנדרטיים של תעבורת נתונים יוצאת באינטרנט מספק שירותי הענן המרוחק (לדוגמה, AWS), שבדרך כלל גבוהים יותר מתעריפי תעבורת נתונים יוצאת של חיבור פרטי.
- זמן אחזור משתנה: הביצועים, רוחב הפס וזמן האחזור של הרשת תלויים בניתוב ובגודש של האינטרנט הציבורי, ולכן קשה יותר לחזות את זמני הביצוע של השאילתות בהשוואה לחיבור פרטי ייעודי.
- הגדרה פשוטה: לא נדרשת תשתית רשת נוספת, שיוך של VPC או הגדרה של Service Directory ב- Google Cloud או בספק הענן המרוחק.
סקירה כללית של הארכיטקטורה
כשמבצעים שאילתות על נתונים באינטרנט הציבורי, Lakehouse מתחבר ישירות לנקודות הקצה של הקטלוג המרוחק ואחסון האובייקטים, בלי לדרוש תשתית פרטית Google Cloud או תשתית של רשתות ענן מרוחקות.
תהליך העבודה של שאילתות באינטרנט הציבורי מתבצע כך:
- מערכת BigQuery מפעילה שאילתה לגבי טבלה מאוחדת שמוגדרת בקטלוג של Lakehouse.
- Lakehouse מאמת בצורה מאובטחת את קטלוג Apache Iceberg המרוחק באמצעות פרטי כניסה שמאוחסנים ב-Secret Manager או באיחוד טוקנים של OIDC.
- Lakehouse מאחזר את המטא-נתונים של הטבלה ואת קובצי המניפסט באינטרנט הציבורי כדי לזהות את קובצי הנתונים הרלוונטיים (לדוגמה, ב-AWS Amazon S3).
- בקשות לגישה לנתונים של האובייקטים הבסיסיים נשלחות ישירות מ-Google Cloud דרך האינטרנט הציבורי באמצעות הצפנת TLS רגילה.
- שירות האחסון המרוחק מאמת את הבקשה באמצעות פרטי כניסה זמניים עם היקף הרשאות מוגבל שמונפקים על ידי Lakehouse, ומחזיר את בלוקי הנתונים המבוקשים דרך האינטרנט הציבורי אל Google Cloud.
המאמרים הבאים
- הגדרת חיבור בין עננים ל-AWS Glue, Databricks Unity Catalog, Snowflake Horizon Catalog או SAP Business Data Cloud.