מושגים מרכזיים

במסמך הזה מוגדרים המונחים והמושגים המרכזיים של borderless Lakehouse.

הדף הזה לא כולל רשימה מלאה של תכונות, אלא הוא משמש כהפניה כללית למונחים ולמושגים שמופיעים בתיעוד של Lakehouse ב-Google Cloud.

מושגים מרכזיים

המושגים הבאים הם הבסיס לארכיטקטורת Lakehouse של Google Cloud.

Data lakehouse

מחסן נתונים מסוג Lakehouse משלב בין החיסכון בעלויות והגמישות של אגם נתונים לבין ניהול הנתונים והביצועים של מחסן נתונים. הוא מאפשר לכם לאחסן נתונים בפורמטים פתוחים ב-Cloud Storage ולהשתמש בתכונות של BigQuery, כמו אמצעי בקרה מדויקים לאבטחה ושאילתות מהירות.

אדריכלות מדליון

תבנית עיצוב נפוצה ב-data lakehouse היא ארכיטקטורת מדליון, שמארגנת את הנתונים באופן לוגי בשכבות מתקדמות של מבנה ואיכות:

  • שכבת ברונזה (נתונים גולמיים): קליטה ואחסון של נתונים גולמיים בפורמטים פתוחים כמו Apache Iceberg ב-Cloud Storage.
  • שכבת כסף (מטוהרת): הנתונים הגולמיים עוברים טיהור, סינון והעשרה לטבלאות סטנדרטיות.
  • שכבת Gold (מנוהלת): מספקת טבלאות מנוהלות ומצטברות ברמת העסק. ב-Lakehouse של Google Cloud,‏ BigQuery משמש לעיתים קרובות להצגת שכבת הזהב לצריכה, לדיווח ולניתוח עם ביצועים גבוהים.

יכולת פעולה הדדית פתוחה

יכולת פעולה הדדית פתוחה היא היכולת של מערכות אנליטיות וטרנזקציונליות מרובות – כמו BigQuery,‏ Apache Spark ו-Apache Flink – לפעול על עותק יחיד של נתונים בפורמטים פתוחים כמו Apache Iceberg. כך לא צריך לשכפל נתונים, ומתקבלת תצוגה עקבית של נתונים בכלים שונים.

קטלוג של סביבת זמן ריצה של Lakehouse

קטלוג זמן הריצה של Lakehouse הוא שירות מטא-נתונים מרכזי ללא שרת (serverless) שמשמש כמקור האמת היחיד של Lakehouse ב-Google Cloud. הוא מאפשר למספר מנועים, כמו Apache Spark,‏ Apache Flink ו-BigQuery, לגלות ולשאול את אותן טבלאות בו-זמנית.

סוגי קטלוגים

קטלוג זמן הריצה של Lakehouse מציע סוגים שונים של קטלוגים לניהול המטא-נתונים.

נקודת הקצה של קטלוג REST של Apache Iceberg

זהו קטלוג שמבוסס על נקודת הקצה של קטלוג REST של Apache Iceberg. הוא מספק יכולת פעולה הדדית בין מנועי קוד פתוח לבין BigQuery, ותומך בתכונות כמו מכירת אישורים ותוכנית התאוששות מאסון (DR).

הגדרות אחסון של קטלוגים

כשיוצרים נקודת קצה של קטלוג REST של Apache Iceberg, אפשר לבחור בין שני מודלים של אחסון:

  • קטלוג עם כמה קטגוריות (מומלץ): מאפשר לתת לקטלוג שם באופן עצמאי ולהגדיר עד 15 קטגוריות ב-Cloud Storage‏ (default_location ו-restricted_locations). כשמגדירים מנועי שאילתות של לקוחות (כמו Spark או Trino), צריך להגדיר את נתיב מחסן הנתונים ל-bl://projects/PROJECT_ID/catalogs/CATALOG_ID.
  • קטלוג עם קטגוריה אחת: הגדרה מדור קודם שבה הקטלוג נעול לקטגוריה אחת של Cloud Storage ומשתמש בשם של הקטגוריה. כשמגדירים מנועי שאילתות בצד הלקוח, צריך להגדיר את הנתיב למחסן הנתונים לערך gs://CLOUD_STORAGE_BUCKET_NAME.

קטלוג מותאם אישית של Apache Iceberg ל-BigQuery

זהו שילוב שמשתמש בקטלוג BigQuery ישירות כשירות המטא-נתונים הבסיסי לטבלאות מנוהלות של Apache Iceberg.

נקודת קצה של קטלוג Apache Hive

נקודת הקצה הזו מספקת תאימות לעומסי עבודה (workloads) בקוד פתוח שתלויים בממשק של Apache Hive metastore‏ (HMS), ומאפשרת להריץ עומסי עבודה של Apache Hive או של Spark מול שירות metastore מנוהל ב-Google Cloud.

סוגי טבלאות

ה-Lakehouse של Google Cloud תומך בכמה פורמטים של טבלאות, בהתאם למנוע שמשמש לניהול הנתונים ולנקודת הקצה של הקטלוג שבה אתם משתמשים.

טבלאות Apache Iceberg

אלה טבלאות Apache Iceberg שאתם יוצרים ממנועי קוד פתוח ומאחסנים ב-Cloud Storage. הקטלוג של Lakehouse runtime מנהל את הטבלאות האלה ומספק גישה אליהן דרך נקודת הקצה של קטלוג REST של Apache Iceberg. למנועי קוד פתוח יש גישת קריאה וכתיבה לטבלאות האלה, ול-BigQuery יש גישת קריאה וגישת כתיבה (גרסת Preview). האפשרות הזו מתאימה אם אתם רוצים שמנועי קוד פתוח ינהלו את תהליך העבודה של ה-ETL.

טבלאות ב-BigQuery

הטבלאות האלה מנוהלות באמצעות BigQuery.

טבלאות Apache Iceberg

אלו הן טבלאות Apache Iceberg שיוצרים מ-BigQuery ומאחסנים ב-Cloud Storage. ‫BigQuery מטפל בכל פריסת הנתונים והאופטימיזציה שלהם. אפשר לקרוא את הטבלאות האלה בכמה מנועים, אבל רק מנוע BigQuery יכול לכתוב בהן ישירות.

טבלאות מקוריות

הטבלאות האלה מנוהלות על ידי BigQuery והנתונים מאוחסנים ב-BigQuery. אפשר לקשר את הטבלאות האלה לקטלוג של זמן הריצה של Lakehouse.

טבלאות חיצוניות

טבלאות חיצוניות נמצאות מחוץ לקטלוג של זמן הריצה של Lakehouse. הנתונים והמטא-נתונים מנוהלים באופן עצמאי בקטלוג של צד שלישי (כמו Cloud Storage,‏ S3 או Azure Blob Storage). מערכת BigQuery יכולה רק לקרוא את הטבלאות האלה.

תכונות של טבלאות

התפתחות הטבלה

‫Lakehouse של Google Cloud תומך באבולוציה של טבלאות Apache Iceberg, שמאפשרת לשנות את הסכימה או את מפרט החלוקה של טבלה לאורך זמן בלי לשכתב את נתוני הטבלה או ליצור מחדש את הטבלה.

מסע בזמן

התכונה 'מסע בזמן' מאפשרת לשלוח שאילתה לנתונים של טבלה כפי שהם היו בנקודת זמן ספציפית או במזהה של תמונת מצב. האפשרות הזו שימושית לביקורת, לשחזור ניסויים או לשחזור נתונים אחרי מחיקה בטעות.

שמירת מטא-נתונים במטמון

שמירת מטא-נתונים במטמון היא תכונה שמאיצה את ביצועי השאילתות בטבלאות חיצוניות. הוא שומר עותק של המטא-נתונים של הטבלה באחסון של BigQuery, וכך מצמצם את הצורך לקרוא קבצי מטא-נתונים מ-Cloud Storage במהלך ביצוע השאילתה.

ניהול טבלאות Lakehouse ב-Google Cloud

ניהול טבלאות Lakehouse של Google Cloud מפשט את תחזוקת Lakehouse על ידי אוטומציה של משימות כגון דחיסה ואיסוף אשפה עבור טבלאות מנוהלות. כך אפשר לשפר את ביצועי השאילתות ואת יעילות האחסון.

מושגים שקשורים ליכולת פעולה הדדית

Borderless Lakehouse

‫Borderless Lakehouse מרחיב את Lakehouse של Google Cloud ומאפשר לכם להתחבר לקטלוגים חיצוניים מרוחקים (כמו Databricks Unity Catalog,‏ AWS Glue,‏ Snowflake Horizon Catalog,‏ Workday Data Lake או SAP BDC). הוא מסנכרן מטא-נתונים מספקי ענן אחרים, ומאפשר לכם לבצע שאילתות על נתונים באמצעות BigQuery או מנועי קוד פתוח חיצוניים דרך נקודת הקצה של קטלוג Apache Iceberg REST, בלי להעביר את הנתונים.

מערכי נתונים ציבוריים

ב-Lakehouse של Google Cloud מתארחים מערכי נתונים ציבוריים באיכות גבוהה שמוגשים דרך קטלוג REST של Apache Iceberg. כך אפשר לקבל גישה לקריאה בלבד לצורך ניתוח ובדיקה, בלי לנהל תשתית.

מבנה השמות של P.C.N.T.

מבנה השמות P.C.N.T. הוא מוסכמה בת ארבעה חלקים שמשמשת לזיהוי ייחודי של טבלאות בקטלוג של זמן הריצה של Lakehouse ולשליחת שאילתות לגביהן מ-BigQuery. הוא מייצג את Project.Catalog.Namespace.Table:

  • ‫Project: מזהה הפרויקט. Google Cloud
  • ‫Catalog: השם של קטלוג זמן הריצה של Lakehouse.
  • Namespace: הקיבוץ הלוגי של הטבלאות (דומה למערך נתונים).
  • Table: שם טבלת הנתונים.

מושגי אבטחה

חיבורים

חיבור הוא משאב ב-BigQuery שבו מאוחסנים פרטי הכניסה לגישה לנתונים חיצוניים. ב-Lakehouse של Google Cloud, חיבורים מעניקים גישה ל-Cloud Storage על ידי מתן גישה לחשבון השירות של החיבור לקטגוריית האחסון בשמכם.

הקצאת פרטי כניסה

הקצאת הרשאות היא מנגנון אבטחה שעוזר להגביר את בקרת הגישה כשמשתמשים בקטלוג של Lakehouse runtime. כשהשירות מופעל, הוא יוצר פרטי כניסה לטווח קצר עם היקף מצומצם, שנועדו להעניק גישה רק לנתיבי הקבצים הספציפיים שנדרשים לשאילתה.

ניהול מאוחד

ניהול מאוחד מאפשר לכם להגדיר ולאכוף מדיניות אבטחה וניהול נתונים באופן מרכזי באמצעות שילוב עם Knowledge Catalog. כשרושמים טבלאות בקטלוג של Lakehouse runtime, המערכת רושמת באופן אוטומטי רשומות תואמות בקטלוג של המטא-נתונים העסקיים (Knowledge Catalog), וכך מאפשרת מעקב אחר מקורות נתונים, חיפוש סמנטי וניהול מרכזי במנועים שונים בלי להעביר או להעתיק קבצים.

מושגים במנוע השאילתות

ארכיטקטורת Lakehouse של Google Cloud מפרידה בין אחסון לבין מחשוב, ומאפשרת למנועי ניתוח שונים ליצור אינטראקציה עם טבלאות פתוחות.

Managed Service for Apache Spark

‫Managed Service for Apache Spark (לשעבר Managed Service for Apache Spark) מספק סביבת ריצה שמנוהלת במלואה לעיבוד פורמטים של טבלאות פתוחות כמו Apache Iceberg. הוא תומך בשני מצבי ביצוע עיקריים:

  • אצוות ללא שרת: מיועדות לצינורות אוטומטיים לעיבוד נתונים ולעומסי עבודה של ETL שאינם אינטראקטיביים. מודל התשלום לפי ביצוע מבטל את הצורך בניהול אשכולות, מסיר את התחרות על משאבים בין משימות ומבצע אוטומציה של תחזוקת התשתית.
  • סשנים אינטראקטיביים בלי שרת (serverless): מיועדים לניתוח נתונים לצורך גילוי תובנות, להנדסת נתונים ולניסויים במדע הנתונים. הפעלת מחברות Apache Spark מתבצעת באמצעות הפעלת Spark Connect או ליבות Spark מרוחקות, וכך מתקבלת סביבה עם שינוי גודל אוטומטי ללא צורך בהגדרת תשתית.

רמות שירות

כשמריצים עומסי עבודה של Apache Spark מול קטלוג זמן הריצה של Lakehouse, אפשר לבחור בין רמות שירות שונות:

  • מסלול רגיל: מסלול הביצוע שמוגדר כברירת מחדל ומתאים לעומסי עבודה רגילים של עיבוד אצווה.
  • מסלול פרימיום: מספק יכולות מתקדמות, כולל תמיכה בסשנים אינטראקטיביים של מחברות בלי שרת (serverless) ותכונות לשיפור הביצועים כמו Lightning Engine.

תבניות של סשנים

תבניות של סשנים מפשטות את ההגדרה של סשנים אינטראקטיביים ללא שרת. הם מאפשרים לאדמינים להגדיר ולשמור הגדרות סביבה נפוצות (כמו מאפייני קטלוג, הגדרות רשת וגרסאות זמן ריצה). כך אפשר לשמור על עקביות ולשפר את הפרודוקטיביות של המפתחים על ידי צמצום הצורך בהגדרה חוזרת. אפשר ליצור ולנהל תבניות של סשנים באמצעות מסוף Google Cloud ,‏ gcloud CLI,‏ API בארכיטקטורת REST או Terraform.

מושגים שקשורים לאמינות

שכפול בין אזורים

רפליקציה בין אזורים יוצרת רפליקות של מטא-נתונים בכמה אזורים כדי להבטיח את הזמינות של הקטלוג במהלך הפסקות חשמל אזוריות.

מעבר לגיבוי (Failover)

מעבר לגיבוי (Failover) הוא תהליך של מעבר בין אזורים ראשיים ומשניים במהלך הפסקת חשמל אזורית, כדי לשמור על פעולות הקטלוג.