מידע על קטלוג Apache Iceberg מותאם אישית לנקודת קצה של BigQuery

נקודת הקצה של קטלוג Apache Iceberg מותאם אישית ל-BigQuery מחברת מנועי שאילתות בקוד פתוח כמו Apache Spark ו-Apache Flink אל קטלוג זמן הריצה של Lakehouse. על ידי שילוב תוסף קטלוג מותאם אישית (BigQueryMetastoreCatalog), נקודת קצה זו מאפשרת לך לנהל ולשאול מטא-נתונים של טבלת Apache Iceberg ישירות דרך BigQuery, תוך אחסון קבצי נתונים ומטא-נתונים ב-Cloud Storage.

איך פועל קטלוג Iceberg מותאם אישית

קטלוג Apache Iceberg המותאם אישית משתמש במימוש קטלוג מותאם אישית (org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog) המסופק בספריית JAR. כאשר עומסי עבודה חישוביים שלך פועלים על Managed Service for Apache Spark, המנוע משתמש בתוסף זה כדי לקיים אינטראקציה עם BigQuery כמאגר מטא-נתונים עבור טבלאות Apache Iceberg שלך.

תהליך העבודה פועל באופן הבא:

  1. הטמעה של קטלוג: מנועי שאילתות טוענים את קובץ ה-JAR של קטלוג BigQuery Metastore ומגדירים את מאפייני הקטלוג של סשן Spark לשימוש ב-org.apache.iceberg.gcp.bigquery.BigQueryMetastoreCatalog.
  2. ניהול מטא-נתונים: כשיוצרים או משנים טבלאות באמצעות ממשקי Spark SQL או DataFrame API, הפלאגין שומר את ההגדרות של מערכי הנתונים והטבלאות ב-BigQuery.
  3. אחסון נתונים: קובצי מטא-נתונים של Apache Iceberg ‏ (metadata.json, רשימות מניפסטים, מניפסטים) וקובצי נתונים (כמו קובצי Parquet) מאוחסנים ישירות בנתיב מחסן הנתונים שצוין ב-Cloud Storage.
  4. גישה בין מנועים: מכיוון שהמטא-נתונים רשומים ב-BigQuery, אפשר להריץ שאילתות על טבלאות גם ממנועי קוד פתוח כמו Spark וגם ישירות מ-BigQuery.

היררכיית המשאבים

הנקודה הסופית של קטלוג Apache Iceberg בהתאמה אישית ל-BigQuery מארגנת את המטא-נתונים בהיררכיה הבאה:

משאב תיאור
פרויקט הפרויקט Google Cloud שמכיל את משאבי BigQuery ואת האחסון במחסן הנתונים ב-Cloud Storage.
מרחב שמות (מערך נתונים) מערך נתונים של BigQuery שתצורתו נקבעה לפעול כמרחב שמות של Iceberg, המגדיר את מיקום ברירת המחדל של אחסון בענן עבור טבלאות שנוצרו בתוכו.
טבלה טבלת Apache Iceberg שהסכימה, התמונות והמטא-נתונים שלה מתועדים ב-BigQuery, וקבצי הנתונים שלה נמצאים ב-Cloud Storage.

השוואה בין קטלוגים מותאמים אישית של Iceberg לבין קטלוגים של Iceberg REST

הטבלה הבאה מסכמת את ההבדלים העיקריים בין קטלוג Apache Iceberg המותאם אישית עבור נקודת הקצה של BigQuery לבין נקודת הקצה של קטלוג Apache Iceberg REST:

תכונה קטלוג אייסברג מותאם אישית עבור BigQuery נקודת קצה של קטלוג REST של Apache Iceberg (מומלץ)
תקן Catalog API תוסף בהתאמה אישית (BigQueryMetastoreCatalog) ‫Open standard Apache Iceberg REST Catalog API
Catalog hierarchy פרויקט > מערך נתונים ב-BigQuery > טבלה פרויקט > קטלוג > מרחב שמות > טבלה (P.C.N.T)
הגדרת האחסון נתיבי Cloud Storage שצוינו לכל מערך נתונים או טבלה קטלוגים של כמה קטגוריות (bl://) או של קטגוריה אחת (gs://)
מכירת פרטי כניסה לא נתמך (נעשה שימוש בפרטי כניסה ישירים של IAM) נתמך (מנפיק אסימוני גישה לטווח קצר לאחסון)
תוכנית התאוששות מאסון (DR) לא נתמך נתמך (רפליקציה בין אזורים ומעבר לגיבוי בעת כשל)
מומלץ ל פריסות ותהליכי עבודה קיימים עומסי עבודה חדשים ושילובים סטנדרטיים של לקוח REST של Iceberg

המאמרים הבאים