ייבוא נתונים מקטלוגים חיצוניים של Iceberg ל-Lakehouse ללא גבולות באמצעות Dataflow

יכול להיות שתרצו לחבר טבלה חיצונית של Iceberg REST Catalog‏ (IRC) לטבלה קיימת של Lakehouse. ממשק המשתמש של כלי בניית המשימות של Dataflow מאפשר לכם לבנות פייפליין להעברת טבלאות קטלוג Iceberg חיצוניות בקוד פתוח אל Lakehouse עם תכנות מינימלי או בלי צורך בתכנות. התהליך הזה מאפשר לאחד נתונים בפורמט Iceberg שמנוהל על ידי Lakehouse, לניתוח חוצה-מנועים.

כדי לייבא נתונים מקטלוגים חיצוניים של Iceberg, צריך להשתמש בפרטי החיבור הבאים.

אחרי שמייבאים את הטבלה, אפשר לייבא מעת לעת נתוני שינויים כדי לסנכרן את העדכונים בטבלת המקור עם הטבלה ב-Lakehouse. מידע נוסף זמין במאמר בנושא העברת נתונים של סימון נתונים שהשתנו (CDC) ב-Apache Iceberg אל Lakehouse ללא גבולות באמצעות Dataflow.

לפני שמתחילים

כדי לייבא נתונים, אתם צריכים:

  1. פרטי החיבור לקטלוג REST חיצוני של Iceberg. לדוגמה: שם הקטלוג, מרחב שמות, שם הטבלה, URI של החשבון והתפקיד לגישה לקטלוג.
  2. קטלוג, מרחב שמות וטבלה של Lakehouse Iceberg שאליהם רוצים לייבא את הנתונים.

תמיכה ומגבלות

לייבוא נתונים מקטלוגים חיצוניים של Iceberg אל Lakehouse באמצעות Dataflow יש את המגבלות הבאות:

  • התכונה הזו תומכת בקריאה מספקי Iceberg שזמינים חיצונית ותומכים ב-IRC (קטלוג Iceberg Rest) אל Lakehouse. אין תמיכה בסוגים אחרים של קטלוג Iceberg.
  • התכונה הזו תומכת בצינורות להעברת נתונים (pipelines) של עיבוד באצווה ושל עיבוד בסטרימינג.

ייבוא טבלת קטלוג Iceberg חיצונית

כדי לייבא טבלת קטלוג Iceberg חיצונית אל Lakehouse:

  1. במסוף Google Cloud , נכנסים לדף קטלוג ייעודי לזמן ריצה של Lakehouse.

    מעבר לקטלוג הייעודי לזמן ריצה של Lakehouse

  2. בוחרים את הקטלוג, מרחב השמות והטבלה שאליהם רוצים לייבא נתונים.

  3. בדף Table details, לוחצים על Import table ואז בוחרים באפשרות From Apache Iceberg REST Catalog (Batch).

    ייפתח הדף Job builder של Dataflow.

  4. בקטע מקורות:

    1. כדי להרחיב את חלונית המקור Iceberg table, לוחצים על החץ להרחבה .

    2. בשדה Iceberg table (טבלת Iceberg), מזינים את המזהה של טבלת Apache Iceberg.

    3. בשדה Catalog name (שם הקטלוג), מזינים את שם הקטלוג.

    4. בשדה Filter, מזינים את מסנן Iceberg שרוצים להשתמש בו. לדוגמה, id > 5.

    5. אופציונלי: כדי לציין שינויים בעמודות של טבלת המקור, משתמשים בקטעים Keep columns או Drop columns.

    6. ברשימה סוג הקטלוג שבקטע מאפייני הקטלוג, בוחרים את סוג הקטלוג.

    7. בשדה Catalog URI (כתובת ה-URI של הקטלוג), מזינים את כתובת ה-URI של הקטלוג. לדוגמה, http://localhost:8181.

    8. בשדה Warehouse name (שם מחסן), מזינים את שם הקטלוג.

      אצל חלק מספקי קטלוג REST חיצוניים של Iceberg, מחסן הנתונים הוא מופשט, ושם הקטלוג מסופק כשם מחסן הנתונים.

    9. ברשימה Authentication type (סוג האימות), בוחרים את סוג האימות. לדוגמה, OAUTH2.

  5. אופציונלי: בקטע Transforms, מוסיפים טרנספורמציות לנתוני המקור.

  6. בקטע Sink (יעד):

    1. אופציונלי: בודקים את חלונית יעד טבלת Lakehouse. המידע בחלונית הזו, כמו טבלת Lakehouse, שם הקטלוג ומיקום המחסן, בדרך כלל מאוכלס מראש.
  7. בקטע Dataflow options (אפשרויות Dataflow), לוחצים על Run job (הפעלת עבודה).

המאמרים הבאים