כדי לכתוב מ-Dataflow אל Apache Iceberg באמצעות קטלוג REST של Lakehouse, משתמשים במחבר קלט/פלט מנוהל.
שירות Managed I/O תומך ביכולות הבאות של Apache Iceberg:
| קטלוגים |
|
|---|---|
| יכולות קריאה | קריאה של נתונים באצווה |
| יכולות כתיבה |
|
כדי להשתמש בטבלאות BigQuery ל-Apache Iceberg, צריך להשתמש במחבר BigQueryIO עם BigQuery Storage API. הטבלה צריכה כבר להיות קיימת. יצירת טבלה דינמית לא אפשרית.
דרישות מוקדמות
הגדרת Lakehouse מגדירים את הפרויקט עם ההרשאות הנדרשות לפי ההוראות במאמר שימוש בקטלוג של זמן הריצה של Lakehouse עם קטלוג REST של Iceberg. Google Cloud חשוב לוודא שאתם מבינים את המגבלות של Lakehouse Iceberg REST Catalog שמתוארות בדף הזה.
תלויות
מוסיפים את יחסי התלות הבאים לפרויקט:
Java
<dependency>
<groupId>org.apache.beam</groupId>
<artifactId>beam-sdks-java-managed</artifactId>
<version>${beam.version}</version>
</dependency>
<dependency>
<groupId>org.apache.beam</groupId>
<artifactId>beam-sdks-java-io-iceberg</artifactId>
<version>${beam.version}</version>
</dependency>
<dependency>
<groupId>org.apache.iceberg</groupId>
<artifactId>iceberg-gcp</artifactId>
<version>${iceberg.version}</version>
</dependency>
דוגמה
בדוגמה הבאה מוצג צינור להעברת נתונים בסטרימינג שכותב נתונים לטבלת Apache Iceberg באמצעות קטלוג REST, שמגובה בקטלוג של זמן הריצה של Lakehouse.
Java
כדי לבצע אימות ב-Dataflow, צריך להגדיר את Application Default Credentials. מידע נוסף זמין במאמר הגדרת אימות לסביבת פיתוח מקומית.
המאמרים הבאים
- קריאת CDC מ-Apache Iceberg באמצעות קטלוג REST של Lakehouse.
- מידע נוסף על קלט/פלט מנוהל
- מידע נוסף על קטלוג Lakehouse REST