כדי לכתוב מ-Dataflow אל Apache Iceberg באמצעות קטלוג REST של Lakehouse for Apache Iceberg, משתמשים במחבר I/O מנוהל.
שירות Managed I/O תומך ביכולות הבאות של Apache Iceberg:
| קטלוגים |
|
|---|---|
| יכולות קריאה | קריאה של נתונים באצווה |
| יכולות כתיבה |
|
כדי להשתמש בטבלאות BigQuery ל-Apache Iceberg, צריך להשתמש במחבר BigQueryIO עם BigQuery Storage API. הטבלה צריכה כבר להיות קיימת. אי אפשר ליצור טבלה דינמית.
דרישות מוקדמות
הגדרת Lakehouse for Apache Iceberg מגדירים את הפרויקט Google Cloud עם ההרשאות הנדרשות לפי ההוראות במאמר שימוש בקטלוג של זמן הריצה של Lakehouse עם קטלוג REST של Iceberg. חשוב לוודא שאתם מבינים את המגבלות של Lakehouse for Apache Iceberg Iceberg REST Catalog שמתוארות בדף הזה.
תלויות
מוסיפים את יחסי התלות הבאים לפרויקט:
Java
<dependency>
<groupId>org.apache.beam</groupId>
<artifactId>beam-sdks-java-managed</artifactId>
<version>${beam.version}</version>
</dependency>
<dependency>
<groupId>org.apache.beam</groupId>
<artifactId>beam-sdks-java-io-iceberg</artifactId>
<version>${beam.version}</version>
</dependency>
<dependency>
<groupId>org.apache.iceberg</groupId>
<artifactId>iceberg-gcp</artifactId>
<version>${iceberg.version}</version>
</dependency>
דוגמה
בדוגמה הבאה מוצג צינור להעברת נתונים בסטרימינג שכותב נתונים לטבלת Apache Iceberg באמצעות קטלוג REST, שמגובה בקטלוג של זמן הריצה של Lakehouse.
Java
כדי לבצע אימות ב-Dataflow, צריך להגדיר את Application Default Credentials. מידע נוסף זמין במאמר הגדרת אימות לסביבת פיתוח מקומית.
המאמרים הבאים
- קריאת CDC מ-Apache Iceberg באמצעות קטלוג REST של Lakehouse for Apache Iceberg
- מידע נוסף על קלט/פלט מנוהל
- מידע נוסף על Lakehouse for Apache Iceberg REST Catalog