Wenn Sie mit dem Lakehouse-REST-Katalog aus Dataflow in Apache Iceberg schreiben möchten, verwenden Sie den verwalteten E/A-Connector.
Verwaltete E/A unterstützt die folgenden Funktionen für Apache Iceberg:
| Kataloge |
|
|---|---|
| Lesefunktionen | Batchlesevorgang |
| Schreibfunktionen |
|
Verwenden Sie für BigQuery-Tabellen für Apache Iceberg,
verwenden Sie den
BigQueryIO Connector
mit der BigQuery Storage API. Die Tabelle muss bereits vorhanden sein. Die dynamische Tabellenerstellung wird nicht unterstützt.
Vorbereitung
Lakehouse einrichten. Konfigurieren Sie Ihr Google Cloud Projekt mit den erforderlichen Berechtigungen. Folgen Sie dazu der Anleitung unter Lakehouse-Laufzeitkatalog mit dem Iceberg-REST-Katalog verwenden. Machen Sie sich mit den Einschränkungen des Lakehouse Iceberg-REST-Katalogs vertraut, die auf dieser Seite beschrieben werden.
Abhängigkeiten
Fügen Sie Ihrem Projekt die folgenden Abhängigkeiten hinzu:
Java
<dependency>
<groupId>org.apache.beam</groupId>
<artifactId>beam-sdks-java-managed</artifactId>
<version>${beam.version}</version>
</dependency>
<dependency>
<groupId>org.apache.beam</groupId>
<artifactId>beam-sdks-java-io-iceberg</artifactId>
<version>${beam.version}</version>
</dependency>
<dependency>
<groupId>org.apache.iceberg</groupId>
<artifactId>iceberg-gcp</artifactId>
<version>${iceberg.version}</version>
</dependency>
Beispiel
Im folgenden Beispiel wird eine Streamingpipeline veranschaulicht, die Daten in eine Apache Iceberg-Tabelle schreibt. Dabei wird der REST-Katalog verwendet, der vom Lakehouse-Laufzeitkatalog unterstützt wird.
Java
Richten Sie die Standardanmeldedaten für Anwendungen ein, um sich bei Dataflow zu authentifizieren. Weitere Informationen finden Sie unter Authentifizierung für eine lokale Entwicklungsumgebung einrichten.
Nächste Schritte
- CDC-Lesevorgang aus Apache Iceberg mit Lakehouse-REST-Katalog.
- Weitere Informationen zu verwalteter E/A.
- Weitere Informationen zum Lakehouse-REST-Katalog.