Externe Iceberg-Tabellen mit Dataflow in den Lakehouse-Laufzeitkatalog importieren

Unterstützte Tabellenformate

Es werden nur Apache Iceberg V2-Tabellen unterstützt. Iceberg V1-Tabellen werden nicht unterstützt. Wenn Sie vorhandene Iceberg V1-Tabellen haben, müssen Sie sie auf V2 aktualisieren (z. B. durch Ausführen von ALTER TABLE catalog.schema.table SET TBLPROPERTIES ('format-version'='2'); oder ähnlichen Engine-Vorgängen), bevor Sie sie in den Lakehouse-Laufzeitkatalog importieren.

In Ihrem Anwendungsfall müssen Sie möglicherweise eine externe Iceberg REST-Katalogtabelle mit einer vorhandenen Lakehouse for Apache Iceberg-Tabelle verbinden. Mit der Job-Builder-UI von Dataflow können Sie eine Pipeline erstellen, mit der Sie Ihre externen Open-Source-Iceberg-Katalogtabellen mit wenig oder gar keinem Code in Lakehouse migrieren. So können Sie Daten in einem einheitlichen, von Lakehouse verwalteten Iceberg-Format für die Engine-übergreifende Analyse zusammenführen.

Verwenden Sie die folgenden Verbindungsdetails, um Daten aus externen Iceberg-Katalogen zu importieren.

Hinweis

Zum Importieren von Daten benötigen Sie Folgendes:

  1. Verbindungsinformationen für den externen Iceberg REST-Katalog. Beispiel: Katalogname, Namespace, Tabellenname, Konto-URI und Rolle für den Zugriff auf den Katalog.
  2. Einen Lakehouse-Iceberg-Katalog, -Namespace und eine Tabelle, in die die Daten importiert werden sollen.

Unterstützung und Einschränkungen

Beim Importieren von Daten aus externen Iceberg-Katalogen in Lakehouse für Apache Iceberg mit Dataflow gelten die folgenden Einschränkungen:

  • Diese Funktion unterstützt das Lesen aus extern verfügbaren Iceberg-Anbietern, die IRC (Iceberg REST-Katalog) in Lakehouse unterstützen. Andere Iceberg-Katalogtypen werden nicht unterstützt.
  • Diese Funktion unterstützt Batch- und Streamingpipelines.

Externe Iceberg-Katalogtabelle importieren

So importieren Sie eine externe Iceberg-Katalogtabelle in Lakehouse für Apache Iceberg:

  1. Rufen Sie in der Google Cloud Console die Seite Lakehouse-Laufzeitkatalog auf.

    Lakehouse-Laufzeitkatalog aufrufen

  2. Wählen Sie den Katalog, den Namespace und die Tabelle aus, in die Sie Daten importieren möchten.

  3. Klicken Sie auf der Seite Tabellendetails auf Tabelle importieren und wählen Sie dann Aus Apache Iceberg REST-Katalog (Batch) aus.

    Die Dataflow-Seite Job-Builder wird geöffnet.

  4. Im Bereich Quellen:

    1. Klicken Sie auf den Pfeil, um den Quellbereich Iceberg-Tabelle zu maximieren.

    2. Geben Sie im Feld Iceberg-Tabelle die Kennung der Apache Iceberg-Tabelle ein.

    3. Geben Sie im Feld Katalogname den Namen des Katalogs ein.

    4. Geben Sie im Feld Filter den zu verwendenden Iceberg-Filter ein. Beispiel: id > 5.

    5. Optional: Wenn Sie Änderungen an den Quelltabelle-Spalten angeben möchten, verwenden Sie die Bereiche Spalten beibehalten oder Spalten entfernen.

    6. Wählen Sie im Bereich Katalogeigenschaften in der Liste Katalogtyp den Typ des Katalogs aus.

    7. Geben Sie im Feld Katalog-URI den URI des Katalogs ein. Beispiel: http://localhost:8181.

    8. Geben Sie im Feld Warehouse-Name den Katalognamen ein.

      Bei einigen externen Iceberg REST-Kataloganbietern wird das Warehouse abstrahiert und der Katalogname als Warehouse-Name angegeben.

    9. Wählen Sie in der Liste Authentifizierungstyp den Authentifizierungstyp aus. Beispiel: OAUTH2.

  5. Optional: Fügen Sie im Bereich Transformationen Transformationen zu den Quelldaten hinzu.

  6. Im Bereich Senke:

    1. Optional: Sehen Sie sich den Senkenbereich Lakehouse-Tabelle an. Die Informationen in diesem Bereich, z. B. die Lakehouse-Tabelle, der Katalogname und der Warehouse-Standort, sind in der Regel bereits ausgefüllt.
  7. Klicken Sie im Bereich Dataflow-Optionen auf Job ausführen.

Nächste Schritte