Daten aus externen Iceberg-Katalogen mit Dataflow in Lakehouse für Apache Iceberg importieren

In Ihrem Anwendungsfall müssen Sie möglicherweise eine externe Iceberg-REST-Katalogtabelle (IRC) mit einer vorhandenen Lakehouse for Apache Iceberg-Tabelle verbinden. Mit der Job-Builder-UI von Dataflow können Sie eine Pipeline erstellen, mit der Sie Ihre externen Open-Source-Iceberg-Katalogtabellen mit wenig oder gar keinem Code in Lakehouse migrieren. Mit diesem Prozess können Sie Daten in einem einheitlichen, von Lakehouse verwalteten Iceberg-Format für die maschinenübergreifende Analyse zusammenführen.

Verwenden Sie die folgenden Verbindungsdetails, um Daten aus externen Iceberg-Katalogen zu importieren.

Hinweis

Für den Import von Daten benötigen Sie Folgendes:

  1. Verbindungsinformationen für den externen Iceberg-REST-Katalog. Beispiel: Katalogname, Namespace, Tabellenname, Konto-URI und Rolle für den Zugriff auf den Katalog.
  2. Einen Lakehouse-Iceberg-Katalog, einen Namespace und eine Tabelle, in die die Daten importiert werden sollen.

Unterstützung und Einschränkungen

Beim Importieren von Daten aus externen Iceberg-Katalogen in Lakehouse für Apache Iceberg mit Dataflow gelten die folgenden Einschränkungen:

  • Diese Funktion unterstützt das Lesen aus extern verfügbaren Iceberg-Anbietern, die IRC (Iceberg Rest Catalog) in Lakehouse unterstützen. Andere Iceberg-Katalogtypen werden nicht unterstützt.
  • Diese Funktion unterstützt Batch- und Streamingpipelines.

Externe Iceberg-Katalogtabelle importieren

So importieren Sie eine externe Iceberg-Katalogtabelle in Lakehouse für Apache Iceberg:

  1. Rufen Sie in der Google Cloud Console die Seite Lakehouse-Laufzeitkatalog auf.

    Lakehouse-Laufzeitkatalog aufrufen

  2. Wählen Sie den Katalog, den Namespace und die Tabelle aus, in die Sie Daten importieren möchten.

  3. Klicken Sie auf der Seite Tabellendetails auf Tabelle importieren und wählen Sie dann Aus Apache Iceberg REST-Katalog (Batch) aus.

    Die Dataflow-Seite Job Builder wird geöffnet.

  4. Im Bereich Quellen:

    1. Klicken Sie auf den Pfeil, um den Quellbereich Iceberg-Tabelle zu maximieren.

    2. Geben Sie im Feld Iceberg-Tabelle die Kennung der Apache Iceberg-Tabelle ein.

    3. Geben Sie im Feld Katalogname den Namen des Katalogs ein.

    4. Geben Sie im Feld Filter den zu verwendenden Iceberg-Filter ein. Beispiel: id > 5.

    5. Optional: Wenn Sie Änderungen an den Quelltabelle-Spalten angeben möchten, verwenden Sie die Bereiche Spalten beibehalten oder Spalten entfernen.

    6. Wählen Sie im Bereich Katalogeigenschaften in der Liste Katalogtyp den Typ des Katalogs aus.

    7. Geben Sie im Feld Katalog-URI den URI des Katalogs ein. Beispiel: http://localhost:8181.

    8. Geben Sie im Feld Warehouse-Name den Katalognamen ein.

      Bei einigen Anbietern von externen Iceberg-REST-Katalogen wird das Warehouse abstrahiert und der Katalogname als Warehouse-Name angegeben.

    9. Wählen Sie in der Liste Authentifizierungstyp den Authentifizierungstyp aus. Beispiel: OAUTH2.

  5. Optional: Fügen Sie im Bereich Transformationen Transformationen zu den Quelldaten hinzu.

  6. Im Bereich Senke:

    1. Optional: Prüfen Sie den Senkenbereich Lakehouse-Tabelle. Die Informationen in diesem Bereich, z. B. die Lakehouse-Tabelle, der Katalogname und der Warehouse-Standort, werden in der Regel vorab ausgefüllt.
  7. Klicken Sie im Bereich Dataflow-Optionen auf Job ausführen.

Nächste Schritte