Mit einem BigQuery-Connector können Sie programmatischen Lese- und Schreibzugriff auf BigQuery ermöglichen. Dies ist ideal für die Verarbeitung von Daten, die in BigQuery gespeichert sind. Der Befehlszeilenzugriff wird nicht verfügbar gemacht. Der BigQuery-Connector ist eine Bibliothek, mit der Spark- und Hadoop-Anwendungen Daten aus BigQuery verarbeiten und in dessen nativer Terminologie in BigQuery schreiben können.
Preise
Bei Verwendung des Connectors umfassen die Kosten die BigQuery-Nutzungsgebühren. Außerdem können folgende dienstspezifische Gebühren anfallen:
- Cloud Storage: Der Connector lädt Daten vor oder während der Jobausführung in einen Cloud Storage-Bucket herunter. Diese Daten werden nach dem erfolgreichen Abschluss des Hadoop-Jobs wieder aus Cloud Storage gelöscht. Die Kosten für die Datenspeicherung entsprechen den in Cloud Storage – Preise angegebenen Preisen. Prüfen Sie Ihr Cloud Storage-Konto und entfernen Sie nicht benötigte temporäre Dateien, um übermäßige Gebühren zu vermeiden.
- Storage Read API: Der Connector liest Daten aus Tabellen mit der Storage Read API, um einen hohen Durchsatz zu erzielen.
- Wenn Anfragen entweder vom Managed Service for Apache Spark Serverless oder von den gespeicherten BigQuery-Prozeduren für Apache Spark stammen, werden die Kosten für das Streaminglesen der Storage Read API ohne zusätzliche Gebühren an den Connector delegiert. Wenn Daten regionsübergreifend gelesen werden, fallen weiterhin die Standardgebühren für ausgehenden Netzwerk-Traffic an.
- Wenn Anfragen von clusterbasierten Apache Spark-Arbeitslasten stammen, z. B. vom Managed Service for Apache Spark on clusters oder von Apache Spark, das in Google Kubernetes Engine (GKE) ausgeführt wird, gelten die standardmäßigen Preise für die Storage Read API.
Verfügbare Connectors
Die folgenden BigQuery-Connectors stehen in Hadoop zur Verfügung:
- Der Spark BigQuery-Connector fügt eine Spark-Datenquelle hinzu, die es DataFrames ermöglicht, mithilfe der
read- undwrite-Vorgänge von Spark direkt mit BigQuery-Tabellen zu interagieren. - Der Hive BigQuery-Connector fügt einen Storage Handler hinzu, der es Apache Hive ermöglicht, mithilfe der HiveQL-Syntax direkt mit BigQuery-Tabellen zu interagieren.
Der Hadoop BigQuery-Connector ermöglicht Hadoop-Mapper und -Reducer die Interaktion mit BigQuery-Tabellen mit abstrahierten Versionen der InputFormat- und OutputFormat-Klassen.
Connectors verwenden
Folgende Beispiele ermöglichen den schnellen Einstieg in BigQuery-Connectors:
- Beispiel für Spark
- Beispiel für Java MapReduce
- Managed Service for Apache Spark-Cluster mit BigQuery verbinden
Nächste Schritte
- Weitere Informationen zu BigQuery
- BigQuery-Beispiel für Spark
- Weitere Informationen zum Hive BigQuery Connector
- BigQuery-Beispiel für Java MapReduce