Vous pouvez utiliser un connecteur BigQuery pour activer l'accès automatisé en lecture et en écriture à BigQuery. Ce procédé est idéal pour traiter les données stockées dans BigQuery. Aucun accès en ligne de commande n'est exposé. Le connecteur BigQuery est une bibliothèque qui permet aux applications Spark et Hadoop de traiter des données depuis BigQuery et de les écrire dans BigQuery à l'aide de sa terminologie native.
Tarifs
Lorsque vous utilisez le connecteur, le tarif comprend les frais d'utilisation de BigQuery. Les frais suivants peuvent également s'appliquer :
- Cloud Storage : le connecteur télécharge des données dans un bucket Cloud Storage avant ou pendant l'exécution de la tâche. Une fois la tâche terminée, les données sont supprimées de Cloud Storage. Ce stockage vous est facturé conformément aux tarifs de Cloud Storage. Pour éviter des frais supplémentaires, vérifiez votre compte Cloud Storage et supprimez les fichiers temporaires inutiles.
- API Storage Read : le connecteur lit les données des tables à l'aide de l'API Storage Read pour obtenir un débit élevé.
- Lorsque les requêtes proviennent de Managed Service pour Apache Spark sans serveur ou des procédures stockées BigQuery pour Apache Spark, les coûts de lecture en flux continu de l'API Storage Read sont délégués au connecteur sans frais supplémentaires. Les frais de sortie réseau standards s'appliquent toujours si les données sont lues dans plusieurs régions.
- Lorsque les requêtes proviennent de charges de travail Apache Spark basées sur des clusters (comme Managed Service pour Apache Spark sur les clusters ou Apache Spark exécuté sur Google Kubernetes Engine (GKE)), les tarifs standards de l'API Storage Read s'appliquent.
Connecteurs disponibles
Les connecteurs BigQuery suivants sont disponibles dans l'écosystème Hadoop :
- Le connecteur Spark BigQuery ajoute une source de données Spark qui permet aux DataFrames d'interagir directement avec les tables BigQuery en utilisant les opérations
readetwritede Spark. - Le connecteur Hive BigQuery ajoute un gestionnaire de stockage qui permet à Apache Hive d'interagir directement avec les tables BigQuery à l'aide de la syntaxe HiveQL.
Le connecteur Hadoop BigQuery permet aux mappeurs et réducteurs Hadoop d'interagir avec les tables BigQuery à l'aide de versions abstraites des classes InputFormat et OutputFormat.
Utiliser les connecteurs
Pour commencer à utiliser le connecteur BigQuery, consultez les exemples suivants :
- Exemple Spark
- Exemple MapReduce Java
- Connecter un cluster Managed Service pour Apache Spark à BigQuery
Étapes suivantes
- Obtenez des informations supplémentaires sur BigQuery.
- Suivez l'exemple BigQuery pour Spark.
- En savoir plus sur le connecteur Hive-BigQuery
- Suivez l'exemple BigQuery pour MapReduce Java.