Lorsque vous utilisez Managed Service pour Apache Spark, les données de cluster et de tâche sont stockées sur des disques persistants associés aux VM Compute Engine de votre cluster et dans un bucket de préproduction Cloud Storage. Par défaut, les données de disque persistant et de bucket sont chiffrées à l'aide d'une clé de chiffrement des données (DEK, Data Encryption Key) générée par Google et d'une clé de chiffrement de clé (KEK, Key Encryption Key).
Si vous souhaitez contrôler et gérer la clé de chiffrement de clé (KEK), vous pouvez utiliser les clés de chiffrement gérées par le client (CMEK) (Google continue de contrôler la clé de chiffrement de données (DEK)). Pour en savoir plus sur les clés de chiffrement des données Google, consultez Chiffrement au repos.
Chiffrement des données du cluster CMEK
Vous pouvez utiliser des clés de chiffrement gérées par le client (CMEK) pour chiffrer les données de cluster suivantes :
- Données sur les disques persistants associés aux VM de cluster Managed Service pour Apache Spark
- Données d'arguments de job envoyées à votre cluster, comme une chaîne de requête envoyée avec un job Spark SQL
- Métadonnées du cluster, résultats du pilote de tâches et autres données écrites dans le bucket de préproduction de votre cluster Managed Service pour Apache Spark
Avant de commencer
- Connectez-vous à votre compte Google Cloud . Si vous débutez sur Google Cloud, créez un compte pour évaluer les performances de nos produits en conditions réelles. Les nouveaux clients bénéficient également de 300 $ de crédits sans frais pour exécuter, tester et déployer des charges de travail.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc, Cloud Key Management Service, Compute Engine, and Cloud Storage APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
Installez la Google Cloud CLI.
-
Si vous utilisez un fournisseur d'identité (IdP) externe, vous devez d'abord vous connecter à la gcloud CLI avec votre identité fédérée.
-
Pour initialiser la gcloud CLI, exécutez la commande suivante :
gcloud init -
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc, Cloud Key Management Service, Compute Engine, and Cloud Storage APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
Installez la Google Cloud CLI.
-
Si vous utilisez un fournisseur d'identité (IdP) externe, vous devez d'abord vous connecter à la gcloud CLI avec votre identité fédérée.
-
Pour initialiser la gcloud CLI, exécutez la commande suivante :
gcloud init
Créer des clés
Pour protéger vos ressources Managed Service pour Apache Spark avec des clés CMEK, vous pouvez automatiser la création de clés ou les créer manuellement.
Création automatique de clés
Utilisez Autokey pour automatiser le provisionnement et l'attribution des clés CMEK. Autokey génère des trousseaux de clés et des clés à la demande lorsque des ressources sont créées. Les agents de service utilisent les clés dans les opérations de chiffrement et de déchiffrement. Si nécessaire, Autokey crée les agents et leur attribue les rôles IAM (Identity and Access Management) requis. Pour en savoir plus, consultez Présentation d'Autokey.
Création manuelle de clés
Pour créer manuellement des clés pour le chiffrement CMEK des données de cluster :
Créez une ou plusieurs clés à l'aide de Cloud KMS. Le nom de la ressource, également appelé ID de ressource d'une clé, que vous utiliserez lors des étapes suivantes, se construit de la façon suivante :
La clé (CMEK) doit se trouver au même emplacement que la ressource chiffrée. Par exemple, la CMEK utilisée pour chiffrer une ressource dans la régionprojects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME
us-central1doit également se trouver dans la régionus-central1.Pour vous assurer que chacun des comptes de service suivants (Compte de service de l'agent de service Compute Engine, Compte de service de l'agent de service Cloud Storage et Compte de service de l'agent de service Managed Service for Apache Spark) dispose des autorisations nécessaires pour protéger les ressources à l'aide de clés Cloud KMS, demandez à votre administrateur d'attribuer le rôle IAM Chiffreur/Déchiffreur de CryptoKeys Cloud KMS (
roles/cloudkms.cryptoKeyEncrypterDecrypter) à chacun des comptes de service suivants : Compte de service de l'agent de service Compute Engine, Compte de service de l'agent de service Cloud Storage et Compte de service de l'agent de service Managed Service for Apache Spark sur votre projet.Exemple d'attribution du rôle Chiffreur/Déchiffreur de CryptoKeys Cloud KMS au compte de service de l'agent de service Managed Service for Apache Spark à l'aide de la Google Cloud CLI :
gcloud projects add-iam-policy-binding KMS_PROJECT_ID \ --member serviceAccount:service-PROJECT_NUMBER@dataproc-accounts.iam.gserviceaccount.com \ --role roles/cloudkms.cryptoKeyEncrypterDecrypter
Remplacez les éléments suivants :
KMS_PROJECT_ID: ID de votre projet Google Cloud contenant la clé Cloud KMS.PROJECT_NUMBER: numéro (et non ID du projet) de votre projet Google Cloud qui exécute les ressources Managed Service pour Apache Spark.Si le rôle d'agent de service Managed Service pour Apache Spark n'est pas associé au compte de service de l'agent de service Managed Service pour Apache Spark, ajoutez l'autorisation
serviceusage.services.useà un rôle personnalisé associé au compte de service de l'agent de service Managed Service pour Apache Spark.
Créer un cluster avec CMEK
Transmettez l'ID de ressource de votre clé lorsque vous créez le cluster Managed Service pour Apache Spark.
gcloud CLI
- Pour chiffrer les données du disque persistant du cluster à l'aide de votre clé, transmettez l'ID de ressource de votre clé à l'option
--gce-pd-kms-keylorsque vous créez le cluster.gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --gce-pd-kms-key='projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME' \ other arguments ...Vous pouvez vérifier les paramètres de clé à partir de l'outil de ligne de commande
gcloud.gcloud dataproc clusters describe CLUSTER_NAME \ --region=REGIONExtrait du résultat de la commande :
... configBucket: dataproc- ... encryptionConfig: gcePdKmsKeyName: projects/project-id/locations/region/keyRings/key-ring-name/cryptoKeys/key-name ... - Pour chiffrer les données de disque persistant du cluster et les données d'arguments de job à l'aide de votre clé, transmettez l'ID de ressource de la clé à l'option
--kms-keylorsque vous créez le cluster. Consultez [Cluster.EncryptionConfig.kmsKey](/managed-spark/docs/reference/rest/v1/ClusterConfig#EncryptionConfig.FIELDS.kms_key) pour obtenir la liste des types de tâches et des arguments chiffrés avec l'indicateur `--kms-key`.gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --kms-key='projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME' \ other arguments ...Vous pouvez vérifier les paramètres de clé avec la commande
dataproc clusters describede la gcloud CLI. L'ID de ressource de clé est défini surgcePdKmsKeyNameetkmsKeypour utiliser votre clé avec le chiffrement des données des arguments de disque persistant et de tâche du cluster.gcloud dataproc clusters describe CLUSTER_NAME \ --region=REGIONExtrait du résultat de la commande :
... configBucket: dataproc- ... encryptionConfig: gcePdKmsKeyName: projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME kmsKey: projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME ... - Pour chiffrer les métadonnées du cluster, le pilote de tâches et les autres données de sortie écrites dans votre bucket de préproduction Managed Service pour Apache Spark dans Cloud Storage :
- Créez votre propre bucket avec CMEK. Lorsque vous ajoutez la clé au bucket, utilisez une clé que vous avez créée à l'étape 1.
- Transmettez le nom du bucket à l'option
--bucketlorsque vous créez le cluster.
gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --bucket=CMEK_BUCKET_NAME \ other arguments ...Vous pouvez également transmettre des buckets activés par CMEK à la commande `gcloud dataproc jobs submit` si votre tâche prend en compte les arguments de bucket, comme illustré dans l'exemple `cmek-bucket` suivant :
gcloud dataproc jobs submit pyspark gs://cmek-bucket/wordcount.py \ --region=region \ --cluster=cluster-name \ -- gs://cmek-bucket/shakespeare.txt gs://cmek-bucket/counts
API REST
- Pour chiffrer les données de disque persistant des VM de cluster à l'aide de votre clé, incluez le champ ClusterConfig.EncryptionConfig.gcePdKmsKeyName dans une requête cluster.create.
Vous pouvez vérifier le paramètre de clé avec la commande
dataproc clusters describede la gcloud CLI.gcloud dataproc clusters describe CLUSTER_NAME \ --region=REGIONExtrait du résultat de la commande :
... configBucket: dataproc- ... encryptionConfig: gcePdKmsKeyName: projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME ... - Pour chiffrer les données de disque persistant des VM de cluster et les données d'arguments de job à l'aide de votre clé, incluez le champ
Cluster.EncryptionConfig.kmsKeydans une requête cluster.create. Consultez Cluster.EncryptionConfig.kmsKey pour obtenir la liste des types de tâches et des arguments chiffrés avec le champ--kms-key.Vous pouvez vérifier les paramètres de clé avec la commande
dataproc clusters describede la gcloud CLI. L'ID de ressource de clé est défini surgcePdKmsKeyNameetkmsKeypour utiliser votre clé avec le chiffrement des données des arguments de disque persistant et de tâche du cluster.gcloud dataproc clusters describe CLUSTER_NAME \ --region=REGIONExtrait du résultat de la commande :
... configBucket: dataproc- ... encryptionConfig: gcePdKmsKeyName: projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME kmsKey: projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME ... - Pour chiffrer les métadonnées du cluster, le pilote de tâches et les autres données de sortie écrites dans votre bucket de préproduction Managed Service pour Apache Spark dans Cloud Storage :
- Créez votre propre bucket avec CMEK. Lorsque vous ajoutez la clé au bucket, utilisez une clé que vous avez créée à l'étape 1.
- Transmettez le nom du bucket au champ ClusterConfig.configBucket dans le cadre d'une requête cluster.create.
gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --bucket=CMEK_BUCKET_NAME \ other arguments ...Vous pouvez également transmettre des buckets activés par CMEK à la commande `gcloud dataproc jobs submit` si votre tâche prend en compte les arguments de bucket, comme illustré dans l'exemple `cmek-bucket` suivant :
gcloud dataproc jobs submit pyspark gs://cmek-bucket/wordcount.py \ --region=region \ --cluster=cluster-name \ -- gs://cmek-bucket/shakespeare.txt gs://cmek-bucket/counts
Utiliser les CMEK avec les données de modèle de workflow
Les données d'arguments de job de modèle de workflow Managed Service pour Apache Spark, telles que la chaîne de requête d'un job SparkSQL, peuvent être chiffrées à l'aide de CMEK. Suivez les étapes 1, 2 et 3 de cette section pour utiliser CMEK avec votre modèle de workflow Managed Service pour Apache Spark. Consultez WorkflowTemplate.EncryptionConfig.kmsKey pour obtenir la liste des types de tâches et des arguments de modèle de workflow qui sont chiffrés à l'aide de CMEK lorsque cette fonctionnalité est activée.
- Créez une clé à l'aide de Cloud KMS.
Le nom de ressource de la clé, que vous utiliserez lors des étapes suivantes, se construit de la façon suivante :
projects/project-id/locations/region/keyRings/key-ring-name/cryptoKeys/key-name
Pour permettre aux comptes de service Managed Service pour Apache Spark d'utiliser votre clé :
Attribuez le rôle Cloud KMS au compte de service de l'agent de service Managed Service for Apache Spark.
CryptoKey Encrypter/DecrypterVous pouvez attribuer le rôle à l'aide de la gcloud CLI :gcloud projects add-iam-policy-binding KMS_PROJECT_ID \ --member serviceAccount:service-PROJECT_NUMBER@dataproc-accounts.iam.gserviceaccount.com \ --role roles/cloudkms.cryptoKeyEncrypterDecrypter
Remplacez les éléments suivants :
KMS_PROJECT_ID : ID de votre projet Google Cloud exécutant Cloud KMS. Il peut également s'agir du projet qui exécute les ressources Managed Service pour Apache Spark.
PROJECT_NUMBER : numéro (et non ID du projet) de votre projet Google Cloud qui exécute les ressources Managed Service pour Apache Spark.
Activez l'API Cloud KMS sur le projet qui exécute les ressources Managed Service pour Apache Spark.
Si le rôle d'agent de service Managed Service pour Apache Spark n'est pas associé au compte de service de l'agent de service Managed Service pour Apache Spark, ajoutez l'autorisation
serviceusage.services.useau rôle personnalisé associé au compte de service de l'agent de service Managed Service pour Apache Spark. Si le rôle "Agent de service Managed Service pour Apache Spark" est associé au compte de service "Agent de service Managed Service pour Apache Spark", vous pouvez ignorer cette étape.
Vous pouvez utiliser gcloud CLI ou l'API Dataproc pour définir la clé que vous avez créée à l'étape 1 sur un workflow. Une fois la clé définie sur un workflow, tous les arguments et requêtes du job de workflow sont chiffrés à l'aide de la clé pour tous les types de jobs et arguments listés dans WorkflowTemplate.EncryptionConfig.kmsKey.
gcloud CLI
Transmettez l'ID de ressource de votre clé à l'option
--kms-keylorsque vous créez le modèle de workflow à l'aide de la commande gcloud dataproc workflow-templates create.Exemple :
Vous pouvez vérifier le paramètre de clé à partir de l'outil de ligne de commandegcloud dataproc workflow-templates create my-template-name \ --region=region \ --kms-key='projects/project-id/locations/region/keyRings/key-ring-name/cryptoKeys/key-name' \ other arguments ...
gcloud.gcloud dataproc workflow-templates describe TEMPLATE_NAME \ --region=REGION
... id: my-template-name encryptionConfig: kmsKey: projects/PROJECT_ID/locations/REGION/keyRings/KEY_RING_NAME/cryptoKeys/KEY_NAME ...
API REST
Utilisez WorkflowTemplate.EncryptionConfig.kmsKey dans le cadre d'une requête workflowTemplates.create.
Vous pouvez vérifier les paramètres de clé à l'aide d'une requête workflowTemplates.get. Le fichier JSON renvoyé contient le
kmsKey:... "id": "my-template-name", "encryptionConfig": { "kmsKey": "projects/project-id/locations/region/keyRings/key-ring-name/cryptoKeys/key-name" },
Cloud External Key Manager
Cloud External Key Manager (Cloud EKM) vous permet de protéger les données Managed Service pour Apache Spark à l'aide de clés gérées par un partenaire de gestion des clés externes compatible. Les étapes que vous suivez pour utiliser Cloud EKM dans Managed Service for Apache Spark sont les mêmes que celles permettant de configurer les clés CMEK, à la différence suivante : votre clé pointe vers un URI pour la clé gérée en externe (voir Présentation de Cloud EKM).
Erreurs Cloud EKM
Lorsque vous utilisez Cloud EKM, une tentative de création d'un cluster peut échouer en raison d'erreurs liées aux entrées, à Cloud EKM, au système partenaire de gestion des clés externes ou aux communications entre Cloud EKM et le système externe. Si vous utilisez l'API REST ou la console Google Cloud , les erreurs sont consignées dans Cloud Logging. Vous pouvez examiner les erreurs du cluster défaillant à partir de l'onglet Afficher le journal.