Ce document explique comment utiliser les opérations de stockage par lot pour effectuer des actions sur des milliards d'objets à grande échelle dans un environnement sans serveur. Les configurations pour les grandes entreprises peuvent comporter des objets répartis dans des milliers de buckets. Les opérations Storage par lot permettent d'automatiser les opérations à grande échelle sur les objets. Cette automatisation réduit le temps de développement nécessaire pour écrire et gérer des scripts pour chaque requête.
Pour savoir comment créer des jobs d'opérations par lot de stockage, consultez Créer et gérer des jobs d'opérations par lot de stockage.
Présentation
Utilisez des opérations par lot de stockage pour gérer un grand nombre de fichiers dans votre projet. Pour commencer, créez une configuration de job. La configuration définit les transformations à appliquer à des objets spécifiques. Ces transformations incluent la définition d'obligations de conservation d'objets, la suppression d'objets, la mise à jour des métadonnées et des contextes d'objets, la réécriture d'objets et la modification des contrôles d'accès.
Lorsque vous envoyez un job d'opération par lot, vous pouvez surveiller son état pour vérifier quand il applique toutes les transformations spécifiées.
Avantages
Voici les avantages des opérations de stockage par lot :
- Évolutivité : effectuez des transformations sur des millions d'objets avec un seul job d'opérations de stockage par lot.
- Exécution sans serveur : exécutez des jobs par lot dans un environnement sans serveur, ce qui élimine la nécessité de gérer l'infrastructure.
- Automatisation : automatisez les tâches complexes et répétitives pour améliorer l'efficacité opérationnelle.
- Réduire le temps de développement : évitez d'écrire et de gérer des scripts personnalisés complexes.
- Intégration des ensembles de données Storage Insights : sélectionnez directement des objets en spécifiant des conditions qui correspondent aux champs de vos ensembles de données Storage Insights. Cette sélection directe élimine la nécessité d'assembler manuellement un fichier manifeste CSV ou d'exécuter des requêtes pour exporter votre ensemble de données depuis BigQuery.
- Performances : exécutez plusieurs jobs par lots simultanés pour effectuer des opérations urgentes. Par exemple, vous pouvez traiter jusqu'à un milliard d'objets en trois heures.
- Nouvelles tentatives automatiques : réessayez automatiquement les opérations ayant échoué.
- Surveillance des jobs : suivez la progression en détail pour surveiller l'état et l'achèvement de tous les jobs.
Cas d'utilisation
Les opérations de stockage par lot automatisent et simplifient la gestion du stockage à l'échelle de l'organisation. Les scénarios courants suivants décrivent comment ils vous aident à protéger, organiser et gérer vos ressources :
Protégez vos données : gérez votre stratégie de sécurité à grande échelle. Par exemple, vous pouvez faire pivoter les clés de chiffrement sur des millions d'objets, appliquer ou supprimer des blocages d'objets pour appliquer l'immuabilité, et corriger les listes de contrôle d'accès (LCA) de manière groupée pour supprimer l'accès public en lecture aux données privées.
Assurer la conformité : respectez les réglementations sur la conservation des données. Utilisez des préservations à titre conservatoire ciblées pour appliquer des règles de conservation, définir des délais d'expiration spécifiques et supprimer des objets dans un délai spécifique afin de respecter les règles de suppression.
Transformer les données à grande échelle : effectuez des mises à jour groupées des propriétés des objets. Par exemple, vous pouvez mettre à jour les métadonnées d'objet personnalisées ou fixes, et taguer des fichiers pour les systèmes en aval en mettant à jour ou en effaçant les contextes personnalisés des objets.
Gérer les coûts de stockage : vous aide à optimiser vos dépenses Cloud Storage. Par exemple, vous pouvez supprimer en masse les objets actifs inutiles, purger les enregistrements obsolètes en supprimant définitivement les versions d'objets non actuelles et déplacer à grande échelle les objets de la classe de stockage Standard vers des classes de stockage plus froides, comme le stockage Archive.
Configurations de tâches
Pour créer un job d'opérations Storage par lot, définissez les configurations de job suivantes. Les configurations de tâches sont des paramètres qui contrôlent la façon dont la tâche traite les objets.
Nom du job : nom unique permettant d'identifier le job d'opérations par lot Storage. Utilisez ce nom pour suivre, surveiller et référencer le job. Les noms de tâches sont alphanumériques, par exemple
job-01.Description du job (facultatif) : brève description de l'objectif du job. Cette description vous aide à comprendre et à documenter ce que fait le job. Par exemple,
Deletes all objects in a bucket.Liste des buckets : liste d'un ou de plusieurs noms de buckets contenant les objets que vous souhaitez traiter, séparés par une virgule. Vous pouvez spécifier jusqu'à 1 000 buckets provenant de n'importe quel projet, à condition que chacun d'eux soit inscrit à un forfait Storage Intelligence.
Sélection d'objets : critères de sélection qui définissent les objets à traiter. Vous pouvez spécifier les critères à l'aide de l'une des options suivantes :
Filtres d'ensemble de données : utilisez le langage CEL (Common Expression Language) pour filtrer les objets en fonction des champs de métadonnées de votre ensemble de données Storage Insights. Vous pouvez exécuter des jobs par lot sur des objets répartis dans plusieurs buckets d'un projet. Lorsque vous utilisez des filtres de dataset pour la sélection d'objets, les opérations par lot de stockage ciblent les objets actifs et actuels à partir de l'instantané de dataset sélectionné. Par conséquent, le job n'inclut que les objets qui ont une valeur
NULLpoursoftDeleteTimeettimeDeletedau moment du snapshot. Pour en savoir plus, consultez Créer un job à l'aide de filtres avancés.Fichier manifeste : créez un fichier manifeste et spécifiez son emplacement lorsque vous créez le job d'opérations de stockage par lot. Le fichier manifeste est un fichier CSV importé dans Google Cloud . Il contient la liste des objets à traiter. Chaque ligne du fichier manifeste doit inclure le
bucketet le nom (name) de l'objet. Vous pouvez éventuellement spécifier lagenerationde l'objet. Si vous omettez la valeurgeneration, le job traite la version en ligne de l'objet.Le fichier manifeste doit inclure une ligne d'en-tête au format suivant :
bucket,name,generationVoici un exemple de fichier manifeste :
bucket,name,generation bucket_1,object_1,generation_1 bucket_1,object_2,generation_2 bucket_2,object_3,generation_3
Vous pouvez également créer un fichier manifeste à l'aide des ensembles de données Storage Insights. Pour en savoir plus, consultez Créer un fichier manifeste à l'aide des ensembles de données Storage Insights.
Préfixes d'objet : spécifiez une liste de préfixes pour filtrer les objets du bucket. Le job ne traite que les objets correspondant à ces préfixes. Si vous laissez la liste des préfixes vide, le job traite tous les objets du bucket.
Type de job : les opérations de stockage par lot sont compatibles avec les types de jobs suivants, qui exécutent un seul job par opération par lot.
Suppression d'objets : supprimez des objets dans un bucket pour optimiser les coûts, gérer le cycle de vie de vos données et respecter les règles de suppression des données.
Mises à jour des métadonnées : vous pouvez modifier les métadonnées d'objet suivantes :
Métadonnées personnalisées : vous pouvez mettre à jour toutes les paires clé/valeur définies par l'utilisateur et associées à l'objet.
Métadonnées fixes : vous pouvez mettre à jour
Cache-Control,Content-Disposition,Content-Encoding,Content-Language,Content-Type,Custom-Timeet la configuration de la période de conservation. Pour modifier les obligations de conservation d'un objet, utilisez le type de mission de mise à jour des obligations de conservation d'un objet.
Mises à jour des obligations de conservation d'objets : vous pouvez activer ou désactiver les obligations de conservation d'objets. Les obligations de conservation d'objets empêchent la suppression ou la modification des objets. Ces mesures de conservation sont essentielles pour la conformité et la conservation des données.
Mises à jour des clés de chiffrement des objets : vous pouvez gérer les clés de chiffrement gérées par le client pour un ou plusieurs objets. Cette fonctionnalité inclut l'application ou la modification de clés de chiffrement à l'aide de la méthode rewrite object.
Mises à jour du contexte d'objet : gérez les contextes d'objet associés aux objets. Vous pouvez effacer tous les contextes d'objet existants ou effectuer des mises à jour spécifiques, comme supprimer des clés ou insérer et mettre à jour des paires clé-valeur.
Mises à jour des classes de stockage d'objets : vous pouvez modifier la classe de stockage des objets de manière groupée pour optimiser les coûts.
Mises à jour des listes de contrôle d'accès (LCA) aux objets : vous pouvez corriger les LCA d'objets pour ajouter, modifier ou supprimer des autorisations pour des entités telles que
allUsersetallAuthenticatedUsers.
Simulation (facultatif) : utilisez le mode de simulation pour éviter les erreurs de configuration à grande échelle. Un dry run simule l'opération sans effectuer de transformations. Cette simulation vous aide à valider la configuration de votre job avant de l'exécuter. Les résultats du dry run fournissent un aperçu des informations suivantes avant l'exécution du job :
Nombre d'objets affectés par le job.
Erreurs potentielles.
Taille totale des objets concernés si vous filtrez par préfixes d'objet.
Tarifs
Pour estimer les frais de votre job ou de votre simulation, consultez les tarifs de Cloud Storage.
Vous pouvez utiliser une simulation pour valider votre configuration sans générer de coûts d'opération, bien que la simulation puisse générer des coûts de liste d'objets.
Limites
Les opérations de stockage par lot sont soumises aux limites suivantes :
La durée de vie maximale des jobs d'opérations de stockage par lot est de 14 jours. Toute tâche en cours qui n'est pas terminée dans les 14 jours suivant sa création est automatiquement annulée.
Vous pouvez inclure jusqu'à 1 000 préfixes d'objet dans un même job.
L'exécution de plus de 10 tâches simultanées sur le même bucket dégrade les performances de chaque tâche.
Vous pouvez exécuter un seul job par lot sur un maximum de 1 000 buckets dans un projet.
Les filtres de bucket et les filtres d'objet sont chacun limités à 150 caractères maximum.
Les opérations de stockage par lot sélectionnent automatiquement l'heure de l'instantané de l'ensemble de données Storage Insights en fonction du fichier manifeste global. Cette sélection fait correspondre tous les buckets cibles au même instantané pour la découverte d'objets. L'heure de l'instantané global sélectionnée est renvoyée dans la réponse de l'API. Si l'instantané date de plus de deux jours, la création du job échoue. Pour savoir comment résoudre cet échec, consultez Résoudre les problèmes liés aux opérations par lot Storage.
Les opérations de stockage par lot ne sont pas compatibles avec les buckets pour lesquels l'option Paiements du demandeur est activée.
Lorsque vous utilisez des ensembles de données Storage Insights pour la sélection d'objets, les opérations de stockage par lot ciblent les objets actifs et actuels à partir de l'instantané de l'ensemble de données sélectionné.
Étapes suivantes
- Découvrez comment créer et gérer des jobs d'opérations par lot de stockage.