Opérations de stockage par lot

Ce document explique comment utiliser les opérations de stockage par lot pour effectuer des actions à grande échelle sur des milliards d'objets dans un environnement sans serveur. Les configurations des grandes entreprises peuvent comporter des objets répartis sur des milliers de buckets. Les opérations de stockage par lot automatisent les opérations à grande échelle sur les objets. Cette automatisation réduit le temps de développement nécessaire pour écrire et gérer des scripts pour chaque requête.

Pour savoir comment créer des tâches d'opérations de stockage par lot, consultez Créer et gérer des tâches d'opérations de stockage par lot.

Présentation

Utilisez les opérations de stockage par lot pour gérer un grand nombre de fichiers dans votre projet. Pour commencer, créez une configuration de tâche. La configuration définit les transformations à appliquer à des objets spécifiques. Ces transformations incluent la préservation à titre conservatoire d'objets, la suppression d'objets, la mise à jour des métadonnées et des contextes d'objets, la réécriture d'objets et l'application de correctifs aux contrôles d'accès.

Lorsque vous envoyez une tâche d'opérations par lot, vous pouvez surveiller son état pour vérifier quand la tâche applique toutes les transformations spécifiées.

Avantages

Voici les avantages des opérations de stockage par lot :

  • Scalabilité : effectuez des transformations sur des millions d'objets avec une seule tâche d'opérations de stockage par lot.
  • Exécution sans serveur : exécutez des tâches par lot dans un environnement sans serveur, ce qui élimine le besoin de gérer l'infrastructure.
  • Automatisation : automatisez les tâches complexes et répétitives pour améliorer l'efficacité opérationnelle.
  • Réduction du temps de développement : évitez d'écrire et de gérer des scripts personnalisés complexes.
  • Intégration d'ensembles de données Storage Insights : sélectionnez directement des objets en spécifiant des conditions qui correspondent aux champs de vos ensembles de données Storage Insights. Cette sélection directe élimine le besoin d'assembler manuellement un fichier manifeste CSV manifest ou d'exécuter des requêtes pour exporter votre ensemble de données depuis BigQuery.
  • Performances : effectuez des opérations urgentes en exécutant plusieurs tâches par lot simultanées. Par exemple, vous pouvez traiter jusqu'à un milliard d'objets en trois heures.
  • Nouvelles tentatives automatiques : réessayez automatiquement les opérations qui ont échoué.
  • Surveillance des tâches : suivez la progression en détail pour surveiller l’état et l’ achèvement de toutes les tâches.

Cas d'utilisation

Les opérations de stockage par lot automatisent et simplifient la gestion du stockage à l'échelle de l'organisation. Les scénarios courants suivants décrivent comment elles vous aident à protéger, organiser et gérer vos ressources :

  • Contribuez à protéger vos données : gérez votre stratégie de sécurité à grande échelle. Par exemple, vous pouvez faire pivoter les clés de chiffrement sur des millions d'objets, appliquer ou supprimer des préservations à titre conservatoire d'objets pour appliquer l'immuabilité, et appliquer des correctifs aux listes de contrôle d'accès (LCA) en bloc pour supprimer l'accès en lecture public aux données privées.

  • Conformité : respectez les réglementations sur la conservation des données. Utilisez des préservations à titre conservatoire d'objets ciblées pour appliquer des règles de conservation, définir des délais d'expiration spécifiques et supprimer des objets dans un délai spécifique pour respecter les règles de suppression.

  • Transformation des données à grande échelle : effectuez des mises à jour groupées des propriétés des objets. Par exemple, vous pouvez mettre à jour des métadonnées d'objets personnalisées ou fixes, et taguer des fichiers pour les systèmes en aval en mettant à jour ou en effaçant les contextes personnalisés des objets.

  • Gestion des coûts de stockage : optimisez vos dépenses Cloud Storage. Par exemple, vous pouvez supprimer en bloc les objets actifs inutiles, purger les enregistrements obsolètes en supprimant définitivement les versions d'objets non actuelles et déplacer à grande échelle les objets de stockage standard vers des classes de stockage plus froides, telles que le stockage Archive.

Configurations de tâches

Pour créer une tâche d'opérations de stockage par lot, définissez les configurations de tâches suivantes. Les configurations de tâches sont des paramètres qui contrôlent la façon dont la tâche traite les objets.

  • Nom de la tâche : nom unique permettant d'identifier la tâche d'opérations de stockage par lot. Utilisez ce nom pour suivre, surveiller et référencer la tâche. Les noms de tâches sont alphanumériques, par exemple job-01.

  • Description de la tâche (facultatif) : brève description de l'objectif de la tâche. Cette description vous aide à comprendre et à documenter ce que fait la tâche. Par exemple, Deletes all objects in a bucket.

  • Liste de buckets : liste de noms de buckets séparés par une virgule contenant les objets que vous souhaitez traiter. Vous pouvez spécifier jusqu'à 1 000 buckets de n'importe quel projet, à condition que chaque bucket soit inscrit à un plan Storage Intelligence.

  • Sélection d'objets : critères de sélection qui définissent les objets à traiter. Vous pouvez spécifier les critères à l'aide de l'une des options suivantes :

    • Filtres d'ensembles de données : utilisez le langage CEL (Common Expression Language) pour filtrer les objets en fonction des champs de métadonnées de votre ensemble de données Storage Insights. Vous pouvez exécuter des tâches par lot sur des objets répartis sur plusieurs buckets d'un projet. Lorsque vous utilisez des filtres d'ensembles de données pour la sélection d'objets, les opérations de stockage par lot ciblent les objets actifs et à jour au moment de l'instantané de l'ensemble de données sélectionné. Par conséquent, la tâche n'inclut que les objets dont la valeur est NULL pour softDeleteTime et timeDeleted au moment de l'instantané. Pour en savoir plus, consultez Créer une tâche à l'aide de filtres avancés.

    • **Fichier manifeste** : créez un fichier manifeste et spécifiez son emplacement lorsque vous créez la tâche d'opérations de stockage par lot. Le fichier manifeste est un fichier CSV importé dans Google Cloud contenant la liste des objets à traiter. Chaque ligne du fichier manifeste doit inclure le bucket et le name de l'objet. Vous pouvez éventuellement spécifier la generation de l'objet. Si vous omettez la valeur generation, la tâche traite la version en ligne de l'objet.

      Le fichier manifeste doit inclure une ligne d'en-tête au format suivant :

      bucket,name,generation

      Voici un exemple de fichier manifeste :

      bucket,name,generation
      bucket_1,object_1,generation_1
      bucket_1,object_2,generation_2
      bucket_2,object_3,generation_3
      

      Vous pouvez également créer un fichier manifeste à l'aide d'ensembles de données Storage Insights. Pour en savoir plus, consultez Créer un fichier manifeste à l'aide d'ensembles de données Storage Insights.

    • Préfixes d'objets : spécifiez une liste de préfixes pour filtrer les objets du bucket. La tâche ne traite que les objets qui correspondent à ces préfixes. Si vous laissez la liste de préfixes vide, la tâche traite tous les objets du bucket.

  • Type de tâche : les opérations de stockage par lot sont compatibles avec les types de tâches suivants, en exécutant une seule tâche par opération par lot.

    • Suppression d'objets : supprimez des objets dans un bucket pour optimiser les coûts, gérer le cycle de vie de vos données et respecter les règles de suppression des données.

    • Mises à jour des métadonnées : vous pouvez modifier les métadonnées d'objet suivantes :

      • Métadonnées personnalisées : vous pouvez mettre à jour toutes les paires clé-valeur définies par l'utilisateur associées à l'objet.

      • Métadonnées fixes : vous pouvez mettre à jour Cache-Control, Content-Disposition, Content-Encoding, Content-Language, Content-Type, Custom-Time, et la configuration de conservation. Pour modifier les préservations à titre conservatoire d'objets, utilisez le type de tâche de mises à jour des préservations à titre conservatoire d'objets.

    • Mises à jour des préservations à titre conservatoire d'objets : vous pouvez activer ou désactiver les préservations à titre conservatoire d'objets. Les préservations à titre conservatoire d'objets empêchent la suppression ou la modification des objets. Ces préservations sont essentielles pour la conformité et la conservation des données.

    • Mises à jour des clés de chiffrement d'objets : vous pouvez gérer les clés de chiffrement gérées par le client pour un ou plusieurs objets. Cette fonctionnalité inclut l'application ou la modification des clés de chiffrement à l'aide de la méthode de réécriture d'objets.

    • Mises à jour du contexte d'objet : gérez les contextes d'objets associés aux objets. Vous pouvez effacer tous les contextes d'objets existants ou effectuer des mises à jour spécifiques, telles que la suppression de clés ou l'insertion et la mise à jour de paires clé-valeur.

    • Mises à jour des classes de stockage d'objets : vous pouvez modifier en bloc la classe de stockage des objets pour optimiser les coûts.

    • Mises à jour des listes de contrôle des accès (LCA) d'objets : vous pouvez appliquer des correctifs aux LCA d'objets pour ajouter, mettre à jour ou supprimer des autorisations pour des entités telles que allUsers et allAuthenticatedUsers.

  • Dry run (facultatif) : utilisez le mode de simulation pour éviter les erreurs de configuration à grande échelle accidentelles. Un dry run simule l'opération sans effectuer de transformations. Cette simulation vous aide à valider la configuration de votre tâche avant de l'exécuter. Les résultats du dry run fournissent un aperçu des détails suivants avant l'exécution de la tâche :

    • Le nombre d'objets affectés par la tâche.

    • Les erreurs potentielles.

    • La taille totale des objets affectés, si vous filtrez par préfixes d'objets.

Tarifs

Pour estimer les frais de votre tâche ou de votre dry run, consultez les tarifs de Cloud Storage.

Vous pouvez utiliser un dry run pour valider votre configuration sans engendrer de coûts d'opération, bien que le dry run puisse entraîner des coûts de liste d'objets.

Limites

Les opérations de stockage par lot sont soumises aux limites suivantes :

  • Les tâches d'opérations de stockage par lot ont une durée de vie maximale de 14 jours. Toute tâche en cours qui n'est pas terminée dans les 14 jours suivant sa création est automatiquement annulée.

  • Vous pouvez inclure jusqu'à 1 000 préfixes d'objets dans une seule tâche.

  • L'exécution de plus de 10 tâches simultanées sur le même bucket dégrade les performances de chaque tâche.

  • Vous pouvez exécuter un seul job par lot sur un maximum de 1 000 buckets dans un projet.

  • Les filtres de buckets et les filtres d'objets sont limités à 150 caractères chacun.

  • Les opérations de stockage par lot sélectionnent automatiquement l'heure de l'instantané de l'ensemble de données Storage Insights en fonction du fichier manifeste global. Cette sélection fait correspondre tous les buckets ciblés à la même heure d'instantané pour la découverte d'objets. L'heure de l'instantané global sélectionnée est renvoyée dans la réponse de l'API. Si l'heure de l'instantané date de plus de deux jours, la création de la tâche échoue. Pour savoir comment résoudre cet échec, consultez Résoudre les problèmes liés aux opérations de stockage par lot.

  • Les opérations de stockage par lot ne sont pas compatibles avec les buckets pour lesquels les paiements du demandeur sont activés.

  • Lorsque vous utilisez des ensembles de données Storage Insights pour la sélection d'objets, les opérations de stockage par lot ciblent les objets actifs et à jour au moment de l'instantané de l'ensemble de données sélectionné.

Étape suivante