Optimiser les charges de travail d'IA et de ML pour l'efficacité énergétique

Last reviewed 2026-01-28 UTC

Ce principe du pilier "Développement durable" du Google Cloud Well-Architected Framework fournit des recommandations pour optimiser les charges de travail d'IA et de ML afin de réduire leur consommation d'énergie et leur empreinte carbone.

Présentation du principe

Pour optimiser les charges de travail d'IA et de ML en termes de développement durable, vous devez adopter une approche holistique de la conception, du déploiement et de l'exploitation de ces charges de travail. Sélectionnez des modèles appropriés et du matériel spécialisé, comme les TPU (Tensor Processing Unit), exécutez les charges de travail dans des régions à faible émission de carbone, optimisez-les pour réduire l'utilisation des ressources et appliquez les bonnes pratiques opérationnelles.

Les pratiques architecturales et opérationnelles qui optimisent le coût et les performances des charges de travail d'IA et de ML entraînent intrinsèquement une réduction de la consommation d'énergie et de l'empreinte carbone. La perspective de l'IA et du ML dans le Well-Architected Framework décrit les principes et les recommandations pour concevoir, créer et gérer des charges de travail d'IA et de ML qui répondent à vos objectifs opérationnels, de sécurité, de fiabilité, de coût et de performances. En outre, le Cloud Architecture Center fournit des architectures de référence détaillées et des guides de conception pour les charges de travail d'IA et de ML dans Google Cloud.

Recommandations

Pour optimiser les charges de travail d'IA et de ML en termes d'efficacité énergétique, tenez compte des recommandations des sections suivantes.

Concevez une architecture économe en énergie à l'aide de TPU

Les charges de travail d'IA et de ML peuvent être gourmandes en ressources de calcul. La consommation d'énergie des charges de travail d'IA et de ML est un élément clé à prendre en compte pour le développement durable. Les TPU vous permettent d'améliorer considérablement l'efficacité énergétique et la durabilité de vos charges de travail d'IA et de ML.

Les TPU sont des accélérateurs conçus sur mesure et spécialement conçus pour les charges de travail d'IA et de ML. L'architecture spécialisée des TPU les rend très efficaces pour la multiplication de matrices à grande échelle, qui est à la base du deep learning. Les TPU peuvent effectuer des tâches complexes à grande échelle avec une plus grande efficacité que les processeurs à usage général tels que les processeurs ou les GPU.

Les TPU offrent les avantages directs suivants en termes de développement durable :

  • Réduction de la consommation d'énergie : les TPU sont conçus pour une efficacité énergétique optimale. Ils offrent un plus grand nombre de calculs par watt d'énergie consommée. Leur architecture spécialisée réduit considérablement les besoins en énergie des tâches d'entraînement et d'inférence à grande échelle, ce qui entraîne une réduction des coûts opérationnels et de la consommation d'énergie.
  • Entraînement et inférence plus rapides : les performances exceptionnelles des TPU vous permettent d'entraîner des modèles d'IA complexes en quelques heures plutôt qu'en quelques jours. Cette réduction significative du temps de calcul total contribue directement à une empreinte écologique plus faible.
  • Réduction des besoins en refroidissement : les TPU intègrent un refroidissement liquide avancé, qui assure une gestion thermique efficace et réduit considérablement l'énergie utilisée pour refroidir le centre de données.
  • Optimisation du cycle de vie de l'IA : en intégrant le matériel et les logiciels, les TPU fournissent une solution optimisée tout au long du cycle de vie de l'IA, du traitement des données à la mise en service des modèles.

Suivez les bonnes pratiques des 4 M pour la sélection des ressources

Google recommande un ensemble de bonnes pratiques pour réduire considérablement la consommation d'énergie et les émissions de carbone pour les charges de travail d'IA et de ML. Nous appelons ces bonnes pratiques 4 M :

  • Modèle : sélectionnez des architectures de modèles de ML efficaces. Par exemple, les modèles creux améliorent la qualité du ML et réduisent les calculs d'un facteur 3 à 10 par rapport aux modèles denses.
  • Machine : choisissez des processeurs et des systèmes optimisés pour l'entraînement ML. Ces processeurs améliorent les performances et l'efficacité énergétique d'un facteur 2 à 5 par rapport aux processeurs à usage général.
  • Mécanisation : déployez vos charges de travail gourmandes en ressources de calcul dans le cloud. Vos charges de travail consomment moins d'énergie et génèrent 1,4 à 2 fois moins d'émissions que les déploiements sur site. Les centres de données cloud utilisent des entrepôts plus récents et conçus sur mesure, qui sont conçus pour l'efficacité énergétique et présentent un rapport d' efficacité énergétique (PUE) élevé. Les centres de données sur site sont souvent plus anciens et plus petits. Par conséquent, les investissements dans des systèmes de refroidissement et de distribution électrique économes en énergie peuvent ne pas être rentables.
  • Carte : sélectionnez Google Cloud des emplacements qui utilisent l'énergie la plus propre. Cette approche permet de réduire l'empreinte carbone brute de vos charges de travail d'un facteur 5 à 10. Pour en savoir plus, consultez la section Énergie décarbonée pour les Google Cloud régions.

Pour en savoir plus sur les bonnes pratiques des 4 M et les métriques d'efficacité, consultez les articles de recherche suivants :

Optimisez les modèles et algorithmes d'IA pour l'entraînement et l'inférence

L'architecture d'un modèle d'IA et les algorithmes utilisés pour l'entraînement et l'inférence ont un impact significatif sur la consommation d'énergie. Tenez compte des recommandations suivantes.

Sélectionnez des modèles d'IA efficaces

Choisissez des modèles d'IA plus petits et plus efficaces qui répondent à vos exigences en termes de performances. Ne sélectionnez pas le plus grand modèle disponible par défaut. Par exemple, une version de modèle plus petite et distillée, comme DistilBERT peut offrir des performances similaires avec une surcharge de calcul considérablement inférieure et une inférence plus rapide qu'un modèle plus grand comme BERT.

Utilisez des solutions hyper-efficaces spécifiques à un domaine

Choisissez des solutions de ML spécialisées qui offrent de meilleures performances et nécessitent beaucoup moins de puissance de calcul qu'un grand modèle de fondation. Ces solutions spécialisées sont souvent pré-entraînées et hyper-optimisées. Elles peuvent réduire considérablement la consommation d'énergie et les efforts de recherche pour les charges de travail d'entraînement et d'inférence. Voici quelques exemples de solutions spécialisées spécifiques à un domaine :

  • Earth AI est une solution économe en énergie qui synthétise de grandes quantités de données géospatiales mondiales pour fournir des insights précis, exploitables et en temps opportun.
  • WeatherNext produit des prévisions météorologiques mondiales plus rapides, plus efficaces et très précises par rapport aux méthodes physiques classiques.

Appliquez des techniques de compression de modèle appropriées

Voici quelques exemples de techniques que vous pouvez utiliser pour la compression de modèles :

  • Élagage : supprimez les paramètres inutiles d'un réseau de neurones. Il s'agit de paramètres qui ne contribuent pas de manière significative aux performances d'un modèle. Cette technique réduit la taille du modèle et les ressources de calcul nécessaires à l'inférence.
  • Quantification : réduisez la précision des paramètres du modèle. Par exemple, réduisez la précision de 32 bits à virgule flottante à des entiers de 8 bits. Cette technique peut aider à réduire considérablement l'empreinte mémoire et la consommation d'énergie sans réduction notable de la précision.
  • Distillation des connaissances : entraînez un modèle élève plus petit pour imiter le comportement d’un modèle enseignant plus grand et plus complexe. Le modèle élève peut atteindre un niveau de performances élevé avec moins de paramètres et en consommant moins d'énergie.

Utilisez du matériel spécialisé

Comme indiqué dans la section Suivez les bonnes pratiques des 4 M pour la sélection des ressources, choisissez des processeurs et des systèmes optimisés pour l’entraînement ML. Ces processeurs améliorent les performances et l'efficacité énergétique d'un facteur 2 à 5 par rapport aux processeurs à usage général.

Utilisez l'affinage d'un sous-ensemble de paramètres

Au lieu d'ajuster tous les milliards de paramètres d'un modèle (affinage complet), utilisez des méthodes d'affinage d'un sous-ensemble de paramètres (PEFT, Parameter-Efficient Fine-Tuning) comme l'adaptation de faible rang (LoRA, Low-Rank Adaptation). Avec cette technique, vous figez les pondérations du modèle d'origine et n'entraînez qu'un petit nombre de nouvelles couches légères. Cette approche permet de réduire les coûts et la consommation d'énergie.

Suivez les bonnes pratiques pour les opérations d'IA et de ML

Les pratiques opérationnelles ont un impact significatif sur la durabilité de vos charges de travail d'IA et de ML. Tenez compte des recommandations suivantes.

Optimisez les processus d'entraînement des modèles

Utilisez les techniques suivantes pour optimiser vos processus d'entraînement des modèles :

  • Arrêt prématuré : surveillez le processus d'entraînement et arrêtez-le lorsque vous n'observez plus d'amélioration des performances du modèle par rapport à l'ensemble de validation. Cette technique vous permet d'éviter les calculs et la consommation d'énergie inutiles.
  • Chargement efficace des données : utilisez des pipelines de données efficaces pour vous assurer que les GPU et les TPU sont toujours utilisés et n'attendent pas les données. Cette technique permet de maximiser l'utilisation des ressources et de réduire le gaspillage d'énergie.
  • Réglage optimisé des hyperparamètres : pour trouver plus efficacement les hyperparamètres optimaux, utilisez des techniques telles que l'optimisation bayésienne ou l'apprentissage par renforcement. Évitez les recherches exhaustives dans la grille, qui peuvent être des opérations gourmandes en ressources.

Améliorez l'efficacité de l'inférence

Pour améliorer l'efficacité des tâches d'inférence d'IA, utilisez les techniques suivantes :

  • Traitement par lot : regroupez plusieurs requêtes d'inférence par lots et profitez du traitement parallèle sur les GPU et les TPU. Cette technique permet de réduire le coût énergétique par prédiction.
  • Mise en cache avancée : implémentez une stratégie de mise en cache multicouche, qui inclut la mise en cache clé-valeur (KV) pour la génération autorégressive et la mise en cache des invites sémantiques pour les réponses des applications. Cette technique permet de contourner les calculs de modèles redondants et peut entraîner des réductions significatives de la consommation d'énergie et des émissions de carbone.

Mesurez et surveillez

Surveillez et mesurez les paramètres suivants :

  • Utilisation et coût : utilisez les outils appropriés pour suivre l'utilisation des jetons, la consommation d'énergie et l'empreinte carbone de vos charges de travail d'IA. Ces données vous aident à identifier les opportunités d'optimisation et à rendre compte des progrès réalisés vers les objectifs de développement durable.
  • Performances : surveillez en continu les performances du modèle en production. Identifiez les problèmes tels que la dérive des données, qui peuvent indiquer que le modèle doit être affiné à nouveau. Si vous devez réentraîner le modèle, vous pouvez utiliser le modèle affiné d'origine comme point de départ et économiser ainsi beaucoup de temps, d'argent et d'énergie lors des mises à jour.

Pour en savoir plus sur l'opérationnalisation de l'amélioration continue, consultez la section Mesurer et améliorer en continu le développement durable.

Implémentez une planification tenant compte des émissions de carbone

Concevez vos jobs de pipeline ML pour qu'ils s'exécutent dans des régions où le mix énergétique est le plus propre. Utilisez le rapport Empreinte carbone pour identifier les régions les moins intensives en carbone. Planifiez les tâches gourmandes en ressources en tant que jobs par lot pendant les périodes où le réseau électrique local présente un pourcentage plus élevé d'énergie sans émission de carbone (CFE, Carbon-Free Energy).

Optimisez les pipelines de données

Les opérations de ML et l'affinage nécessitent un ensemble de données propre et de haute qualité. Avant de démarrer les jobs de ML, utilisez des services de traitement de données gérés pour préparer efficacement les données. Par exemple, utilisez Dataflow pour le traitement par flux et par lot, et utilisez Managed Service pour Apache Spark pour les pipelines Spark et Hadoop gérés. Un pipeline de données optimisé permet de s'assurer que votre charge de travail d'affinage n'attend pas les données. Vous pouvez ainsi maximiser l'utilisation des ressources et réduire le gaspillage d'énergie.

Adoptez le MLOps

Pour automatiser et gérer l'ensemble du cycle de vie du ML, implémentez des pratiques d'opérations de ML (MLOps). Ces pratiques permettent de s'assurer que les modèles sont surveillés, validés et redéployés en continu et de manière efficace, ce qui permet d'éviter les entraînements ou l'allocation de ressources inutiles.

Utilisez des services gérés

Au lieu de gérer votre propre infrastructure, utilisez des services cloud gérés tels que Gemini Enterprise Agent Platform. La plate-forme cloud gère la gestion des ressources sous-jacentes, ce qui vous permet de vous concentrer sur le processus d'affinage. Utilisez des services qui incluent des outils intégrés pour le réglage des hyperparamètres, la surveillance des modèles et la gestion des ressources.

Étape suivante