Elige opciones de procesamiento

En este documento, se comparan las opciones principales de procesamiento para ayudarte a seleccionar la mejor solución o herramienta para la arquitectura, el escalamiento y otros requisitos de tu aplicación. Google Cloud

Para implementar cargas de trabajo en Google Cloud, puedes elegir entre una variedad de soluciones o herramientas que equilibren tu control sobre la infraestructura con la administración automatizada de Google. La opción de procesamiento que selecciones puede afectar significativamente el rendimiento, el costo y el esfuerzo de mantenimiento diario. Para comprender mejor estas opciones antes de elegir una, consulta Descripción general de Google Compute.

Elige una opción de procesamiento

La mejor solución o herramienta de procesamiento para tu carga de trabajo puede depender de varios factores. Por ejemplo, si deseas migrar tu entorno de VMware a Google Cloud, entonces usa VMware Engine.

Para ayudarte a analizar las compensaciones entre la administración de la infraestructura, los contenedores y las instancias de Compute Engine, usa el siguiente diagrama de flujo. Si deseas comparar rápidamente las funciones entre las opciones de procesamiento, consulta la tabla de comparación en este documento.

Un diagrama de flujo para ayudarte a elegir una opción de procesamiento en Google Cloud.

Las preguntas del diagrama de flujo anterior son las siguientes:

  1. ¿Quieres que Google administre toda la infraestructura?

  2. ¿Quieres la organización de clústeres para tus cargas de trabajo (como Kubernetes o Slurm)?

    • : ve a la pregunta 4.

    • No: ve a la pregunta 3.

  3. ¿Quieres administrar las VMs o las instancias de hardware directamente?

  4. ¿Quieres ejecutar aplicaciones alojadas en contenedores estándar (como microservicios o APIs)?

    • : usa GKE.

    • No: ve a la pregunta 5.

  5. ¿Quieres que Google administre el ciclo de vida del clúster?

Usa Batch

Elige Batch para cargas de trabajo como el análisis de datos asíncrono, las tareas de conversión de video o las simulaciones científicas. Con Batch, Google administra la infraestructura para que puedas programar, poner en cola y ejecutar trabajos de procesamiento por lotes en Google Cloud. No necesitas implementar ni administrar servidores por tu cuenta. En cambio, envías secuencias de comandos ejecutables o cargas de trabajo alojadas en contenedores a una cola de trabajos.

Batch proporciona las siguientes capacidades:

  • Compatibilidad con aceleradores: Batch admite GPU NVIDIA hasta RTX PRO 6000 para cargas de trabajo de procesamiento por lotes y de computación de alto rendimiento (HPC) que requieren un alto rendimiento. Batch no admite TPU de Google.

  • Control de SO y kernel: Google administra el SO y el entorno de ejecución para tus trabajos.

  • Organización: La cola de trabajos programa tareas y vuelve a intentarlas si se produce un error. Para ajustar la capacidad, el servicio aprovisiona e inicia VMs según la cantidad de trabajos en cola y detiene las VMs cuando se completan esos trabajos.

Para obtener más información, consulta Cómo comenzar a usar Batch.

Usa Cloud Run

Elige Cloud Run para implementar aplicaciones o trabajos web alojados en contenedores sin administración del servidor. Cloud Run es una plataforma sin servidores que te permite ejecutar aplicaciones alojadas en contenedores sin administración de servidores ni clústeres. Google controla toda la administración de la infraestructura por ti, incluido el SO, el kernel, la configuración de la red y la administración de la capacidad.

Cloud Run ofrece las siguientes funciones:

  • Compatibilidad con aceleradores: Cloud Run admite GPU NVIDIA RTX PRO 6000 Blackwell y L4. Cloud Run no admite otros modelos de GPU ni TPU de Google.

  • Control de SO y kernel: Empaquetas tus cargas de trabajo como contenedores y las ejecutas como servicios web, tareas asíncronas o trabajos por lotes.

  • Organización: Como plataforma sin servidores, Google inicia, ejecuta y escala tus instancias de contenedor sin intervención manual. Para los servicios web, Cloud Run agrega o quita instancias de contenedor según las solicitudes entrantes o el consumo de CPU.

Para obtener más información, consulta Qué es Cloud Run.

Usa Cluster Director

Elige Cluster Director si deseas entrenar modelos de IA o ejecutar trabajos de simulación programados por Slurm sin tareas de configuración de red o de configuración del SO del clúster. Cluster Director es un servicio administrado que automatiza la implementación y la administración del ciclo de vida para clústeres de IA, AA y HPC.

Cluster Director proporciona las siguientes capacidades:

  • Compatibilidad con aceleradores: Cluster Director admite GPU NVIDIA, incluidos GB300 Ultra Superchips, GB200 Superchips, B200, H200, y H100, para cargas de trabajo de IA, AA y HPC. Cluster Director no admite TPU de Google.

  • Control de SO y kernel: Google administra el ciclo de vida del clúster y configura un SO Ubuntu personalizado diseñado para AA. El servicio proporciona un entorno listo para usar, completo con nodos de acceso, conjuntos de nodos de procesamiento y plantillas de implementación creadas para cargas de trabajo de IA.

  • Organización: Para ajustar la capacidad, Slurm crea nodos cuando aumenta el consumo de CPU y borra los nodos cuando permanecen inactivos durante un período para evitar cargos innecesarios.

Para obtener más información, consulta Descripción general de Cluster Director.

Usa Cluster Toolkit

Elige Cluster Toolkit si deseas usar plantillas de implementación automatizadas y, al mismo tiempo, mantener el control administrativo sobre tu SO y pila de software. Cluster Toolkit es una herramienta de código abierto que se usa para aprovisionar y configurar clústeres de IA, AA y HPC en Google Cloud.

Cluster Toolkit ofrece las siguientes funciones:

  • Compatibilidad con aceleradores: Cluster Toolkit admite GPU NVIDIA y TPU de Google, que aprovisionas y configuras con plantillas de implementación llamadas planos. Con estos archivos de configuración automatizados, implementas una infraestructura de clúster estandarizada y repetible basada en los principios de infraestructura como código (IaC).

  • Control de SO y kernel: Cluster Toolkit implementa instancias de procesamiento o recursos de GKE dentro de tu proyecto. Google CloudDespués de implementar estos recursos, mantienes el control administrativo sobre el SO, la configuración del software y el ciclo de vida del clúster.

  • Organización: Para ajustar la capacidad, configura grupos de instancias administrados (MIG) o herramientas de GKE para agregar o quitar nodos según la configuración de tu plantilla.

Para obtener más información, consulta Descripción general de Cluster Toolkit.

Usa Compute Engine

Elige Compute Engine si tus aplicaciones requieren configuraciones arquitectónicas personalizadas, parámetros de configuración de kernel especializados o control administrativo sobre servidores virtuales. Compute Engine es Google Cloud's core plataforma principal de infraestructura como servicio (IaaS) de, que te permite crear y ejecutar instancias de VM y de hardware directamente en el hardware físico de Google.

Compute Engine proporciona las siguientes capacidades:

  • Compatibilidad con aceleradores: Compute Engine admite GPU NVIDIA y TPU de Google, que adjuntas a tus instancias de procesamiento.

  • Control de SO y kernel: Conservas el control completo sobre el SO, la configuración del kernel y los archivos de arranque, y seleccionas los procesadores de CPU, las configuraciones de memoria los tipos de almacenamiento y el SO invitado.

  • Organización: Debido a que la organización es manual, debes configurar y administrar tus propias instancias de procesamiento, reglas de red, rutas de tráfico y sistemas de copia de seguridad para garantizar la confiabilidad. Para ajustar la capacidad, agrega o quita instancias de procesamiento según sea necesario, usa herramientas personalizadas o configura MIG para ajustar la capacidad del clúster.

Para obtener más información, consulta Descripción general de Compute Engine.

Usa GKE

Elige Google Kubernetes Engine (GKE) cuando necesites una plataforma de organización sólida basada en contenedores para aplicaciones distribuidas o microservicios de uso general. GKE es una plataforma de Kubernetes administrada estándar de la industria para implementar, escalar y organizar aplicaciones alojadas en contenedores. Google administra el plano de control de Kubernetes para la seguridad y la disponibilidad del sistema.

GKE ofrece las siguientes funciones:

  • Compatibilidad con aceleradores: GKE admite GPU NVIDIA y TPU de Google para cargas de trabajo alojadas en contenedores.

  • Control de SO y kernel: Google administra el SO en los modos Autopilot y Standard. En el modo Autopilot, Google administra los nodos del clúster y los ajustes de capacidad sin intervención manual. En el modo Standard, administras los grupos de nodos del clúster.

  • Organización: Para ajustar la capacidad a medida que cambia la demanda, GKE agrega o quita contenedores con Horizontal Pod Autoscaler y Vertical Pod Autoscaler (HPA y VPA), y agrega o quita nodos con el escalador automático del clúster. GKE también organiza trabajos por lotes a través de Kueue.

Para obtener más información, consulta Descripción general de GKE.

Usa VMware Engine

Elige VMware Engine para migrar tus cargas de trabajo de VMware locales a la Google Cloud infraestructura con cambios operativos mínimos. VMware Engine es un servicio administrado que te permite ejecutar máquinas virtuales de VMware en hardware de Google sin modificaciones en la aplicación.

VMware Engine proporciona las siguientes capacidades:

  • Compatibilidad con aceleradores: VMware Engine no admite GPU ni TPU.

  • Control de SO y kernel: Ejecutas aplicaciones de VMware en Google Cloud tal como se ejecutan en tu configuración existente. Google administra el hardware físico, la infraestructura de red y la plataforma de software de VMware, como vSphere, vCenter, vSAN y NSX-T. Conservas el control administrativo sobre tus VMs, el SO invitado y las herramientas de administración de VMware.

  • Organización: Para ajustar el tamaño de tu nube privada, agrega o quita nodos ESXi dedicados.

Para obtener más información, consulta Descripción general de Google Cloud VMware Engine.

Compara las opciones de procesamiento

Para identificar la solución o herramienta de procesamiento que se adapta a tu carga de trabajo, compara las capacidades técnicas entre las opciones de procesamiento en la siguiente tabla:

Opción de Compute GPU TPU Control de SO y kernel Organización Escalamiento
Lote Hasta NVIDIA RTX PRO 6000 No Administrado por Google Cola de trabajos Automático según los trabajos en cola
Cloud Run NVIDIA RTX PRO 6000 Blackwell y L4 No Administrado por Google Sin servidores Automático según las solicitudes o el consumo de CPU
Cluster Director NVIDIA GB300 Ultra Superchips, GB200 Superchips, B200, H200 y H100 No Administrado por Google (Ubuntu personalizado) Slurm Automático según el consumo de CPU
Cluster Toolkit Todas las GPU NVIDIA disponibles Todas las TPU de Google disponibles Administración automática Archivos de configuración automatizados (IaC) Personalizable con MIG o herramientas de GKE
Compute Engine Todas las GPU NVIDIA disponibles Todas las TPU de Google disponibles Administración automática Manual Manual o automático con MIG
Google Kubernetes Engine (GKE) Todas las GPU NVIDIA disponibles Todas las TPU de Google disponibles Administrado por Google (Autopilot) o semiadministrado (Standard) Kubernetes Escalamiento automático de nodos y pods
VMware Engine No No Administrado por Google Plataforma de VMware Manual con nodos ESXi