Plataforma de ML Diagnostics
Google Cloud ML Diagnostics es una plataforma administrada de extremo a extremo para optimizar, supervisar y diagnosticar cargas de trabajo de IA y AA en Google Cloud. Usa ML Diagnostics para supervisar cargas de trabajo, así como para recopilar y visualizar todas las métricas, las configuraciones y los perfiles de las cargas de trabajo en una sola plataforma. ML Diagnostics se aplica a las cargas de trabajo de entrenamiento y de inferencia, y es compatible con todos los orquestadores en Cloud TPU, incluidos Google Kubernetes Engine (GKE) y los orquestadores personalizados. ML Diagnostics incluye las siguientes funciones:
- Supervisión de cargas de trabajo: Supervisa y diagnostica automáticamente las cargas de trabajo de IA/AA que se ejecutan en las TPU de GKE. Para cada trabajo de GKE, la supervisión de cargas de trabajo de ML Diagnostics crea automáticamente una ejecución de aprendizaje automático, supervisa el ciclo de trabajo de la TPU en la carga de trabajo, detecta eventos que afectan la carga de trabajo y analiza diferentes capas de la carga de trabajo, como la infraestructura, el orquestador y el framework, para ayudar a determinar las posibles causas del evento.
- Ejecuciones de aprendizaje automático: Usa ML Diagnostics para crear y registrar tus ejecuciones de aprendizaje automático a través de Google Cloud CLI o integra el SDK de ML Diagnostics con tu carga de trabajo. Puedes crear y registrar ejecuciones automáticamente con la supervisión de cargas de trabajo, implementar instancias administradas XProf con tus ejecuciones de aprendizaje automático , y recopilar y administrar métricas, configuraciones y sesiones de perfiles de cargas de trabajo.
- Experiencia de gcloud CLI: Usa las APIs de ML Diagnostics a través de gcloud CLI para registrar y administrar ejecuciones, implementar recursos administrados de XProf, visualizar sesiones de perfiles en buckets de almacenamiento y activar capturas de perfiles desde la CLI. También puedes enumerar todos los eventos detectados por la supervisión de cargas de trabajo y obtener detalles del analizador para estos eventos a través de la CLI o la API.
- SDK de Python: Usa el SDK de ML Diagnostics de código abierto integrado con cargas de trabajo de AA para obtener una experiencia completa de diagnóstico de cargas de trabajo de AA. Supervisa las cargas de trabajo, y recopila y administra métricas de cargas de trabajo, configuraciones y perfiles en Google Cloud.
- Generación de perfiles administrada: ML Diagnostics implementa una instancia administrada de XProf con un backend escalable en cuentas asociadas, lo que permite la carga rápida de perfiles grandes. Admite que varios usuarios accedan a los perfiles de forma simultánea y contiene funciones integradas, como la generación de perfiles de varios hosts y la generación de perfiles a pedido.
- Métricas de cargas de trabajo: Haz un seguimiento de las métricas de cargas de trabajo, incluidas la calidad del modelo, el rendimiento del modelo y las métricas del sistema. Con la supervisión de cargas de trabajo, puedes obtener métricas del sistema asociadas con la carga de trabajo sin integrar el SDK.
- Administración de la configuración de cargas de trabajo: Haz un seguimiento de las configuraciones de cargas de trabajo, incluidas las configuraciones de software, las configuraciones del sistema y las configuraciones definidas por el usuario.
- Visualizaciones en Cluster Director y GKE: Visualiza métricas, configuraciones y perfiles en Cluster Director y Google Kubernetes Engine en la Google Cloud consola.
- Uso compartido de vínculos: Colabora con vínculos compartibles con información sobre ejecuciones de aprendizaje automático, supervisión de cargas de trabajo, métricas y perfiles.
Rutas de usuario
Puedes usar la plataforma de ML Diagnostics automáticamente con la supervisión de cargas de trabajo para todos los trabajos de GKE o integrar el SDK con tu carga de trabajo para obtener la experiencia completa de diagnóstico de cargas de trabajo de AA. Puedes interactuar con el sistema de diagnóstico de AA a través de Google Cloud consola o la CLI. La supervisión de cargas de trabajo está disponible automáticamente para todas las cargas de trabajo implementadas con GKE en las TPU.
Con la CLI, puedes usar ML Diagnostics gcloud CLI para crear o modificar una ejecución de aprendizaje automático y, luego, implementar los recursos administrados de XProf. Con el SDK de ML Diagnostics, el SDK debe integrarse en tu carga de trabajo de AA para recopilar y administrar métricas y configuraciones de cargas de trabajo, y para implementar recursos administrados de XProf.
Para comenzar, usa una de las siguientes guías:
Generación de perfiles administrada con XProf
Puedes obtener una experiencia de generación de perfiles administrada con XProf cuando usas la CLI o el SDK. XProf es una herramienta de código abierto de generación de perfiles y análisis de rendimiento para cargas de trabajo de aprendizaje automático y forma parte del ecosistema de OpenXLA.
Estos son algunos de los beneficios de una experiencia de generación de perfiles administrada en comparación con una experiencia de generación de perfiles autoalojada:
- No se requiere configuración de XProf ni otras dependencias.
- Mejor seguridad y protección contra vulnerabilidades.
- Vínculos compartibles para la colaboración.
- Carga más rápida de perfiles grandes.
- Compatibilidad con varios usuarios que acceden a los perfiles de forma simultánea con el ajuste de escala automático de los recursos según la carga de acceso a los vínculos.
- Funciones integradas, como la generación de perfiles de varios hosts y la generación de perfiles a pedido.
- Carga varias sesiones de perfiles en varias ejecuciones con la misma instancia administrada de XProf.
- No se aplican cargos por los recursos administrados de XProf que implementa la plataforma de ML Diagnostics, lo que hace que XProf administrado sea más rentable que el autoalojamiento de XProf.
Requisitos previos
Antes de usar ML Diagnostics, habilita la API de Cluster Director y agrega los permisos de IAM necesarios. Si usas GKE, la supervisión de cargas de trabajo ya está habilitada. Sin embargo, el SDK de ML Diagnostics y la generación de perfiles a pedido requieren artefactos adicionales de GKE y la configuración de tu clúster de GKE. Para obtener más información, consulta Configura GKE.
Habilita la API de Cluster Director
No es necesario que uses Cluster Director para implementar y administrar tus clústeres para usar el producto de ML Diagnostics. ML Diagnostics funciona con clústeres administrados por GKE, Cluster Director o orquestadores personalizados. ML Diagnostics forma parte de la familia de APIs de Cluster Director, pero no depende de que los usuarios usen el producto de Cluster Director en sí.
Para obtener más información sobre cómo habilitar la API de Cluster Director, consulta Habilita una API en tu Google Cloud proyecto.
Permisos de IAM
Google Cloud Lacuenta de servicio que usa tu carga de trabajo requiere los siguientes roles de IAM asignados en el proyecto:
roles/hypercomputecluster.editor: Para obtener acceso completo para crear y administrar recursosMLRuny ver la interfaz de usuario.roles/logging.logWriter: Para escribir registros y métricas en Cloud Logging.roles/storage.objectUser: Para guardar perfiles en el bucket de Cloud Storage especificado enmachinelearning_run.
También puedes crear roles personalizados que asignen a los usuarios un subconjunto de las APIs necesarias para ML Diagnostics. Como los usuarios no necesitan usar Cluster Director para administrar clústeres, solo debes asignar los siguientes permisos:
hypercomputecluster.locations.gethypercomputecluster.locations.listhypercomputecluster.machineLearningRuns.createhypercomputecluster.machineLearningRuns.deletehypercomputecluster.machineLearningRuns.gethypercomputecluster.machineLearningRuns.listhypercomputecluster.machineLearningRuns.updatehypercomputecluster.operations.cancelhypercomputecluster.operations.deletehypercomputecluster.operations.gethypercomputecluster.operations.listresourcemanager.projects.getResourcemanager.projects.list
Para las cargas de trabajo en Google Kubernetes Engine, usa Workload Identity
Federation para asociar una
cuenta de servicio de Kubernetes con una Google Cloud cuenta de servicio a la que se le
otorgaron los roles necesarios. Los Pods que se ejecutan en la red del host (hostNetwork: true) no usan Workload Identity Federation for GKE. Para estos casos, consulta Workload Identity Federation for GKE.
Precios
Se te cobra por el almacenamiento de métricas a través de Cloud Logging y el almacenamiento de perfiles a través de Cloud Storage. No es necesario habilitar ninguna facturación adicional para estos servicios cuando se usa la plataforma de ML Diagnostics. No se aplican cargos por los recursos administrados de XProf que implementa la plataforma de ML Diagnostics.