Questo documento ti aiuta a ottimizzare il goodput, ovvero la velocità di trasferimento dei dati utili, per i tuoi carichi di lavoro. Per ottenere questa ottimizzazione, abbiamo selezionato ricette di goodput riproducibili che utilizzano modelli e framework di machine learning (ML) comuni. Per esaminare queste ricette, consulta l'
organizzazione GitHub di AI Hypercomputer.
Le ricette di goodput sono state testate su cluster creati utilizzando Cluster Toolkit.
Per garantire un'affidabilità ottimale del carico di lavoro e massimizzare il goodput, puoi anche identificare in modo proattivo i nodi di un cluster Google Kubernetes Engine (GKE) che probabilmente subiranno un degrado nelle prossime cinque ore. Questo avviso anticipato ti aiuta a evitare di pianificare nuovi carichi di lavoro su VM a rischio, riducendo così il rischio di interruzioni dei job. Per saperne di più, consulta
Attivare la previsione dello stato dei nodi.
Prima di iniziare
Prima di utilizzare le ricette di goodput descritte in questo documento, completa i seguenti passaggi, se non l'hai già fatto:
[[["Facile da capire","easyToUnderstand","thumb-up"],["Il problema è stato risolto","solvedMyProblem","thumb-up"],["Altra","otherUp","thumb-up"]],[["Difficile da capire","hardToUnderstand","thumb-down"],["Informazioni o codice di esempio errati","incorrectInformationOrSampleCode","thumb-down"],["Mancano le informazioni o gli esempi di cui ho bisogno","missingTheInformationSamplesINeed","thumb-down"],["Problema di traduzione","translationIssue","thumb-down"],["Altra","otherDown","thumb-down"]],["Ultimo aggiornamento 2026-09-09 UTC."],[],[]]