Utilizzare le VM con avvio flessibile con l'inferenza

Questa guida descrive i vantaggi e le limitazioni dell'utilizzo delle VM con inizio flessibile con l'inferenza di Gemini Enterprise Agent Platform. Questa guida descrive anche come eseguire il deployment di un modello che utilizza le VM con inizio flessibile.

Panoramica

Puoi ridurre il costo di esecuzione dei job di inferenza utilizzando le VM con inizio flessibile, con piattaforma Dynamic Workload Scheduler. Le VM con inizio flessibile offrono sconti significativi e sono adatte ai carichi di lavoro di breve durata.

Puoi specificare per quanto tempo ti serve una Flex-start VM, per una durata massima di sette giorni. Al termine del periodo di tempo richiesto, il modello di cui hai eseguito il deployment viene automaticamente annullato. Puoi anche annullare manualmente il deployment del modello prima della scadenza del periodo di tempo.

Annullamento automatico del deployment

Se richiedi una Flex-start VM per una durata specifica, il deployment del modello viene annullato automaticamente al termine del periodo di tempo. Ad esempio, se richiedi una VM con inizio flessibile per cinque ore, il deployment del modello viene annullato automaticamente cinque ore dopo l'invio. Ti viene addebitato solo il tempo di esecuzione del carico di lavoro.

Limitazioni e requisiti

Tieni presenti le seguenti limitazioni e i seguenti requisiti quando utilizzi le VM con inizio flessibile:

  • Durata massima: le VM con inizio flessibile hanno una durata massima di utilizzo di sette giorni. Qualsiasi richiesta di deployment per una durata maggiore verrà rifiutata.
  • Supporto TPU: l'utilizzo di VM con inizio flessibile con i pod TPU non è supportato.
  • Quota: assicurati di avere una quota preemptible di Agent Platform sufficiente prima di avviare il job. Per saperne di più, consulta Quote di frequenza.
  • Provisioning in coda: l'utilizzo di VM con inizio flessibile con provisioning in coda non è supportato.
  • Riciclo dei nodi: il riciclo dei nodi non è supportato.

Fatturazione

Se il carico di lavoro viene eseguito per meno di sette giorni, l'utilizzo di VM con inizio flessibile può ridurre i costi.

Quando utilizzi le VM con inizio flessibile, la fatturazione si basa sulla durata del job e sul tipo di macchina selezionato. Ti viene addebitato solo il tempo di esecuzione attiva del carico di lavoro. Non paghi il tempo in cui il job è in coda o qualsiasi tempo dopo la scadenza della durata richiesta.

La fatturazione è distribuita su due SKU:

  • Lo SKU di Compute Engine, con l'etichetta vertex-ai-online-prediction. Consulta i prezzi di Dynamic Workload Scheduler.

  • Lo SKU della commissione di gestione di Agent Platform. Consulta i prezzi di Agent Platform.

Ottenere inferenze utilizzando le VM con inizio flessibile

Per utilizzare le VM con inizio flessibile quando esegui il deployment di un modello per ottenere inferenze, puoi utilizzare l'API REST.

Prima di utilizzare i dati della richiesta, apporta le sostituzioni seguenti:

  • LOCATION_ID: la regione in cui utilizzi Agent Platform.
  • PROJECT_ID: Il tuo ID progetto. .
  • ENDPOINT_ID: l'ID dell'endpoint.
  • MODEL_ID: l'ID del modello di cui eseguire il deployment.
  • DEPLOYED_MODEL_NAME: un nome per DeployedModel. Puoi utilizzare anche il nome visualizzato di Model per la DeployedModel as well.
  • MACHINE_TYPE: (facoltativo) Le risorse macchina utilizzate per ogni nodo di questo deployment. L'impostazione predefinita è n1-standard-2. Scopri di più sui tipi di macchina.
  • ACCELERATOR_TYPE: (facoltativo) Il tipo di acceleratore da collegare alla macchina. Scopri di più.
  • ACCELERATOR_COUNT: (facoltativo) Il numero di acceleratori da utilizzare per ogni replica.
  • MAX_RUNTIME_DURATION: la durata massima del deployment con inizio flessibile. Il deployment del modello viene annullato automaticamente dopo questa durata. Specifica la durata in secondi, terminando con una s. Ad esempio, 3600s per un'ora. Il valore massimo è 604800s (7 giorni).
  • PROJECT_NUMBER: il numero di progetto generato automaticamente del tuo progetto.

Metodo HTTP e URL:

POST https://LOCATION-aiplatform.googleapis.com/v1beta1/projects/PROJECT_ID/locations/LOCATION/endpoints/ENDPOINT_ID:deployModel

Corpo JSON della richiesta:

{
  "deployedModel": {
    "model": "projects/PROJECT/locations/LOCATION/models/MODEL_ID",
    "displayName": "DEPLOYED_MODEL_NAME",
    "enableContainerLogging": true,
    "dedicatedResources": {
      "machineSpec": {
        "machineType": "MACHINE_TYPE",
        "acceleratorType": "ACCELERATOR_TYPE",
        "acceleratorCount": ACCELERATOR_COUNT
      },
      "flexStart": {
        "maxRuntimeDuration": "MAX_RUNTIME_DURATION"
      },
      "minReplicaCount": 2,
      "maxReplicaCount": 2
    },
  },
}

Per inviare la richiesta, espandi una di queste opzioni:

Dovresti ricevere una risposta JSON simile alla seguente:

{
  "name": "projects/PROJECT_ID/locations/LOCATION/endpoints/ENDPOINT_ID/operations/OPERATION_ID",
  "metadata": {
    "@type": "type.googleapis.com/google.cloud.aiplatform.v1beta1.DeployModelOperationMetadata",
    "genericMetadata": {
      "createTime": "2020-10-19T17:53:16.502088Z",
      "updateTime": "2020-10-19T17:53:16.502088Z"
    }
  }
}

Passaggi successivi