Questa pagina mostra come creare un set di dati Agent Platform dai dati tabulari per iniziare ad addestrare i modelli di previsione. Puoi creare un set di dati utilizzando laconsole o l'API Agent Platform. Google Cloud
Prima di iniziare
Prima di creare un set di dati Agent Platform dai dati tabulari, prepara i dati di addestramento.
Crea un set di dati vuoto e associa i dati preparati
Per creare un modello di machine learning per la previsione, devi disporre di una raccolta rappresentativa di dati da utilizzare per l'addestramento. Utilizza la Google Cloud console o l'API per associare i dati preparati al set di dati.
Quando crei un set di dati, lo associ anche alla relativa origine dati. I dati di addestramento possono essere un file CSV in Cloud Storage o una tabella in BigQuery. Se l'origine dati si trova in un progetto diverso, assicurati di configurare le autorizzazioni richieste.
Google Cloud Console
- Nella Google Cloud console, nella sezione Agent Platform, vai a alla pagina Set di dati.
- Fai clic su Crea per aprire la pagina dei dettagli di creazione del set di dati.
- Modifica il campo Nome set di dati per creare un nome visualizzato descrittivo per il set di dati.
- Seleziona la scheda Tabulare.
- Seleziona lo scopo Previsione.
- Seleziona una regione dall'elenco a discesa Regione.
- Fai clic su Crea per creare il set di dati vuoto e passare alla scheda Origine.
- Scegli una delle seguenti opzioni in base all'origine dati.
File CSV sul computer
- Fai clic su Carica file CSV dal tuo computer.
- Fai clic su Seleziona file e scegli tutti i file locali da caricare in un bucket Cloud Storage bucket.
- Nella sezione Seleziona un percorso Cloud Storage , inserisci il percorso del bucket Cloud Storage o fai clic su Sfoglia per scegliere la posizione di un bucket.
File CSV in Cloud Storage
- Fai clic su Seleziona file CSV da Cloud Storage.
- Nella sezione Seleziona file CSV da Cloud Storage , inserisci il percorso del bucket Cloud Storage o fai clic su Sfoglia per scegliere la posizione dei file CSV.
Una tabella o una visualizzazione in BigQuery
- Fai clic su Seleziona una tabella o una visualizzazione da BigQuery.
- Inserisci gli ID progetto, set di dati e tabella per il file di input.
- Fai clic su Continua.
L'origine dati è associata al set di dati.
-
Nella scheda Analizza, specifica la colonna Timestamp e la
Identificatore serie
colonna per questo set di dati.
Puoi specificare queste colonne anche quando addestri il modello, ma in genere un set di dati di previsione ha colonne specifiche per l'identificatore di tempo e serie temporali, quindi è consigliabile specificarle nel set di dati.
API : CSV
REST
Utilizza il metodo datasets.create per creare un set di dati.
Prima di utilizzare i dati della richiesta, apporta le sostituzioni seguenti:
-
LOCATION: regione in cui verrà archiviato il set di dati. Deve essere una
regione che supporta
le risorse del set di dati. Ad esempio,
us-central1. - PROJECT: il tuo ID progetto.
- DATASET_NAME: nome visualizzato per il set di dati.
-
METADATA_SCHEMA_URI: l'URI del file di schema per il tuo scopo.
gs://google-cloud-aiplatform/schema/dataset/metadata/time_series_1.0.0.yaml -
URI: percorsi (URI) dei bucket Cloud Storage contenenti i dati di addestramento.
Può essere più di uno. Ogni URI ha il formato:
gs://GCSprojectId/bucketName/fileName
- PROJECT_NUMBER: il numero di progetto generato automaticamente per il tuo progetto.
Metodo HTTP e URL:
POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT/locations/LOCATION/datasets
Corpo JSON della richiesta:
{
"display_name": "DATASET_NAME",
"metadata_schema_uri": "METADATA_SCHEMA_URI",
"metadata": {
"input_config": {
"gcs_source": {
"uri": [URI1, URI2, ...]
}
}
}
}
Per inviare la richiesta, scegli una di queste opzioni:
curl
Salva il corpo della richiesta in un file denominato request.json,
quindi esegui il comando seguente:
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT/locations/LOCATION/datasets"
PowerShell
Salva il corpo della richiesta in un file denominato request.json,
quindi esegui il comando seguente:
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT/locations/LOCATION/datasets" | Select-Object -Expand Content
Dovresti ricevere una risposta JSON simile alla seguente:
{
"name": "projects/PROJECT_NUMBER/locations/LOCATION/datasets/DATASET_ID/operations/OPERATION_ID",
"metadata": {
"@type": "type.googleapis.com/google.cloud.aiplatform.v1.CreateDatasetOperationMetadata",
"genericMetadata": {
"createTime": "2020-07-07T21:27:35.964882Z",
"updateTime": "2020-07-07T21:27:35.964882Z"
}
}
Java
Prima di provare questo esempio, segui le istruzioni di configurazione Java nella guida rapida di Agent Platform per l'utilizzo delle librerie client. Per saperne di più, consulta la documentazione di riferimento dell'JavaAPI di Agent Platform.
Per eseguire l'autenticazione in Agent Platform, configura le credenziali predefinite dell'applicazione. Per saperne di più, consulta Configura l'autenticazione per un ambiente di sviluppo locale.
Node.js
Prima di provare questo esempio, segui le istruzioni di configurazione di Node.js nella guida rapida di Agent Platform per l'utilizzo delle librerie client. Per saperne di più, consulta la documentazione di riferimento dell' API Node.js di Agent Platform.
Per eseguire l'autenticazione in Agent Platform, configura le credenziali predefinite dell'applicazione. Per saperne di più, consulta Configura l'autenticazione per un ambiente di sviluppo locale.
Python
Per scoprire come installare o aggiornare l'SDK Vertex AI Python, consulta Installare l'SDK Vertex AI Python. Per saperne di più, consulta la documentazione di riferimento dell'API Python.
API : BigQuery
REST
Utilizza il datasets.create per creare un set di dati.
Prima di utilizzare i dati della richiesta, apporta le sostituzioni seguenti:
-
LOCATION: regione in cui verrà archiviato il set di dati. Deve essere una
regione che supporta
le risorse del set di dati. Ad esempio,
us-central1. - PROJECT: .
- DATASET_NAME: nome visualizzato per il set di dati.
-
METADATA_SCHEMA_URI: l'URI del file di schema per il tuo scopo.
gs://google-cloud-aiplatform/schema/dataset/metadata/time_series_1.0.0.yaml -
URI: percorso della tabella BigQuery contenente i dati di addestramento. Nel formato:
bq://bqprojectId.bqDatasetId.bqTableId
- PROJECT_NUMBER: il numero di progetto generato automaticamente per il tuo progetto.
Metodo HTTP e URL:
POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT/locations/LOCATION/datasets
Corpo JSON della richiesta:
{
"display_name": "DATASET_NAME",
"metadata_schema_uri": "METADATA_SCHEMA_URI",
"metadata": {
"input_config": {
"bigquery_source" :{
"uri": "URI
}
}
}
}
Per inviare la richiesta, scegli una di queste opzioni:
curl
Salva il corpo della richiesta in un file denominato request.json,
quindi esegui il comando seguente:
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT/locations/LOCATION/datasets"
PowerShell
Salva il corpo della richiesta in un file denominato request.json,
quindi esegui il comando seguente:
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT/locations/LOCATION/datasets" | Select-Object -Expand Content
Dovresti ricevere una risposta JSON simile alla seguente:
{
"name": "projects/PROJECT_NUMBER/locations/LOCATION/datasets/DATASET_ID/operations/OPERATION_ID",
"metadata": {
"@type": "type.googleapis.com/google.cloud.aiplatform.v1.CreateDatasetOperationMetadata",
"genericMetadata": {
"createTime": "2020-07-07T21:27:35.964882Z",
"updateTime": "2020-07-07T21:27:35.964882Z"
}
}
Java
Prima di provare questo esempio, segui le istruzioni di configurazione Java nella guida rapida di Agent Platform per l'utilizzo delle librerie client. Per saperne di più, consulta la documentazione di riferimento dell'JavaAPI di Agent Platform.
Per eseguire l'autenticazione in Agent Platform, configura le credenziali predefinite dell'applicazione. Per saperne di più, consulta Configura l'autenticazione per un ambiente di sviluppo locale.
Node.js
Prima di provare questo esempio, segui le istruzioni di configurazione di Node.js nella guida rapida di Agent Platform per l'utilizzo delle librerie client. Per saperne di più, consulta la documentazione di riferimento dell' API Node.js di Agent Platform.
Per eseguire l'autenticazione in Agent Platform, configura le credenziali predefinite dell'applicazione. Per saperne di più, consulta Configura l'autenticazione per un ambiente di sviluppo locale.
Python
Per scoprire come installare o aggiornare l'SDK Vertex AI Python, consulta Installare l'SDK Vertex AI Python. Per saperne di più, consulta la documentazione di riferimento dell'API Python.
Recupera lo stato dell'operazione
Alcune richieste avviano operazioni a lunga esecuzione che richiedono tempo per essere completate. Queste richieste restituiscono un nome dell'operazione, che puoi utilizzare per visualizzare lo stato dell'operazione o annullarla. Agent Platform fornisce metodi helper per effettuare chiamate a operazioni a lunga esecuzione. Per saperne di più, consulta Utilizzare le operazioni a lunga esecuzione.