Model Armor è un Google Cloud servizio progettato per migliorare la sicurezza e la sicurezza delle applicazioni di AI, in particolare quelle che utilizzano modelli linguistici di grandi dimensioni (LLM). Funziona ispezionando i prompt inviati ai modelli e le risposte generate, aiutandoti a mitigare i rischi e applicare le pratiche di AI responsabile.
Per i dettagli sui risultati creati da Model Armor, consulta Risultati di Model Armor.
Configura modelli
Definisci la modalità di screening dei contenuti da parte di Model Armor creando e utilizzando i modelli di Model Armor. Un modello è un insieme di configurazioni riutilizzabile in cui specifichi i filtri da attivare, i livelli di confidenza per i filtri e il tipo di applicazione per ogni filtro. Per saperne di più, consulta Crea e gestisci modelli.
Configura impostazioni di base
Per garantire un livello di protezione di base, gli amministratori della sicurezza possono configurare le impostazioni di base a livello di organizzazione, cartella o progetto. Queste impostazioni impongono requisiti minimi per i filtri a cui devono attenersi tutti i modelli di Model Armor creati nell'ambito in questione, contribuendo a prevenire configurazioni eccessivamente permissive. Per saperne di più, consulta Configura impostazioni di base.
Sanifica prompt e risposte
Quando un utente invia un prompt all'applicazione, quest'ultima lo invia prima a Model Armor. Model Armor elabora il prompt tramite i filtri abilitati nel modello e restituisce una risposta che indica se sono state rilevate violazioni delle policy e i risultati dettagliati di ogni filtro. La logica dell'applicazione decide quindi cosa fare dopo.
Quando un LLM genera una risposta, prima di mostrarla all'utente, l'applicazione la invia a Model Armor. Model Armor esamina l'output dell'LLM utilizzando le configurazioni dei filtri definite nel modello e restituisce i risultati dell'analisi. L'applicazione decide quindi se mostrare la risposta all'utente, bloccandola potenzialmente se vengono rilevate violazioni.
Per saperne di più, consulta Sanifica prompt e risposte.