Sicherheit (verantwortungsbewusste Anwendung von KI)

Für generative KI-Modelle wie Gemini sind robuste Sicherheitsmaßnahmen erforderlich, um Risiken wie die Generierung schädlicher Inhalte, die Weitergabe sensibler Informationen oder Missbrauch zu minimieren. Die Gemini Enterprise Agent Platform bietet eine Reihe von Tools und Best Practices, um umfassende Sicherheitsmaßnahmen für Ihre Gemini-Modelle zu implementieren.

Potenzielle Sicherheitsrisiken und Strategien zur Risikominimierung

Beim Bereitstellen von Gemini-Modellen ist es wichtig, verschiedene potenzielle Risiken zu identifizieren und zu minimieren. Wenn Sie diese Risiken proaktiv angehen, können Sie Sicherheitsmaßnahmen effektiver implementieren. Ein mehrstufiger Sicherheitsansatz ist entscheidend, da er Folgendes minimieren oder verhindern kann:

  • Inhaltsrisiken:Dazu können schädliche Inhalte, Obszönitäten und Sexualisierung sowie Gewalt und grausame Inhalte gehören.
  • Risiken für die Markensicherheit:Generierte Inhalte stimmen möglicherweise nicht mit dem Ton oder den Werten Ihrer Marke überein, sie können Konkurrenten oder unangemessene Produkte bewerben oder Inhalte generieren, die zu Reputationsschäden führen können.
  • Risiken in Bezug auf die Übereinstimmung:Generierte Inhalte sind möglicherweise irrelevant oder ungenau.
  • Risiken in Bezug auf Sicherheit und Datenschutz:Generierte Inhalte können sensible Trainingsdaten oder Prompts weitergeben. Böswillige Nutzer können versuchen, das Modell zu zwingen, Sicherheitsprotokolle zu überschreiben oder sich auf unbeabsichtigte Weise zu verhalten.

Unsere bereitgestellten Modelle bieten verschiedene Funktionen, um diese potenziellen Probleme zu beheben:

  • Das Standardmodell und die nicht konfigurierbaren Filter bieten ein allgemeines Sicherheitsnetz.
  • Systemanweisungen geben dem Modell direkte Anweisungen zum bevorzugten Verhalten und zu Themen, die vermieden werden sollten.
  • Inhaltsfilter ermöglichen es Ihnen, bestimmte Schwellenwerte für häufige Arten von Schäden festzulegen.
  • Gemini als Filter bietet einen erweiterten, anpassbaren Kontrollpunkt für komplexe oder differenzierte Sicherheits bedenken, die von den vorherigen Ebenen möglicherweise nicht erfasst werden oder eine kontextbezogenere Bewertung erfordern.
  • DLP befasst sich speziell mit dem kritischen Risiko der Weitergabe sensibler Daten, falls das Modell Zugriff auf sensible Daten hat. Außerdem können Sie benutzerdefinierte Blockierlisten erstellen.
  • Content Credentials fügen Bildern, die mit dem Gemini 3 Pro Image-Modell generiert wurden, kryptografisch signierte C2PA-Metadaten hinzu. Diese geben an, dass die Bilder KI-generiert sind, und bieten eine überprüfbare Historie ihres Ursprungs.

Verfügbare Sicherheitstools in der Agent Platform für Gemini

Die Agent Platform bietet mehrere Tools zum Verwalten der Sicherheit Ihrer Gemini-Modelle. Wenn Sie wissen, wie die einzelnen Tools funktionieren, welche Überlegungen zu berücksichtigen sind und welche idealen Anwendungsfälle es gibt, können Sie eine maßgeschneiderte Sicherheitslösung entwickeln.

Ansatz Funktionsweise Bereitgestellter Schutz Risiken Geeignet für
Standardeinstellungen: Gemini + nicht konfigurierbare Filter Gemini-Modelle sind von Natur aus auf Sicherheit und Fairness ausgelegt, auch bei bösartigen Prompts. Google hat in umfassende Sicherheits Bewertungen investiert, einschließlich Bias und Toxizität. Die Standardeinstellungen umfassen eine unabhängige Schutzebene, die die Generierung von Inhalten im Zusammenhang mit Darstellungen des sexuellen Missbrauchs von Kindern oder urheberrechtlich geschützten Inhalten verhindern soll. Basisschutz gegen Darstellungen des sexuellen Missbrauchs von Kindern und Urheberrechtsverletzungen Die Standardsicherheit von Gemini entspricht möglicherweise nicht den Anforderungen Ihrer Organisation. Das Modell kann halluzinieren oder Anweisungen nicht befolgen. Motivierte Angreifer können möglicherweise trotzdem Jailbreaks und Prompt Injection durchführen. Workflows, bei denen keine böswilligen Eingaben erwartet werden
Konfigurierbare Filter Die vorgefertigten Inhaltsfilter von Gemini bieten zusätzlichen Schutz vor verschiedenen Kategorien schädlicher Inhalte, z. B. sexuellen, hasserfüllten, belästigenden oder gefährlichen Inhalten. Sie können Blockierschwellenwerte für jede Kategorie von Schäden konfigurieren (z.B. BLOCK_LOW_AND_ABOVE, BLOCK_MEDIUM_AND_ABOVE, BLOCK_ONLY_HIGH) basierend auf der Wahrscheinlichkeit und/oder dem Schweregrad der schädlichen Inhalte. Diese sind unabhängig vom Modell und daher robust gegen Jailbreaks. Robust gegen Verstöße für vordefinierte Kategorien, anpassbare Sensibilität Keine detaillierte Anpassung über die Schwellenwerteinstellungen für vordefinierte Kategorien hinaus möglich. Kann gelegentlich gutartige Inhalte blockieren (falsch positive Ergebnisse) oder einige schädliche Inhalte übersehen (falsch negative Ergebnisse). Nur für die Antwortfilterung verfügbar, nicht für die Prompt filterung. Bietet ein grundlegendes Sicherheitsniveau für nutzerorientierte Anwendungen oder Agenten. Wenn Sie die Inhalts- und Markensicherheit gewährleisten möchten, sollten Inhaltsfilter mit Systemanweisungen kombiniert werden.
Systemanweisungen Sie können dem Modell Ihre Richtlinien zur Marken- und Inhaltssicherheit über Systemanweisungen oder Präambeln mitteilen. Sie können dem Modell beispielsweise mitteilen, dass es keine Fragen zu politischen Themen beantworten soll oder dass es sich an bestimmte Richtlinien für die Markenstimme und den Ton halten soll. Systemanweisungen steuern das Verhalten des Modells direkt. Anpassbar für Inhalts- und Markensicherheit, kann sehr effektiv sein. Das Modell kann halluzinieren oder Anweisungen nicht befolgen. Motivierte Angreifer können möglicherweise trotzdem Jailbreaks und Prompt Injection durchführen. Anwendungen oder Agenten, die bestimmte Markenrichtlinien oder differenzierte Inhaltsrichtlinien einhalten müssen. Wenn Sie die Inhalts- und Markensicherheit gewährleisten möchten, sollten System anweisungen mit Inhaltsfiltern kombiniert werden.
DLP für benutzerdefinierte Blockierlisten und Schutz sensibler Daten Die DLP API kann Text prüfen, um sensible Informationen anhand einer Vielzahl vordefinierter und benutzerdefinierter InfoType-Detektoren zu identifizieren und zu klassifizieren. Nach der Identifizierung können De-Identifikationstechniken wie Entfernen, Maskieren oder Tokenisierung angewendet werden. Die DLP API kann auch zum Blockieren Keywords verwendet werden. Eingabeschutz: Bevor Sie Nutzerprompts oder ‑daten an Gemini senden, können Sie den Text über die DLP API senden, um sensible Informationen zu entfernen oder zu maskieren. So wird verhindert, dass sensible Daten vom Modell verarbeitet oder protokolliert werden. Ausgabeschutz: Wenn das Risiko besteht, dass Gemini versehentlich sensible Informationen generiert oder preisgibt (z.B. wenn es Quelldokumente zusammenfasst, die personenidentifizierbare Informationen enthalten), kann die Ausgabe des Modells von der DLP API gescannt werden, bevor sie an den Nutzer gesendet wird. Robuste Filterung für Obszönitäten oder benutzerdefinierte Wörter. Robuste Filterung für sensible Daten. Erhöht die Latenz. Kann zu Überblockierung führen. Schutz vor Datenverlust für Agenten, die Zugriff auf sensible Daten haben.
Gemini als Filter Sie können Gemini verwenden, um Prompts und Antworten für Ihren Agenten oder Ihre Anwendung zu filtern. Dazu ist ein zweiter Aufruf eines schnellen und kostengünstigen Gemini-Modells (z. B. Gemini Flash oder Flash Lite) erforderlich, um zu bewerten, ob die Eingabe eines Nutzers oder Tools oder die Ausgabe Ihres primären Gemini-Modells sicher ist. Das Filtermodell erhält Anweisungen, um zu entscheiden, ob die Inhalte sicher sind oder nicht, basierend auf Ihren definierten Richtlinien, einschließlich Inhalts- und Markensicherheit sowie Abweichungen des Agenten. Dies bietet einen robusten und hochgradig anpassbaren Schutz vor Verstößen gegen die Inhaltssicherheit, Problemen mit der Markensicherheit, Modellabweichungen und Halluzinationen und kann Texte, Bilder, Videos und Audioinhalte analysieren, um ein umfassendes Verständnis zu erhalten. Sehr robust und anpassbar für Inhalts- und Markensicherheit, Abweichungen, Halluzinationen; multimodales Verständnis. Zusätzliche Kosten und Latenz. Extrem geringe Wahrscheinlichkeit falsch negativer Ergebnisse. Bietet ein benutzerdefiniertes Sicherheitsniveau für nutzerorientierte Anwendungen oder Agenten.
Kombinierter Ansatz: Konfigurierbare Filter + Systemanweisungen + DLP + Gemini als Filter Sehr robust und anpassbar für Inhalts- und Markensicherheit, Abweichungen, Halluzinationen; multimodales Verständnis. Zusätzliche Kosten und Latenz. Bietet ein robustes Sicherheitsniveau für nutzerorientierte Anwendungen oder Agenten, insbesondere wenn böswillige Nutzung erwartet wird.
C2PA Content Credentials Bei unterstützten Modellen fügt die Gemini Enterprise Agent Platform generierten Bildern automatisch kryptografisch signierte Content Credentials hinzu. Diese geben an, dass die Bilder KI-generiert sind, und bieten eine überprüfbare Historie ihres Ursprungs gemäß dem C2PA Standard. Weitere Informationen finden Sie unter Content Credentials. Transparenz über den Ursprung von Inhalten; hilft Nutzern, KI-generierte Bilder zu identifizieren. Die Verwendung nicht konformer Tools kann die Authentizität von Dateien beeinträchtigen; garantiert nicht die Vertrauenswürdigkeit der Medienquelle. Anwendungsfälle für die Mediengenerierung, bei denen Transparenz über den Ursprung und die Historie der Datei für das Vertrauen der Nutzer wichtig ist.

Kontinuierliche Sicherheitsbewertung

Eine kontinuierliche Sicherheitsbewertung ist für KI-Systeme entscheidend. Die KI-Landschaft und die Methoden des Missbrauchs entwickeln sich ständig weiter, was diese Bewertungen unerlässlich macht.

Regelmäßige Bewertungen bieten mehrere wichtige Vorteile. Sie helfen Ihnen, Sicherheitslücken zu identifizieren, die Wirksamkeit von Maßnahmen zur Risikominimierung zu bewerten, sich an sich entwickelnde Risiken anzupassen, die Übereinstimmung mit Richtlinien und Werten sicherzustellen, Vertrauen aufzubauen und die Compliance aufrechtzuerhalten.

Um diese Vorteile zu nutzen, können Sie verschiedene Arten von Bewertungen durchführen:

  • Bewertungen während der Entwicklung
  • Bewertungen zur Qualitätssicherung
  • Red Teaming
  • Externe Bewertungen
  • Benchmark-Tests

Der Umfang Ihrer Bewertung sollte mehrere kritische Bereiche abdecken:

  • Inhaltssicherheit
  • Markensicherheit
  • Relevanz
  • Bias und Fairness
  • Wahrheit
  • Robustheit gegen bösartige Angriffe

Tools wie der Gen AI Evaluation Service der Agent Platform können Sie dabei unterstützen. Denken Sie daran, dass iterative Verbesserungen auf der Grundlage der Bewertungsergebnisse für eine verantwortungsbewusste KI-Entwicklung unerlässlich sind.

Nächste Schritte

Übersicht

Hier finden Sie eine Übersicht darüber, wie Sicherheitsadministratoren Richtlinien definieren, anwenden und verwalten können, die die Interaktionen von Agenten regeln.

Leitfaden

Informationen zu Sicherheitskontrollen für die Google Agent Platform.

Leitfaden

Einen einfachen Agenten erstellen und bereitstellen und den Agenten mit dem Gen AI Evaluation Service bewerten