Finanzdienstleistungen: Operative Exzellenz

Last reviewed 2025-07-28 UTC

Dieses Dokument in der Google Cloud Well-Architected Framework-Perspektive für Finanzdienstleistungen (Financial Services, FS) bietet eine Übersicht über die Prinzipien und Empfehlungen zum Erstellen, Bereitstellen und Betreiben robuster FS-Arbeitslasten in der Google Cloud. Diese Empfehlungen helfen Ihnen, grundlegende Elemente wie Beobachtbarkeit, Automatisierung und Skalierbarkeit einzurichten. Die Empfehlungen in diesem Dokument stimmen mit der Säule „Operative Exzellenz“ des Well-Architected Framework überein.

Operative Exzellenz ist für FS-Arbeitslasten in Google Cloud aufgrund der streng regulierten und sensiblen Natur solcher Arbeitslasten von entscheidender Bedeutung. Operative Exzellenz sorgt dafür, dass sich Cloud-Lösungen an sich ändernde Anforderungen anpassen und Ihre Anforderungen an Wert, Leistung, Sicherheit und Zuverlässigkeit erfüllen können. Fehler in diesen Bereichen können zu erheblichen finanziellen Verlusten, behördlichen Strafen und Reputationsschäden führen.

Operative Exzellenz bietet folgende Vorteile für FS-Arbeitslasten:

  • Vertrauen und Reputation bewahren: Finanzinstitute sind stark auf das Vertrauen ihrer Kunden angewiesen. Betriebsstörungen oder Sicherheitsverstöße können dieses Vertrauen erheblich untergraben und zu Kundenverlusten führen. Operative Exzellenz hilft, diese Risiken zu minimieren.
  • Strenge Einhaltung regulatorischer Anforderungen erfüllen: Finanzdienstleistungen unterliegen zahlreichen und komplexen Vorschriften, z. B.:

    Robuste Betriebsprozesse, Monitoring und Vorfallmanagement sind unerlässlich, um die Einhaltung von Vorschriften nachzuweisen und Strafen zu vermeiden.

  • Geschäftskontinuität und Resilienz gewährleisten: Finanzmärkte und ‑dienstleistungen sind oft rund um die Uhr in Betrieb. Daher sind Hochverfügbarkeit und effektive Notfallwiederherstellung von größter Bedeutung. Die Prinzipien der operativen Exzellenz leiten das Design und die Implementierung robuster Systeme. Weitere Informationen finden Sie in der Säule „Zuverlässigkeit“.

  • Sensible Daten schützen: Finanzinstitute verarbeiten große Mengen hochsensibler Kunden- und Finanzdaten. Strenge Betriebskontrollen, Sicherheitsmonitoring und schnelle Incident Response sind entscheidend, um Datenlecks zu verhindern und den Datenschutz zu wahren. Weitere Informationen finden Sie in der Säule „Sicherheit“.

  • Leistung für kritische Anwendungen optimieren: Viele Finanz anwendungen wie Handelsplattformen und Echtzeitanalysen erfordern hohe Leistung und niedrige Latenz. Um diese Leistungsanforderungen zu erfüllen, benötigen Sie ein hochoptimiertes Design für Computing, Netzwerk und Speicher. Weitere Informationen finden Sie in der Säule „Leistungsoptimierung“.

  • Kosten effektiv verwalten: Neben Sicherheit und Zuverlässigkeit ist für Finanzinstitute auch die Kosteneffizienz wichtig. Operative Exzellenz umfasst Praktiken zur Optimierung der Ressourcennutzung und zur Verwaltung der Cloud-Ausgaben. Weitere Informationen finden Sie in der Säule „ Kostenoptimierung “.

Die Empfehlungen zur operativen Exzellenz in diesem Dokument sind den folgenden Kernprinzipien zugeordnet:

SLAs und entsprechende SLOs und SLIs definieren

In vielen FS-Organisationen wird die Verfügbarkeit von Anwendungen in der Regel anhand der Messwerte für das Recovery Time Objective (RTO) und das Recovery Point Objective (RPO) klassifiziert. Für geschäftskritische Anwendungen, die externe Kunden bedienen, kann auch ein Service Level Agreement (SLA) definiert werden.

SLAs benötigen ein Framework von Messwerten, das das Verhalten des Systems aus der Perspektive der Nutzerzufriedenheit darstellt. Mit den Praktiken des Site Reliability Engineering (SRE) können Sie das gewünschte Maß an Systemzuverlässigkeit erreichen. Beim Erstellen eines Frameworks von Messwerten werden wichtige numerische Indikatoren definiert und überwacht, um den Systemzustand aus Nutzersicht zu verstehen. Messwerte wie Latenz und Fehlerraten geben beispielsweise an, wie gut ein Dienst funktioniert. Diese Messwerte werden als Service Level Indicators (SLIs) bezeichnet. Die Entwicklung effektiver SLIs ist entscheidend, da sie die Rohdaten liefern, die für eine objektive Bewertung der Zuverlässigkeit erforderlich sind.

Beachten Sie die folgenden Empfehlungen, um aussagekräftige SLAs, SLIs und SLOs zu definieren:

  • Entwickeln und definieren Sie SLIs für jeden kritischen Dienst. Legen Sie Zielwerte fest, die die akzeptablen Leistungsniveaus definieren.
  • Entwickeln und definieren Sie die Service Level Objectives (SLOs), die den SLIs entsprechen. Ein SLO kann beispielsweise festlegen, dass 99,9% der Anfragen eine Latenz von weniger als 200 Millisekunden haben müssen.
  • Legen Sie die internen Abhilfemaßnahmen fest, die ergriffen werden müssen, wenn ein Dienst die SLOs nicht erfüllt. Um beispielsweise die Resilienz der Plattform zu verbessern, müssen Sie möglicherweise Entwicklungsressourcen für die Behebung von Problemen einsetzen.
  • Validieren Sie die SLA-Anforderung für jeden Dienst und erkennen Sie das SLA als formellen Vertrag mit den Dienstnutzern an.

Beispiele für Servicelevels

Die folgende Tabelle enthält Beispiele für SLIs, SLOs und SLAs für eine Zahlungsplattform:

Geschäftsmesswert SLI SLO SLA
Erfolgreiche Zahlungstransaktion

Ein quantitatives Maß für den Prozentsatz aller initiierten Zahlungstransaktionen, die erfolgreich verarbeitet und bestätigt wurden.

Beispiel: (Anzahl der erfolgreichen Transaktionen ÷ Gesamtzahl der gültigen Transaktionen) × 100, gemessen über ein gleitendes 5-Minuten-Fenster.

Ein internes Ziel, um einen hohen Prozentsatz erfolgreicher Zahlungstransaktionen über einen bestimmten Zeitraum aufrechtzuerhalten.

Beispiel: Eine Erfolgsrate von 99,98% für Zahlungstransaktionen über ein gleitendes 30-Tage-Fenster beibehalten, wobei ungültige Anfragen und geplante Wartungsarbeiten ausgeschlossen sind.

Eine vertragliche Garantie für die Erfolgsrate und Geschwindigkeit der Verarbeitung von Zahlungstransaktionen.

Beispiel: Der Dienstanbieter garantiert, dass 99,0 % der vom Kunden initiierten Zahlungstransaktionen innerhalb einer Sekunde erfolgreich verarbeitet und bestätigt werden.

Latenz bei der Zahlungsverarbeitung

Die durchschnittliche Zeit, die für die Verarbeitung einer Zahlungstransaktion von der Initiierung durch den Kunden bis zur endgültigen Bestätigung benötigt wird.

Beispiel: Durchschnittliche Antwortzeit in Millisekunden für die Transaktionsbestätigung, gemessen über ein gleitendes 5-Minuten-Fenster.

Ein internes Ziel für die Geschwindigkeit, mit der Zahlungstransaktionen verarbeitet werden.

Beispiel: Sicherstellen, dass 99,5% der Zahlungstransaktionen innerhalb von 400 Millisekunden über ein gleitendes 30-Tage-Fenster verarbeitet werden.

Eine vertragliche Verpflichtung, kritische Probleme bei der Zahlungsverarbeitung innerhalb eines bestimmten Zeitrahmens zu beheben.

Beispiel: Bei kritischen Problemen bei der Zahlungsverarbeitung (definiert als Ausfall, der mehr als 1% der Transaktionen betrifft), verpflichtet sich der Dienstanbieter zu einer Lösungszeit von zwei Stunden ab dem Zeitpunkt, an dem das Problem gemeldet oder erkannt wird.

Plattformverfügbarkeit

Der Prozentsatz der Zeit, in der die Kern-API für die Zahlungsverarbeitung und die Benutzeroberfläche betriebsbereit und für Kunden zugänglich sind.

Beispiel: (Gesamtbetriebszeit − Ausfallzeit) ÷ Gesamtbetriebszeit × 100, gemessen pro Minute.

Ein internes Ziel für die Betriebszeit der Kern-Zahlungsplattform.

Beispiel: Eine Plattformverfügbarkeit von 99,995% pro Kalendermonat erreichen, wobei geplante Wartungsfenster ausgeschlossen sind.

Eine formelle, rechtsverbindliche Verpflichtung gegenüber Kunden in Bezug auf die Mindestbetriebszeit der Zahlungsplattform, einschließlich der Folgen bei Nichterfüllung.

Beispiel: Die Plattform muss eine Verfügbarkeit von mindestens 99,9% pro Kalendermonat aufweisen, wobei geplante Wartungsfenster ausgeschlossen sind. Wenn die Verfügbarkeit unter das Mindestniveau fällt, erhält der Kunde eine Gutschrift in Höhe von 5% der monatlichen Servicegebühr für jeden Rückgang um 0,1 %.

Verwenden Sie SLI-Daten, um zu prüfen, ob die Systeme die definierten SLOs einhalten und die SLAs erfüllt werden. Mit einer Reihe genau definierter SLIs können Techniker und Entwickler FS-Anwendungen auf den folgenden Ebenen überwachen:

  • Direkt im Dienst, auf dem die Anwendungen bereitgestellt werden, z. B. GKE oder Cloud Run.
  • Mithilfe von Logs, die von Infrastrukturkomponenten wie dem Load Balancer bereitgestellt werden.

OpenTelemetry bietet einen Open-Source-Standard und eine Reihe von Technologien zum Erfassen aller Arten von Telemetriedaten, einschließlich Messwerten, Traces und Logs. Google Cloud Managed Service for Prometheus bietet ein vollständig verwaltetes, hochskalierbares Back-End für Messwerte und den Betrieb von Prometheus im großen Maßstab.

Weitere Informationen zu SLI, SLO und Fehlerbudgets finden Sie im SRE-Handbuch.

Verwenden Sie Google Cloud Observability tools zusammen mit Google Cloud Monitoring, um effektive Dashboards und Mechanismen für Benachrichtigungen und Monitoring zu entwickeln. Informationen zu sicherheitsspezifischen Monitoring- und Erkennungsfunktionen finden Sie in der Säule „Sicherheit“.

Prozesse für das Vorfallmanagement definieren und testen

Gut definierte und regelmäßig getestete Prozesse für das Vorfallmanagement tragen direkt zum Wert, zur Leistung, zur Sicherheit und zur Zuverlässigkeit der FS Arbeitslasten in derbei Google Cloud. Diese Prozesse helfen Finanzinstituten, ihre strengen behördlichen Anforderungen zu erfüllen, sensible Daten zu schützen, die Geschäftskontinuität aufrechtzuerhalten und das Vertrauen der Kunden zu wahren.

Regelmäßige Tests von Prozessen für das Vorfallmanagement bieten folgende Vorteile:

  • Leistung bei Spitzenlasten aufrechterhalten: Regelmäßige Leistungs- und Last tests helfen Finanzinstituten sicherzustellen, dass ihre cloudbasierten Anwendungen und Infrastruktur Spitzenlasten bei Transaktionen, Markt volatilität und andere Szenarien mit hoher Nachfrage ohne Leistungseinbußen bewältigen können. Diese Funktion ist entscheidend, um eine nahtlose Nutzererfahrung zu gewährleisten und die Anforderungen der Finanzmärkte zu erfüllen.
  • Potenzielle Engpässe und Einschränkungen erkennen: Bei Stresstests werden Systeme an ihre Grenzen gebracht. So können Finanzinstitute potenzielle Engpässe und Leistungseinschränkungen erkennen, bevor sie sich auf kritische Vorgänge auswirken. Dieser proaktive Ansatz ermöglicht es Finanzinstituten, ihre Infrastruktur und Anwendungen für optimale Leistung und Skalierbarkeit anzupassen.
  • Zuverlässigkeit und Resilienz validieren: Regelmäßige Tests, einschließlich Chaos Engineering oder simulierter Fehler, helfen, die Zuverlässigkeit und Resilienz von Finanzsystemen zu validieren. Diese Tests stellen sicher, dass sich die Systeme nach Fehlern ordnungsgemäß wiederherstellen und eine hohe Verfügbarkeit aufrechterhalten können, was für die Geschäftskontinuität unerlässlich ist.
  • Effektive Kapazitätsplanung durchführen: Leistungstests liefern wertvolle Daten zur Ressourcennutzung unter verschiedenen Lastbedingungen, was für eine genaue Kapazitätsplanung entscheidend ist. Finanzinstitute können diese Daten verwenden, um zukünftige Kapazitätsanforderungen proaktiv zu antizipieren und Leistungsprobleme aufgrund von Ressourcenbeschränkungen zu vermeiden.
  • Neue Funktionen und Codeänderungen erfolgreich bereitstellen: Durch die Integration automatisierter Tests in CI/CD-Pipelines wird sichergestellt, dass Änderungen und neue Bereitstellungen gründlich validiert werden, bevor sie in Produktionsumgebungen freigegeben werden. Dieser Ansatz reduziert das Risiko von Fehlern und Regressionen, die zu Betriebsstörungen führen könnten, erheblich.
  • Behördliche Anforderungen an die Systemstabilität erfüllen: Finanz vorschriften verlangen oft, dass Institute robuste Testverfahren einsetzen, um die Stabilität und Zuverlässigkeit ihrer kritischen Systeme zu gewährleisten. Regelmäßige Tests helfen, die Einhaltung dieser Anforderungen nachzuweisen.

Beachten Sie die folgenden Empfehlungen, um Ihre Prozesse für das Vorfallmanagement zu definieren und zu testen.

Klare Verfahren für die Incident Response festlegen

Ein gut etabliertes Set von Incident Response-Verfahren umfasst die folgenden Elemente:

  • Rollen und Verantwortlichkeiten, die für Incident Commander, Ermittler, Kommunikatoren und technische Experten definiert sind, um eine effektive und koordinierte Reaktion zu gewährleisten.
  • Kommunikationsprotokolle und Eskalationspfade, die definiert sind, um sicherzustellen, dass Informationen bei Vorfällen schnell und effektiv weitergegeben werden.
  • Verfahren, die in einem Runbook oder Playbook dokumentiert sind und die Schritte für Kommunikation, Triage, Untersuchung und Lösung beschreiben.
  • Regelmäßige Schulungen und Vorbereitung, die Teams das Wissen und die Fähigkeiten vermitteln, um effektiv zu reagieren.

Regelmäßige Leistungs- und Lasttests implementieren

Regelmäßige Leistungs- und Lasttests helfen sicherzustellen, dass cloudbasierte Anwendungen und Infrastruktur Spitzen lasten bewältigen und eine optimale Leistung aufrechterhalten können. Bei Lasttests werden realistische Trafficmuster simuliert. Bei Stresstests wird das System an seine Grenzen gebracht, um potenzielle Engpässe und Leistungseinschränkungen zu erkennen. Mit Produkten wie Cloud Load Balancing und Lasttestdiensten können Sie realen Traffic simulieren. Anhand der Testergebnisse können Sie Ihre Cloud-Infrastruktur und ‑Anwendungen für optimale Leistung und Skalierbarkeit anpassen. Sie können beispielsweise die Ressourcenzuweisung anpassen oder Anwendungskonfigurationen optimieren.

Tests in CI/CD-Pipelines automatisieren

Durch die Einbindung automatisierter Tests in Ihre CI/CD-Pipelines können Sie die Qualität und Zuverlässigkeit von Cloud-Anwendungen sicherstellen, indem Sie Änderungen vor der Bereitstellung validieren. Dieser Ansatz reduziert das Risiko von Fehlern und Regressionen erheblich und hilft Ihnen, ein stabileres und robusteres Softwaresystem zu entwickeln. Sie können verschiedene Arten von Tests in Ihre CI/CD-Pipelines einbinden, darunter Unit-Tests, Integrationstests und End-to-End-Tests. Verwenden Sie Produkte wie Cloud Build und Cloud Deploy um Ihre CI/CD-Pipelines zu erstellen und zu verwalten.

Kontinuierliche Verbesserung und Innovation

Für Arbeitslasten für Finanzdienstleistungen in der Cloud ist die Migration in die Cloud nur der erste Schritt. Kontinuierliche Verbesserung und Innovation sind aus folgenden Gründen unerlässlich:

  • Innovation beschleunigen: Nutzen Sie neue Technologien wie KI um Ihre Dienste zu verbessern.
  • Kosten senken: Beseitigen Sie Ineffizienzen und optimieren Sie die Ressourcennutzung.
  • Agilität verbessern: Passen Sie sich schnell an Markt- und regulatorische Änderungen an.
  • Entscheidungsfindung verbessern: Verwenden Sie Datenanalyseprodukte wie BigQuery und Looker, um fundierte Entscheidungen zu treffen.

Beachten Sie die folgenden Empfehlungen, um kontinuierliche Verbesserung und Innovation zu gewährleisten.

Regelmäßige Retrospektiven durchführen

Retrospektiven sind unerlässlich, um die Verfahren für die Incident Response kontinuierlich zu verbessern und Teststrategien auf der Grundlage der Ergebnisse regelmäßiger Leistungs- und Lasttests zu optimieren. So sorgen Sie dafür, dass Retrospektiven effektiv sind:

  • Geben Sie Teams die Möglichkeit, über ihre Erfahrungen nachzudenken, zu ermitteln, was gut gelaufen ist, und Bereiche für Verbesserungen zu identifizieren.
  • Führen Sie Retrospektiven nach Projektmeilensteinen, größeren Vorfällen oder wichtigen Testzyklen durch. Teams können aus Erfolgen und Misserfolgen lernen und ihre Prozesse und Praktiken kontinuierlich verbessern.
  • Verwenden Sie einen strukturierten Ansatz wie das Start-Stop-Continue Modell, um sicherzustellen, dass die Retrospektivensitzungen produktiv sind und zu umsetzbaren Schritten führen.
  • Verwenden Sie Retrospektiven, um Bereiche zu identifizieren, in denen die Automatisierung des Änderungsmanagements weiter verbessert werden kann, um die Zuverlässigkeit zu erhöhen und Risiken zu reduzieren.

Lernkultur fördern

Eine Lernkultur ermöglicht die sichere Erkundung neuer Technologien in Google Cloud, z. B. KI- und ML-Funktionen zur Verbesserung von Diensten wie Betrug erkennung und personalisierter Finanzberatung. So fördern Sie eine Lernkultur:

  • Ermutigen Sie Teams, zu experimentieren, Wissen zu teilen und kontinuierlich zu lernen.
  • Führen Sie eine Kultur der Schuldlosigkeit ein, in der Fehler als Chancen für Wachstum und Verbesserung betrachtet werden.
  • Schaffen Sie eine psychologisch sichere Umgebung, in der Teams Risiken eingehen und innovative Lösungen in Betracht ziehen können. Teams lernen aus Erfolgen und Misserfolgen, was zu einer resilienteren und anpassungsfähigeren Organisation führt.
  • Entwickeln Sie eine Kultur, die den Austausch von Wissen fördert, das aus Prozessen für das Vorfallmanagement und Testübungen gewonnen wurde.

Über Cloud-Technologien auf dem Laufenden bleiben

Kontinuierliches Lernen ist unerlässlich, um neue Sicherheitsmaßnahmen zu verstehen und zu implementieren, erweiterte Datenanalysen für bessere Erkenntnisse zu nutzen und innovative Lösungen einzuführen, die für Finanzdienstleistungen relevant sind.

  • Maximieren Sie das Potenzial der Google Cloud Dienste, indem Sie sich über die neuesten Fortschritte, Funktionen und Best Practices informieren.
  • Wenn neue Google Cloud Funktionen und ‑Dienste eingeführt werden, ermitteln Sie Möglichkeiten, Prozesse weiter zu automatisieren, die Sicherheit zu erhöhen und die Leistung und Skalierbarkeit Ihrer Anwendungen zu verbessern.
  • Nehmen Sie an relevanten Konferenzen, Webinaren und Schulungen teil, um Ihr Wissen zu erweitern und neue Funktionen zu verstehen.
  • Ermutigen Sie Teammitglieder, Google Cloud Zertifizierungen zu erwerben, um sicherzustellen, dass die Organisation über die erforderlichen Fähigkeiten für den Erfolg in der Cloud verfügt.