Standardmäßig optimiert Cloud Run die Leistung mit einem Auslastungsziel von 60% für CPU und Nebenläufigkeit und skaliert die Anzahl der Instanzen automatisch, um alle eingehenden Anfragen zu verarbeiten. Für einige Anwendungsfälle möchten Sie jedoch möglicherweise konfigurieren, welche Skalierungsfaktoren verwendet werden sollen, z. B. nur die CPU, und benutzerdefinierte Ziele für die Auslastung festlegen.
Cloud Run bietet Skalierungssteuerungen, mit denen Sie mehr Kontrolle über das Skalierungsverhalten Ihres Dienstes haben. So können Sie fundierte Entscheidungen zur Skalierung Ihrer Arbeitslast entsprechend Ihren Anforderungen treffen. Sie können die folgenden benutzerdefinierten Auslastungsziele konfigurieren:
- Zielauslastung für die CPU-basierte Skalierung
- Zielauslastung für die nebenläufigkeitsbasierte Skalierung
Mit Skalierungssteuerungen können Sie die Kosten optimieren und die Vorhersagbarkeit Ihrer Dienste verbessern. Weitere Informationen zum Standardverhalten beim Autoscaling von Cloud Run-Diensten finden Sie unter Instanz-Autoscaling in Cloud Run-Diensten.
Konfigurationsbeschränkungen
Für benutzerdefinierte Skalierungsziele gelten die folgenden Limits:
| Skalierungsfaktor | Standardeinstellung % | Minimal konfigurierbarer Prozentsatz | Maximal konfigurierbarer Prozentsatz |
|---|---|---|---|
CPU target utilization |
60 % | 10 % | 90 % |
Concurrency target utilization |
60 % | 10 % | 95 % |
Benutzerdefinierte Ziele konfigurieren
Sie können benutzerdefinierte Auslastungsziele definieren, um die Kosten zu optimieren oder die Leistung Ihrer Arbeitslasten zu verbessern. Dazu konfigurieren Sie bestimmte CPU- und Parallelitätsauslastungsziele innerhalb der Konfigurationslimits.
Jede Konfigurationsänderung führt zur Erstellung einer neuen Überarbeitung. Für nachfolgende Überarbeitungen gilt automatisch dieselbe Konfigurationseinstellung, sofern Sie sie nicht explizit aktualisieren.
Auch wenn Sie benutzerdefinierte Ziele für die Anzahl gleichzeitiger Nutzer konfigurieren oder die CPU-basierte Skalierung deaktivieren, bleibt die adaptive Optimierung der Anzahl gleichzeitiger Nutzer (Adaptive Concurrency Tuning, ACT) aktiv. Weitere Informationen finden Sie unter Autoscaling von Instanzen.
Sie können die Skalierungssteuerung über die Google Cloud Console, die gcloud CLI, YAML oder Terraform konfigurieren, wenn Sie eine neue Überarbeitung bereitstellen.
Console
Rufen Sie in der Google Cloud Console die Seite Cloud Run-Dienste auf:
Wenn Sie einen neuen Dienst konfigurieren, klicken Sie auf Container bereitstellen, um die Seite Dienst erstellen aufzurufen.
Wenn Sie einen vorhandenen Dienst konfigurieren, klicken Sie auf den Dienst, um die Seite Dienstdetails zu öffnen, und klicken Sie dann auf den Tab Skalierung.
Suchen Sie nach dem Abschnitt Dienstskalierung. Achten Sie darauf, dass Autoscaling ausgewählt ist. Maximieren Sie den Bereich Autoscaling-Faktoren anpassen, um die folgenden Nutzungsziele zu konfigurieren:
Wenn Sie die CPU-Zielauslastung konfigurieren möchten, klicken Sie auf CPU-Auslastung und geben Sie einen Wert zwischen
10und90ein.Wenn Sie die Zielauslastung gleichzeitiger Anfragen konfigurieren möchten, klicken Sie auf Auslastung gleichzeitiger Anfragen und geben Sie einen Wert zwischen
10und95ein.Klicken Sie unter jeder Konfiguration für die Auslastung auf Fertig.
Klicken Sie für einen neuen Dienst auf Erstellen. Klicken Sie für einen vorhandenen Dienst auf Unterschied ansehen und erneut bereitstellen und dann auf Änderungen bereitstellen.
gcloud
Aktualisieren Sie die Werte für die CPU-Zielauslastung und die Zielauslastung für Nebenläufigkeit einer bestimmten Version, indem Sie den Befehl gcloud run services update ausführen.
Führen Sie den folgenden Befehl aus, um die Ziel-CPU-Auslastung zu aktualisieren:
gcloud run services update SERVICE --scaling-cpu-target=CPU_TARGET
Ersetzen Sie Folgendes:
SERVICE: der Name Ihres Dienstes.
CPU_TARGET: das Ziel für die CPU-Auslastung. Geben Sie einen Wert zwischen
0.1und0.90an. Sie können maximal zwei Ziffern nach dem Dezimalkomma konfigurieren.
Führen Sie den folgenden Befehl aus, um die Zielauslastung für die Nebenläufigkeit zu aktualisieren:
gcloud run services update SERVICE --scaling-concurrency-target=CONCURRENCY_TARGET
Ersetzen Sie Folgendes:
SERVICE: der Name Ihres Dienstes.
CONCURRENCY_TARGET: Das Ziel für die Nutzung der Nebenläufigkeit. Geben Sie einen Wert zwischen „0,1“ und „0,95“ an. Sie können nur bis zu zwei Ziffern nach dem Dezimalkomma konfigurieren.
Führen Sie den folgenden Befehl aus, um sowohl die Ziel-CPU als auch die Gleichzeitigkeitsauslastung zu aktualisieren:
gcloud run services update SERVICE --scaling-cpu-target=CPU_TARGET \ --scaling-concurrency-target=CONCURRENCY_TARGET
Ersetzen Sie Folgendes:
- SERVICE: der Name Ihres Dienstes.
- CPU_TARGET: das Ziel für die CPU-Auslastung. Geben Sie einen Wert zwischen
0.1und0.90an. Sie können maximal zwei Ziffern nach dem Dezimalkomma konfigurieren. - CONCURRENCY_TARGET: Das Ziel für die Nutzung der Nebenläufigkeit. Geben Sie einen Wert zwischen „0,1“ und „0,95“ an. Sie können nur bis zu zwei Ziffern nach dem Dezimalkomma konfigurieren.
YAML
Wenn Sie einen neuen Dienst erstellen, überspringen Sie diesen Schritt. Wenn Sie einen vorhandenen Dienst aktualisieren, laden Sie die zugehörige YAML-Konfiguration herunter:
gcloud run services describe SERVICE --format export > service.yaml
Fügen Sie die Attribute
run.googleapis.com/scaling-cpu-targetundrun.googleapis.com/scaling-concurrency-targethinzu, um die CPU-Zielauslastung und die Zielauslastung der Nebenläufigkeit zu aktualisieren:apiVersion: serving.knative.dev/v1 kind: Service metadata: name: SERVICE spec: template: metadata: annotations: run.googleapis.com/scaling-cpu-target: 'CPU_TARGET' run.googleapis.com/scaling-concurrency-target: 'CONCURRENCY_TARGET'
Ersetzen Sie Folgendes:
- SERVICE: der Name Ihres Dienstes.
- CPU_TARGET: das Ziel für die CPU-Auslastung. Geben Sie einen Wert zwischen
0.1und0.90an. Sie können maximal zwei Ziffern nach dem Dezimalkomma konfigurieren. - CONCURRENCY_TARGET: Das Ziel für die Nutzung der Nebenläufigkeit. Geben Sie einen Wert zwischen „0,1“ und „0,95“ an. Sie können nur bis zu zwei Ziffern nach dem Dezimalkomma konfigurieren.
Erstellen oder aktualisieren Sie den Dienst mit dem folgenden Befehl:
gcloud run services replace service.yaml
Standardmäßig wird mit dem Befehl
gcloud run services replacedie Dateiservice.yamlverwendet, sofern sie vorhanden ist.
Terraform
Informationen zum Anwenden oder Entfernen einer Terraform-Konfiguration finden Sie unter Grundlegende Terraform-Befehle.
Fügen Sie der Ressourcegoogle_cloud_run_v2_service in Ihrer Terraform-Konfiguration Folgendes hinzu:resource "google_cloud_run_v2_service" "default" {
name = "SERVICE"
location = "REGION"
template {
scaling {
cpu_utilization = CPU_TARGET
concurrency_utilization = CONCURRENCY_TARGET
}
containers {
image = "IMAGE_URL"
}
}
}
Ersetzen Sie Folgendes:
- SERVICE: der Name Ihres Dienstes.
- REGION: die Google Cloud Region, z. B.
europe-west1. - CPU_TARGET: das Ziel für die CPU-Auslastung. Geben Sie einen Wert zwischen
0.1und0.90an. Sie können maximal zwei Ziffern nach dem Dezimalkomma konfigurieren. - CONCURRENCY_TARGET: Das Ziel für die Nutzung der Nebenläufigkeit. Geben Sie einen Wert zwischen „0,1“ und „0,95“ an. Sie können nur bis zu zwei Ziffern nach dem Dezimalkomma konfigurieren.
IMAGE_URL: ein Verweis auf das Container-Image, z. B.us-docker.pkg.dev/cloudrun/container/hello:latestWenn Sie Artifact Registry verwenden, muss das Repository REPO_NAME bereits erstellt sein. Die URL hat das FormatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.
Skalierungssteuerelemente deaktivieren
Sie können entweder Ziele für die CPU-Auslastung oder für die Auslastung durch Parallelität deaktivieren, aber nicht beide. Es muss immer ein Skalierungsfaktor aktiv sein. Wenn Sie die Skalierungssteuerung deaktivieren möchten, stellen Sie stattdessen die Standardwerte für die Auslastung wieder her. Wenn Sie einen Skalierungstreiber deaktivieren, ignoriert Cloud Run diesen Messwert bei Skalierungsentscheidungen.
Sie können die Skalierungssteuerung über die Google Cloud Console, die gcloud CLI, YAML oder Terraform deaktivieren, wenn Sie eine neue Überarbeitung bereitstellen.
Console
Rufen Sie in der Google Cloud Console die Seite Cloud Run-Dienste auf:
Klicken Sie auf den Dienst, um die Seite Dienstdetails zu öffnen, und klicken Sie dann auf den Tab Skalierung.
Suchen Sie nach dem Abschnitt Dienstskalierung. Achten Sie darauf, dass Autoscaling ausgewählt ist. Maximieren Sie den Bereich Autoscaling-Faktoren anpassen:
Wenn Sie nur nach CPU skalieren möchten, klicken Sie neben Auslastung durch gleichzeitige Anfragen auf das Löschsymbol und geben Sie einen Wert für die Ziel-CPU-Auslastung ein, falls er fehlt.
Wenn Sie nur nach Nebenläufigkeit skalieren möchten, klicken Sie neben CPU-Auslastung auf das Löschsymbol und geben Sie einen Wert für die Zielauslastung bei Nebenläufigkeit ein, falls er fehlt.
Klicken Sie unter jeder Konfiguration für die Auslastung auf Fertig.
Klicken Sie für einen neuen Dienst auf Erstellen. Klicken Sie für einen vorhandenen Dienst auf Unterschied ansehen und erneut bereitstellen und dann auf Änderungen bereitstellen.
gcloud
Sie können entweder die CPU-Zielauslastung oder die Zielauslastung für Parallelität deaktivieren, indem Sie den Befehl gcloud run services update ausführen.
Wenn Sie nur nach CPU skalieren möchten, deaktivieren Sie das Ziel für die Parallelität mit dem folgenden Befehl:
gcloud run services update SERVICE --scaling-concurrency-target=disabled
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Wenn Sie nur nach Parallelität skalieren möchten, deaktivieren Sie das CPU-Ziel mit dem folgenden Befehl:
gcloud run services update SERVICE --scaling-cpu-target=disabled
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
YAML
Wenn Sie einen neuen Dienst erstellen, überspringen Sie diesen Schritt. Wenn Sie einen vorhandenen Dienst aktualisieren, laden Sie die zugehörige YAML-Konfiguration herunter:
gcloud run services describe SERVICE --format export > service.yaml
Wenn Sie nur nach CPU skalieren möchten, deaktivieren Sie das Gleichzeitigkeitsziel, indem Sie das Attribut
run.googleapis.com/scaling-concurrency-targetaufdisabledfestlegen:apiVersion: serving.knative.dev/v1 kind: Service metadata: name: SERVICE spec: template: metadata: annotations: run.googleapis.com/scaling-concurrency-target: disabled
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Wenn Sie nur nach Nebenläufigkeit skalieren möchten, deaktivieren Sie das CPU-Ziel, indem Sie das Attribut
run.googleapis.com/scaling-cpu-targetaufdisabledfestlegen:apiVersion: serving.knative.dev/v1 kind: Service metadata: name: SERVICE spec: template: metadata: annotations: run.googleapis.com/scaling-cpu-target: disabled
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Erstellen oder aktualisieren Sie den Dienst mit dem folgenden Befehl:
gcloud run services replace service.yaml
Standardmäßig wird mit dem Befehl
gcloud run services replacedie Dateiservice.yamlverwendet, sofern sie vorhanden ist.
Terraform
Informationen zum Anwenden oder Entfernen einer Terraform-Konfiguration finden Sie unter Grundlegende Terraform-Befehle.
Fügen Sie der Ressourcegoogle_cloud_run_v2_service in Ihrer Terraform-Konfiguration Folgendes hinzu:Wenn Sie nur nach CPU skalieren möchten, deaktivieren Sie das Gleichzeitigkeitsziel, indem Sie
concurrency_utilizationauf0festlegen:resource "google_cloud_run_v2_service" "default" { name = "SERVICE" location = "REGION" template { scaling { cpu_utilization = CPU_TARGET concurrency_utilization = 0 } containers { image = "IMAGE_URL" } } }Ersetzen Sie Folgendes:
- SERVICE: der Name Ihres Dienstes.
- REGION: die Google Cloud Region, z. B.
europe-west1. - CPU_TARGET: das Ziel für die CPU-Auslastung. Geben Sie einen Wert zwischen
0.1und0.90an. Sie können maximal zwei Ziffern nach dem Dezimalkomma konfigurieren. IMAGE_URL: ein Verweis auf das Container-Image, z. B.us-docker.pkg.dev/cloudrun/container/hello:latestWenn Sie Artifact Registry verwenden, muss das Repository REPO_NAME bereits erstellt sein. Die URL hat das FormatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.
Wenn Sie nur nach Nebenläufigkeit skalieren möchten, deaktivieren Sie das CPU-Ziel, indem Sie
cpu_utilizationauf0festlegen:resource "google_cloud_run_v2_service" "default" { name = "SERVICE" location = "REGION" template { scaling { cpu_utilization = 0 concurrency_utilization = CONCURRENCY_TARGET } containers { image = "IMAGE_URL" } } }Ersetzen Sie Folgendes:
- SERVICE: der Name Ihres Dienstes.
- REGION: die Google Cloud Region, z. B.
europe-west1. - CONCURRENCY_TARGET: Das Ziel für die Nutzung der Nebenläufigkeit. Geben Sie einen Wert zwischen „0,1“ und „0,95“ an. Sie können nur bis zu zwei Ziffern nach dem Dezimalkomma konfigurieren.
IMAGE_URL: ein Verweis auf das Container-Image, z. B.us-docker.pkg.dev/cloudrun/container/hello:latestWenn Sie Artifact Registry verwenden, muss das Repository REPO_NAME bereits erstellt sein. Die URL hat das FormatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.
Auf Standardwerte zurücksetzen
Wenn Sie die Werte für die Ziel-CPU- oder die Ziel-Concurrency-Auslastung auf die Standardwerte zurücksetzen, verwendet Cloud Run anstelle Ihrer benutzerdefinierten Ziele das Standardziel für die Auslastung von 60 %. Sie können die Skalierungssteuerung über die Google Cloud Console, die gcloud CLI, YAML oder Terraform auf die Standardeinstellungen zurücksetzen, wenn Sie eine neue Überarbeitung bereitstellen.
Console
Rufen Sie in der Google Cloud Console die Seite Cloud Run-Dienste auf:
Klicken Sie auf den Dienst, um die Seite Dienstdetails zu öffnen, und klicken Sie dann auf den Tab Skalierung.
Suchen Sie nach dem Abschnitt Dienstskalierung. Achten Sie darauf, dass Autoscaling ausgewählt ist. Maximieren Sie den Bereich Autoscaling-Faktoren anpassen, um die folgenden Nutzungsziele zu konfigurieren:
Wenn die Zielvorhaben für CPU-Auslastung und Auslastung gleichzeitiger Anfragen entfernt wurden, klicken Sie auf Signal hinzufügen, um sie wieder hinzuzufügen.
Legen Sie die Werte für CPU-Auslastung und Auslastung gleichzeitiger Anfragen auf
60fest.Klicken Sie unter jeder Konfiguration für die Auslastung auf Fertig.
Klicken Sie für einen neuen Dienst auf Erstellen. Klicken Sie für einen vorhandenen Dienst auf Unterschied ansehen und erneut bereitstellen und dann auf Änderungen bereitstellen.
gcloud
Stellen Sie die CPU-Zielauslastung und die Zielauslastung der Nebenläufigkeit auf die Standardwerte zurück, indem Sie den Befehl gcloud run services update ausführen.
Führen Sie den folgenden Befehl aus, um die Ziel-CPU-Auslastung auf den Standardwert zurückzusetzen:
gcloud run services update SERVICE --scaling-cpu-target=default
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Führen Sie den folgenden Befehl aus, um die Auslastung des Gleichzeitigkeitsziels auf den Standardwert zurückzusetzen:
gcloud run services update SERVICE --scaling-concurrency-target=default
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Führen Sie den folgenden Befehl aus, um sowohl die Ziel-CPU-Auslastung als auch die Ziel-Nebenläufigkeit auf ihre Standardwerte zurückzusetzen:
gcloud run services update SERVICE --scaling-cpu-target=default \ --scaling-concurrency-target=default
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
YAML
Wenn Sie einen neuen Dienst erstellen, überspringen Sie diesen Schritt. Wenn Sie einen vorhandenen Dienst aktualisieren, laden Sie die zugehörige YAML-Konfiguration herunter:
gcloud run services describe SERVICE --format export > service.yaml
Wenn Sie die CPU- und Parallelitätsauslastung auf die Standardziele zurücksetzen möchten, entfernen Sie die Attribute
run.googleapis.com/scaling-cpu-targetundrun.googleapis.com/scaling-concurrency-targetaus Ihrer YAML-Datei:apiVersion: serving.knative.dev/v1 kind: Service metadata: name: SERVICE spec: template: metadata: # Remove the scaling target annotations to restore defaults ...
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Erstellen oder aktualisieren Sie den Dienst mit dem folgenden Befehl:
gcloud run services replace service.yaml
Standardmäßig wird mit dem Befehl
gcloud run services replacedie Dateiservice.yamlverwendet, sofern sie vorhanden ist.
Terraform
Informationen zum Anwenden oder Entfernen einer Terraform-Konfiguration finden Sie unter Grundlegende Terraform-Befehle.
Fügen Sie der Ressourcegoogle_cloud_run_v2_service in Ihrer Terraform-Konfiguration Folgendes hinzu:Wenn Sie die CPU- und Parallelitätsauslastung auf die Standardziele zurücksetzen möchten, entfernen Sie die Attribute cpu_utilization und concurrency_utilization aus dem Block scaling in Ihrer Terraform-Konfiguration:
resource "google_cloud_run_v2_service" "default" {
name = "SERVICE"
location = "REGION"
template {
scaling {
# Remove the scaling target attributes to restore defaults
}
containers {
image = "IMAGE_URL"
}
}
}
Ersetzen Sie Folgendes:
- SERVICE: der Name Ihres Dienstes.
- REGION: die Google Cloud Region, z. B.
europe-west1. IMAGE_URL: ein Verweis auf das Container-Image, z. B.us-docker.pkg.dev/cloudrun/container/hello:latestWenn Sie Artifact Registry verwenden, muss das Repository REPO_NAME bereits erstellt sein. Die URL hat das FormatLOCATION-docker.pkg.dev/PROJECT_ID/REPO_NAME/PATH:TAG.
Skalierungskonfiguration ansehen
Sie können Ihre Skalierungskonfiguration über die Google Cloud Console oder die gcloud CLI aufrufen.
Console
Rufen Sie in der Google Cloud Console die Seite Cloud Run-Dienste auf:
Klicken Sie auf Ihren Dienst, um den Bereich Dienstdetails zu öffnen.
Klicken Sie auf den Tab Skalierung, um die Skalierungseinstellungen aufzurufen.
gcloud
Verwenden Sie den folgenden Befehl:
gcloud run services describe SERVICE
Ersetzen Sie SERVICE durch den Namen Ihres Dienstes.
Suchen Sie in der zurückgegebenen Konfiguration nach den Werten für die Einstellungen CPU-Zielauslastung und Zielauslastung für Nebenläufigkeit.
Best Practices
Sie können die Kosten optimieren und eine Überdimensionierung verhindern, indem Sie die Anzahl der Instanzen verringern. Alternativ können Sie die Leistung verbessern, indem Sie aggressiver auf bestimmte Faktoren reagieren. Verwenden Sie die folgenden Strategien, um die optimalen Auslastungsziele für Ihre Arbeitslast zu ermitteln:
Bevor Sie Ziele anpassen, sollten Sie herausfinden, welcher Messwert die Skalierung Ihres Dienstes auslöst. So ermitteln Sie die Skalierungs-Messwert:
Rufen Sie in der Google Cloud Console den Metrics Explorer auf, um das Monitoring-Diagramm für Ihren Skalierungstreiber anzusehen.
Suchen Sie nach dem Messwert
run.googleapis.com/scaling/recommended_instancesund wählen Sie ihn aus. Legen Sie Aggregation auf Nicht aggregiert fest, um den Messwert nach Skalierungsfaktor gruppiert zu sehen.
Der Treiber mit dem höchsten Wert steuert die Anzahl der Instanzen Ihres Dienstes. Wenn ein anderer Treiber Priorität haben soll oder Sie die Skalierung aggressiver oder weniger aggressiv gestalten möchten, passen Sie das Auslastungsziel für diesen Treiber an.
Wenn ACT (Adaptive Concurrency Tuning) der Skalierungstreiber ist, bedeutet das, dass die CPU-Auslastung einzelner Instanzen innerhalb einer Sekunde 90% überschreitet und Cloud Run die Anzahl gleichzeitiger Anfragen dynamisch begrenzt, um Ihren Dienst zu schützen. Um zu verhindern, dass ACT Ihre Skalierung beeinflusst, sollten Sie die CPU-Zuweisung erhöhen oder die Einstellungen für die Nebenläufigkeit anpassen. Weitere Informationen finden Sie unter Autoscaling von Instanzen.
Passen Sie die Ziele schrittweise an und warten Sie einige Minuten zwischen den Anpassungen, um die Auswirkungen auf die Leistung zu beobachten.
Verwenden Sie die Traffic-Aufteilung, um neue Skalierungsziele zu testen. Dazu leiten Sie einen kleinen Prozentsatz Ihres Traffics an eine separate Überarbeitung weiter, bevor Sie sie für Ihren gesamten Dienst einführen.
Ziele für geringe Auslastung
Wenn Sie das Auslastungsziel auf das Minimum von 0.1 (10%) senken, ändert sich die Skalierung Ihres Dienstes erheblich.
Die Vorteile eines niedrigen Auslastungsziels sind unter anderem:
Hohe Dienstverfügbarkeit: Ihr Dienst wird viel früher skaliert und behält einen großen Puffer an Leerlaufkapazität bei, um plötzliche Trafficspitzen ohne Latenzprobleme zu bewältigen.
Schnellere Skalierung bei geringer Anzahl von Instanzen: Dienste werden zuverlässiger skaliert, bevor es zu Engpässen bei der hohen Auslastung kommt.
Nachteile niedriger Auslastungsziele:
- Potenzial für Kostensteigerung: Sie führen mehr Instanzen aus, als für Ihre aktuelle Last unbedingt erforderlich ist. Das führt zu höheren Abrechnungen.
- Häufigere Skalierungsentscheidungen: Bei geringerer Auslastung ist die Toleranz von Cloud Run geringer und es wird nicht so lange mit der Skalierung gewartet.
Nächste Schritte
- Weitere Informationen zu Autoscaling-Konzepten und -Verhalten finden Sie unter Autoscaling von Instanzen in Cloud Run-Diensten.
- Weitere Skalierungsoptionen finden Sie unter Manuelle Skalierung.
- Informationen zum Verwalten der maximalen Anzahl von Instanzen Ihrer Cloud Run-Dienste finden Sie unter Maximale Anzahl von Instanzen festlegen.
- Informationen zum Verwalten der maximalen Anzahl gleichzeitiger Anfragen, die von jeder Instanz verarbeitet werden, finden Sie unter Gleichzeitigkeit festlegen.
- Informationen zum Optimieren der Gleichzeitigkeitseinstellung finden Sie unter Tipps für Entwickler: Gleichzeitigkeit optimieren.
- Wenn Sie festlegen möchten, dass eine inaktive Instanz dauerhaft ausgeführt wird, um damit Latenz oder Kaltstarts bei ersten Anfragen zu minimieren, lesen Sie den Abschnitt Inaktive Instanzen mithilfe von
min-instanceaktivieren.