Classes
Amount
Represents an amount of money in a specific currency.
Cost
Cost for running a model deployment on a given instance type. Currently, only USD currency code is supported.
FetchBenchmarkingDataRequest
Request message for [GkeInferenceQuickstart.FetchBenchmarkingData][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchBenchmarkingData].
FetchBenchmarkingDataResponse
Response message for [GkeInferenceQuickstart.FetchBenchmarkingData][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchBenchmarkingData].
FetchModelServerVersionsRequest
Request message for [GkeInferenceQuickstart.FetchModelServerVersions][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchModelServerVersions].
FetchModelServerVersionsResponse
Response message for [GkeInferenceQuickstart.FetchModelServerVersions][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchModelServerVersions].
FetchModelServersRequest
Request message for [GkeInferenceQuickstart.FetchModelServers][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchModelServers].
FetchModelServersResponse
Response message for [GkeInferenceQuickstart.FetchModelServers][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchModelServers].
FetchModelsRequest
Request message for [GkeInferenceQuickstart.FetchModels][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchModels].
FetchModelsResponse
Response message for [GkeInferenceQuickstart.FetchModels][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchModels].
FetchProfilesRequest
Request message for [GkeInferenceQuickstart.FetchProfiles][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchProfiles].
FetchProfilesResponse
Response message for [GkeInferenceQuickstart.FetchProfiles][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchProfiles].
GenerateOptimizedManifestRequest
Request message for [GkeInferenceQuickstart.GenerateOptimizedManifest][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.GenerateOptimizedManifest].
GenerateOptimizedManifestResponse
Response message for [GkeInferenceQuickstart.GenerateOptimizedManifest][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.GenerateOptimizedManifest].
GkeInferenceQuickstart
GKE Inference Quickstart (GIQ) service provides profiles with performance metrics for popular models and model servers across multiple accelerators. These profiles help generate optimized best practices for running inference on GKE.
GkeInferenceQuickstart.GkeInferenceQuickstartBase
Base class for server-side implementations of GkeInferenceQuickstart
GkeInferenceQuickstart.GkeInferenceQuickstartClient
Client for GkeInferenceQuickstart
GkeInferenceQuickstartClient
GkeInferenceQuickstart client wrapper, for convenient use.
GkeInferenceQuickstartClientBuilder
Builder class for GkeInferenceQuickstartClient to provide simple configuration of credentials, endpoint etc.
GkeInferenceQuickstartClientImpl
GkeInferenceQuickstart client wrapper implementation, for convenient use.
GkeInferenceQuickstartSettings
Settings for GkeInferenceQuickstartClient instances.
KubernetesManifest
A Kubernetes manifest.
MillisecondRange
Represents a range of latency values in milliseconds.
ModelServerInfo
Model server information gives. Valid model server info combinations can be found using [GkeInferenceQuickstart.FetchProfiles][google.cloud.gkerecommender.v1.GkeInferenceQuickstart.FetchProfiles].
PerformanceRange
Performance range for a model deployment.
PerformanceRequirements
Performance requirements for a profile and or model deployment.
PerformanceStats
Performance statistics for a model deployment.
Profile
A profile containing information about a model deployment.
ResourcesUsed
Resources used by a model deployment.
StorageConfig
Storage configuration for a model deployment.
TokensPerSecondRange
Represents a range of throughput values in tokens per second.