Hugging Face-Modelle verwenden

Hugging Face bietet vortrainierte Modelle, Scripts zur Feinabstimmung und Entwicklungs-APIs, die das Erstellen und Entdecken von LLMs erleichtern. Model Garden kann Texteinbettungs, Text-zu-Bild, Textgenerierungs, und Bildtext-zu-Text -Modelle in Hugging Face bereitstellen.

Bereitstellungsoptionen für Hugging Face-Modelle

Sie können unterstützte Hugging Face-Modelle in der Gemini Enterprise Agent Platform oder in der Google Kubernetes Engine (GKE) bereitstellen. Die von Ihnen gewählte Bereitstellungsoption kann vom verwendeten Modell und von der gewünschten Kontrolle über Ihre Arbeitslasten abhängen.

In der Gemini Enterprise Agent Platform bereitstellen

Die Gemini Enterprise Agent Platform bietet eine verwaltete Plattform zum Erstellen und Skalieren von ML-Projekten, ohne dass interne MLOps-Kenntnisse erforderlich sind. Sie können die Gemini Enterprise Agent Platform als nachgelagerte Anwendung verwenden, die Hugging Face-Modelle bereitstellt. Wir empfehlen die Verwendung der Gemini Enterprise Agent Platform, wenn Sie End-to-End-MLOps-Funktionen, Mehrwert-ML-Features und eine serverlose Umgebung für eine optimierte Entwicklung wünschen.

  1. Wenn Sie ein unterstütztes Hugging Face-Modell in der Gemini Enterprise Agent Platform bereitstellen möchten, rufen Sie Model Garden auf.

    Zu Model Garden

  2. Rufen Sie den Bereich Open-Source-Modelle auf Hugging Face auf und klicken Sie auf Mehr anzeigen.

  3. Suchen und wählen Sie ein Modell aus, das Sie bereitstellen möchten.

  4. Optional: Wählen Sie für die Bereitstellungsumgebung die Option Gemini Enterprise Agent Platform aus.

  5. Optional: Geben Sie die Bereitstellungsdetails an.

  6. Klicken Sie auf Bereitstellen.

Sehen Sie sich zum Einstieg die folgenden Beispiele an:

In GKE bereitstellen

Google Kubernetes Engine (GKE) ist die Google Cloud Lösung für verwaltete Kubernetes, die Skalierbarkeit, Sicherheit, Robustheit und Kosteneffizienz bietet. Wir empfehlen diese Option, wenn Sie bereits Kubernetes-Investitionen haben, Ihre Organisation über interne MLOps-Kenntnisse verfügt oder wenn Sie eine detaillierte Kontrolle über komplexe KI/ML-Arbeitslasten mit besonderer Sicherheit, Datenpipeline und Ressourcen benötigen Managementanforderungen.

  1. Wenn Sie ein unterstütztes Hugging Face-Modell in GKE bereitstellen möchten, rufen Sie Model Garden auf.

    Zu Model Garden

  2. Rufen Sie den Bereich Open-Source-Modelle auf Hugging Face auf und klicken Sie auf Mehr anzeigen.

  3. Suchen und wählen Sie ein Modell aus, das Sie bereitstellen möchten.

  4. Wählen Sie als Bereitstellungsumgebung GKE aus.

  5. Folgen Sie der Anleitung zur Bereitstellung.

Sehen Sie sich zum Einstieg die folgenden Beispiele an:

Was bedeutet „Wird von der Gemini Enterprise Agent Platform unterstützt“?

Wir fügen dem Model Garden automatisch die neuesten und beliebtesten Hugging Face-Modelle hinzu. Dieser Prozess umfasst die automatische Generierung einer Bereitstellungskonfiguration für jedes Modell.

Um Bedenken hinsichtlich Sicherheitslücken und schädlichem Code auszuräumen, verwenden wir den Hugging Face Malware Scanner, um die Sicherheit von Dateien in jedem Hugging Face-Modellrepository täglich zu bewerten. Wenn ein Modellrepository als Malware enthaltend gekennzeichnet wird, entfernen wir das Modell sofort von der Hugging Face-Galerieseite.

Wenn ein Modell als Wird von der Gemini Enterprise Agent Platform unterstützt gekennzeichnet ist, bedeutet das, dass es getestet wurde und in der Gemini Enterprise Agent Platform bereitgestellt werden kann. Wir garantieren jedoch nicht, dass keine Sicherheitslücken oder kein schädlicher Code vorhanden sind. Wir empfehlen Ihnen, eigene Sicherheitsprüfungen durchzuführen, bevor Sie ein Modell in Ihrer Produktionsumgebung bereitstellen.

Bereitstellungskonfigurationen für bestimmte Anwendungsfälle optimieren

Die Standardbereitstellungskonfiguration, die mit der Option zur Bereitstellung mit einem Klick bereitgestellt wird, kann aufgrund der Vielzahl von Anwendungsfällen und der unterschiedlichen Prioritäten in Bezug auf Latenz, Durchsatz, Kosten und Genauigkeit nicht alle Anforderungen erfüllen.

Daher können Sie zuerst mit der Bereitstellung mit einem Klick experimentieren, um eine Baseline zu erstellen, und dann die Bereitstellungskonfigurationen mit dem Colab-Notebook (vLLM, TGI, TEI, HF-PyTorch-Inferenz) oder dem Python SDK optimieren. Mit diesem iterativen Ansatz können Sie die Bereitstellung genau an Ihre Anforderungen anpassen, um die bestmögliche Leistung für Ihre spezifische Anwendung zu erzielen.

Was tun, wenn das gewünschte Modell nicht im Model Garden aufgeführt ist?

Wenn Sie nach einem bestimmten Modell suchen, das nicht im Model Garden aufgeführt ist, wird das Modell von der Gemini Enterprise Agent Platform nicht unterstützt. In den folgenden Abschnitten werden die Gründe dafür erläutert und was Sie tun können.

Warum ist das Modell nicht aufgeführt?

Die folgenden Gründe erklären, warum ein Modell möglicherweise nicht im Model Garden enthalten ist:

  • Es ist kein Top-Trendmodell: Wir priorisieren oft Modelle, die sehr beliebt sind und ein starkes Interesse in der Community haben.
  • Es ist noch nicht kompatibel: Das Modell funktioniert möglicherweise nicht mit einem unterstützten Bereitstellungscontainer. Beispiel: Der vLLM-Container für text-generation und image-text-to-text-Modelle.
  • Nicht unterstützte Pipelineaufgaben: Das Modell hat eine Aufgabe die wir derzeit noch nicht vollständig unterstützen. Wir unterstützen die folgenden Aufgaben: text-generation, text2text-generation, text-to-image, feature-extraction, sentence-similarity, und image-text-to-text.

Welche Möglichkeiten haben Sie?

Sie können weiterhin mit Modellen arbeiten, die nicht im Model Garden verfügbar sind:

  • Selbst mit dem Colab-Notebook bereitstellen: Wir haben die folgenden Colab Notebooks: (vLLM, TGI, TEI, HF-PyTorch-Inferenz), mit denen Sie Modelle mit benutzerdefinierten Konfigurationen bereitstellen können. So haben Sie die vollständige Kontrolle über den Prozess.
  • Funktionsanfrage senden: Arbeiten Sie mit Ihrem Support-Entwickler zusammen und senden Sie eine Feature Request über den Model Garden. Weitere Hilfe erhalten Sie beim Vertex Generative AI-Support.
  • Updates im Blick behalten: Wir fügen dem Model Garden regelmäßig neue Modelle hinzu. Das gesuchte Modell ist möglicherweise in Zukunft verfügbar. Sehen Sie also regelmäßig nach.