Projekt zur Zeichenerkennung einrichten

Auf dieser Seite erfahren Entwickler, wie sie ein Google Distributed Cloud-Projekt (GDC) mit Air Gap einrichten, um den Dienst für optische Zeichenerkennung (Optical Character Recognition, OCR) zu verwenden. Dazu gehören das Erstellen eines Projekts, das Aktivieren der OCR API, das Installieren von Clientbibliotheken, das Definieren von Umgebungsvariablen und das Authentifizieren Ihrer Anmeldedaten. Wenn Sie Vertex AI noch nicht kennen, finden Sie hier weitere Informationen zu den Funktionen für die Zeichenerkennung.

Sie richten ein Zeichenerkennungsprojekt mit der GDC Console und der gdcloud CLI so ein:

  • GDC Console: Aktivieren Sie die OCR API und rufen Sie den Dienststatus und den Endpunkt auf.
  • gdcloud CLI: Konfigurieren Sie Dienstkonten für die Interaktion mit der OCR API, installieren Sie Clientbibliotheken und authentifizieren Sie API Anfragen.

Projekt erstellen

Wenn Sie ein Zeichenerkennungsprojekt in Ihrer Distributed Cloud Ressourcenhierarchie erstellen, werden Ihre OCR-Ressourcen organisiert. Dazu gehören Mitbearbeiter, aktivierte APIs, Monitoringtools, Abrechnungsinformationen, Authentifizierungsanmeldedaten und Zugriffssteuerungen.

Informationen zum Erstellen eines Projekts finden Sie unter Projekt für Vertex AI einrichten. Sie benötigen Ihre Projekt-ID für API-Aufrufe.

Berechtigungen für Entwickler anfordern

Sie benötigen die Rolle „AI OCR Developer“ in Ihrem Projekt, um auf die Funktionen für die optische Zeichenerkennung zuzugreifen und ein API-Token für die Authentifizierung und Autorisierung von Anfragen zu generieren.

Bitten Sie Ihren Projekt-IAM-Administrator, Ihrem Nutzer oder Dienstkonto im Namespace Ihres Projekts die Rolle „AI OCR Developer“ (ai-ocr-developer) zuzuweisen. Weitere Informationen zu dieser Rolle finden Sie unter IAM-Berechtigungen vorbereiten.

OCR API aktivieren

Sie müssen die vortrainierte OCR API für Ihr Projekt aktivieren. Wenn sie aktiviert ist, können Sie den Dienststatus und den Endpunkt für die vortrainierte OCR API aufrufen.

Clientbibliotheken installieren

Clientbibliotheken sind für die Programmiersprache Python verfügbar. Wir empfehlen, diese Clientbibliotheken für Aufrufe an die OCR API zu verwenden, da sie den Zugriff auf APIs erleichtern.

Die empfohlene Methode zum Installieren dieser Bibliothek ist in einer virtuellen Umgebung mit venv.

Die Verwendung von venv bietet mehrere wichtige Vorteile:

  • Es werden isolierte Python-Umgebungen erstellt, um verschiedene Versionen von Paketen zu hosten.
  • Konflikte zwischen Projektabhängigkeiten und systemweiten Installationen werden verhindert.
  • Bibliotheken können installiert werden, ohne dass Berechtigungen auf Systemebene erforderlich sind.

Installieren Sie die OCR-Clientbibliothek und führen Sie die folgenden Schritte aus, um sicherzustellen, dass Sie die richtige Version haben:

  1. Prüfen Sie, ob die OCR-Clientbibliothek installiert ist, und rufen Sie die Versionsnummer ab:

    pip freeze | grep vision
    

    Wenn die Clientbibliothek bereits installiert ist, erhalten Sie eine Ausgabe ähnlich dem folgenden Beispiel:

    google-cloud-vision==3.0.0
    

    Die Versionsnummer muss mit der Clientbibliothek am folgenden Endpunkt übereinstimmen:

    https://GDC_URL/.well-known/static/client-libraries
    

    Ersetzen Sie GDC_URL durch die URL Ihrer Organisation in GDC.

  2. Wenn die Versionsnummern nicht übereinstimmen, deinstallieren Sie die Clientbibliothek:

    pip uninstall google-cloud-vision
    
  3. Wenn Sie die OCR-Clientbibliothek deinstalliert haben, müssen Sie sie neu installieren und dabei den Dateinamen angeben, der Ihrem Betriebssystem entspricht.

Umgebungsvariablen festlegen

Nachdem Sie die OCR-Clientbibliothek installiert haben, können Sie über ein Python-Skript mit der API interagieren.

Wenn Sie ein Dienstkonto eingerichtet haben in Ihrem Projekt, um autorisierte API-Aufrufe programmatisch auszuführen, können Sie Umgebungsvariablen im Python-Skript definieren, um auf Werte wie die Dienstkontoschlüssel beim Ausführen zuzugreifen.

Führen Sie die folgenden Schritte aus, um die erforderlichen Umgebungsvariablen in einem Python-Skript festzulegen:

  1. Erstellen Sie ein JupyterLab-Notebook um mit der vortrainierten OCR API zu interagieren.

  2. Erstellen Sie ein Python-Skript im JupyterLab-Notebook.

  3. Fügen Sie dem Python-Skript den folgenden Code hinzu:

    import os
    
    os.environ["GOOGLE_APPLICATION_CREDENTIALS"] = "APPLICATION_DEFAULT_CREDENTIALS_FILENAME"
    

    Ersetzen Sie APPLICATION_DEFAULT_CREDENTIALS_FILENAME durch den Namen der JSON-Datei, die die Dienstkontoschlüssel enthält, die Sie erstellt haben im Projekt, z. B. my-service-key.json.

  4. Speichern Sie das Python-Skript unter einem Namen, z. B. vision.py.

  5. Führen Sie das Python-Skript aus, um die Umgebungsvariablen festzulegen:

    python SCRIPT_NAME
    

    Ersetzen Sie SCRIPT_NAME durch den Namen, den Sie Ihrem Python-Skript gegeben haben, z. B. vision.py.

Authentifizierung einrichten

Bevor Sie die OCR API verwenden können, müssen Sie Ihre Clientanmeldedaten authentifizieren und den Kontozugriff auf Ihre Projektressourcen anfordern. Weitere Informationen finden Sie unter API-Anfragen authentifizieren.