Configurer un projet de reconnaissance de caractères

Cette page aide les développeurs à configurer un projet Google Distributed Cloud (GDC) air-gapped pour utiliser le service de reconnaissance optique de caractères (OCR). Ce processus inclut la création d'un projet, l'activation de l'API OCR, l'installation de bibliothèques clientes, la définition de variables d'environnement et l'authentification de vos identifiants. Si vous ne connaissez pas Vertex AI, découvrez les fonctionnalités de reconnaissance de caractères.

Vous configurez un projet de reconnaissance de caractères à l'aide de la console GDC et de la CLI gdcloud comme suit :

  • Console GDC : activez l'API OCR et affichez l' état et le point de terminaison du service.
  • CLI gdcloud : configurez des comptes de service pour interagir avec l'API OCR, installez des bibliothèques clientes et authentifiez les requêtes API.

Créer un projet

La création d'un projet de reconnaissance de caractères dans votre hiérarchie de ressources Distributed Cloud organise vos ressources OCR, qui incluent des collaborateurs, des API activées, des outils de surveillance, des informations de facturation, des identifiants d'authentification et des contrôles d'accès.

Pour créer votre projet, consultez Configurer un projet pour Vertex AI. Vous aurez besoin de votre ID de projet lorsque vous effectuerez des appels d'API.

Demander des autorisations de développeur

Vous devez disposer du rôle de développeur AI OCR dans votre projet pour accéder aux fonctionnalités de reconnaissance optique de caractères et générer un jeton d'API pour l'authentification et l'autorisation des requêtes.

Demandez à votre administrateur IAM de projet d'attribuer le rôle de développeur AI OCR (ai-ocr-developer) à votre compte utilisateur ou de service dans l'espace de noms de votre projet. Pour en savoir plus sur ce rôle, consultez Préparer les autorisations IAM.

Activer l'API OCR

Vous devez activer l'API pré-entraînée OCR pour votre projet. Si elle est activée, vous pouvez afficher l'état et le point de terminaison du service pour l'API pré-entraînée OCR.

Installer les bibliothèques clientes

Des bibliothèques clientes sont disponibles pour le langage de programmation Python. Nous vous recommandons d'utiliser ces bibliothèques clientes pour effectuer des appels à l'API OCR, car elles facilitent l'accès aux API.

La méthode recommandée pour installer cette bibliothèque consiste à utiliser un environnement virtuel avec venv.

L'utilisation de venv présente plusieurs avantages clés :

  • Il crée des environnements Python isolés pour héberger différentes versions de packages.
  • Il évite les conflits entre les dépendances du projet et les installations à l'échelle du système.
  • Il permet d'installer des bibliothèques sans avoir besoin d'autorisations au niveau du système.

Installez la bibliothèque cliente OCR et procédez comme suit pour vous assurer que vous disposez de la bonne version :

  1. Vérifiez si la bibliothèque cliente OCR est installée et obtenez le numéro de version :

    pip freeze | grep vision
    

    Si la bibliothèque cliente est déjà installée, vous obtenez un résultat semblable à l'exemple suivant :

    google-cloud-vision==3.0.0
    

    Le numéro de version que vous obtenez doit correspondre à la bibliothèque cliente au point de terminaison suivant :

    https://GDC_URL/.well-known/static/client-libraries
    

    Remplacez GDC_URL par l'URL de votre organisation dans GDC.

  2. Si les numéros de version ne correspondent pas, désinstallez la bibliothèque cliente :

    pip uninstall google-cloud-vision
    
  3. Si vous avez désinstallé la bibliothèque cliente OCR, vous devez la réinstaller en spécifiant le nom de fichier correspondant à votre système d'exploitation.

Définir les variables d'environnement

Après avoir installé la bibliothèque cliente OCR, vous pouvez interagir avec l'API à partir d'un script Python.

Si vous configurez un compte de service dans votre projet pour effectuer des appels d'API autorisés par programmation, vous pouvez définir des variables d'environnement dans le script Python pour accéder à des valeurs telles que les clés de compte de service lors de l'exécution.

Procédez comme suit pour définir les variables d'environnement requises dans un script Python :

  1. Créez un notebook JupyterLab pour interagir avec l'API pré-entraînée OCR.

  2. Créez un script Python dans le notebook JupyterLab.

  3. Ajoutez le code suivant au script Python :

    import os
    
    os.environ["GOOGLE_APPLICATION_CREDENTIALS"] = "APPLICATION_DEFAULT_CREDENTIALS_FILENAME"
    

    Remplacez APPLICATION_DEFAULT_CREDENTIALS_FILENAME par le nom du fichier JSON contenant les clés de compte de service que vous avez créées dans le projet, par exemple my-service-key.json.

  4. Enregistrez le script Python sous un nom, par exemple vision.py.

  5. Exécutez le script Python pour définir les variables d'environnement :

    python SCRIPT_NAME
    

    Remplacez SCRIPT_NAME par le nom que vous avez attribué à votre script Python, par exemple vision.py.

Configurer l'authentification

Avant de pouvoir utiliser l'API OCR, vous devez authentifier vos identifiants client et demander l'accès au compte pour les ressources de votre projet. Pour en savoir plus, consultez Authentifier les requêtes API.