En esta página se explica cómo configurar un proyecto aislado de Google Distributed Cloud (GDC) para usar el servicio de reconocimiento óptico de caracteres (OCR). Este proceso incluye la creación de un proyecto, la habilitación de la API OCR, la instalación de bibliotecas de cliente, la definición de variables de entorno y la autenticación de tus credenciales. Si no conoces Vertex AI, consulta más información sobre las funciones de reconocimiento de caracteres.
Para configurar un proyecto de reconocimiento de caracteres, sigue estos pasos con la consola de GDC y la CLI de gdcloud:
- Consola de GDC: habilita la API OCR y consulta el estado y el endpoint del servicio.
- CLI de gdcloud: configura cuentas de servicio para interactuar con la API OCR, instala bibliotecas de cliente y autentica las solicitudes de la API.
Crear un proyecto
Al crear un proyecto de reconocimiento de caracteres en la jerarquía de recursos de Distributed Cloud se organizan tus recursos de OCR, que incluyen colaboradores, APIs habilitadas, herramientas de monitorización, datos de facturación, credenciales de autenticación y controles de acceso.
Para crear un proyecto, consulta el artículo Configurar un proyecto para Vertex AI. Necesitarás el ID del proyecto para hacer llamadas a la API.
Solicitar permisos de desarrollador
Debes tener el rol de desarrollador de OCR de IA en tu proyecto para acceder a las funciones de reconocimiento óptico de caracteres y generar un token de API para la autenticación y la autorización de solicitudes.
Pide al administrador de IAM del proyecto que asigne el rol de desarrollador de OCR de IA (ai-ocr-developer) a tu usuario o cuenta de servicio en el espacio de nombres del proyecto. Para obtener información sobre este rol, consulta el artículo
Preparar permisos de IAM.
Habilitar la API OCR
Debes habilitar la API preentrenada de OCR en tu proyecto. Si está habilitada, puedes ver el estado y el endpoint del servicio de la API preentrenada de OCR.
Instalar bibliotecas de cliente
Las bibliotecas de cliente están disponibles para el lenguaje de programación Python. Te recomendamos que uses estas bibliotecas de cliente para hacer llamadas a la API OCR, ya que facilitan el acceso a las APIs.
El método recomendado para instalar esta biblioteca es en un entorno virtual mediante venv.
Usar venv ofrece varias ventajas clave:
- Crea entornos de Python aislados para alojar diferentes versiones de paquetes.
- Evita conflictos entre las dependencias de los proyectos y las instalaciones en todo el sistema.
- Permite instalar bibliotecas sin necesidad de permisos a nivel de sistema.
Instala la biblioteca de cliente de OCR y sigue estos pasos para asegurarte de que tienes la versión correcta:
Comprueba si la biblioteca de cliente de OCR está instalada y obtén el número de versión:
pip freeze | grep visionSi la biblioteca de cliente ya está instalada, obtendrás un resultado similar al siguiente ejemplo:
google-cloud-vision==3.0.0El número de versión que obtengas debe coincidir con la biblioteca de cliente del siguiente endpoint:
https://GDC_URL/.well-known/static/client-librariesSustituye
GDC_URLpor la URL de tu organización en GDC.Si los números de versión no coinciden, desinstala la biblioteca de cliente:
pip uninstall google-cloud-visionSi has desinstalado la biblioteca de cliente de OCR, debes volver a instalarla especificando el nombre de archivo correspondiente a tu sistema operativo.
Definir variables de entorno
Después de instalar la biblioteca de cliente de OCR, puedes interactuar con la API desde una secuencia de comandos de Python.
Si configuras una cuenta de servicio en tu proyecto para hacer llamadas autorizadas a la API de forma programática, puedes definir variables de entorno en la secuencia de comandos de Python para acceder a valores como las claves de la cuenta de servicio durante la ejecución.
Sigue estos pasos para definir las variables de entorno necesarias en una secuencia de comandos de Python:
Crea un bloc de notas de JupyterLab para interactuar con la API preentrenada de OCR.
Crea una secuencia de comandos de Python en el bloc de notas de JupyterLab.
Añade el siguiente código a la secuencia de comandos de Python:
import os os.environ["GOOGLE_APPLICATION_CREDENTIALS"] = "APPLICATION_DEFAULT_CREDENTIALS_FILENAME"Sustituye
APPLICATION_DEFAULT_CREDENTIALS_FILENAMEpor el nombre del archivo JSON que contiene las claves de la cuenta de servicio que has creado en el proyecto, comomy-service-key.json.Guarda la secuencia de comandos de Python con un nombre, como
vision.py.Ejecuta la secuencia de comandos de Python para definir las variables de entorno:
python SCRIPT_NAMESustituye
SCRIPT_NAMEpor el nombre que le has dado a tu secuencia de comandos de Python, comovision.py.
Configurar la autenticación
Antes de empezar a usar la API OCR, debes autenticar tus credenciales de cliente y solicitar acceso a la cuenta de los recursos de tu proyecto. Para obtener más información, consulta el artículo Autenticar solicitudes de la API.