En esta página, se ayuda a los desarrolladores a configurar un proyecto aislado de Google Distributed Cloud (GDC) para usar el servicio de reconocimiento óptico de caracteres (OCR). Este proceso incluye la creación de un proyecto, la habilitación de la API de OCR, la instalación de bibliotecas cliente, la definición de variables de entorno y la autenticación de tus credenciales. Si no conoces Vertex AI, obtén más información sobre las funciones de reconocimiento de caracteres.
Para configurar un proyecto de reconocimiento de caracteres, usa la consola de GDC y la CLI de gdcloud de la siguiente manera:
- Consola de GDC: Habilita la API de OCR y consulta el estado y el extremo del servicio.
- CLI de gdcloud: Configura cuentas de servicio para interactuar con la API de OCR, instalar bibliotecas cliente y autenticar solicitudes a la API.
Crea un proyecto
La creación de un proyecto de reconocimiento de caracteres dentro de la jerarquía de recursos de Distributed Cloud organiza tus recursos de OCR, que incluyen colaboradores, APIs habilitadas, herramientas de supervisión, datos de facturación, credenciales de autenticación, y controles de acceso.
Para crear tu proyecto, consulta Configura un proyecto para Vertex AI. Necesitas el ID del proyecto cuando realices llamadas a la API.
Solicita permisos de desarrollador
Debes tener el rol de desarrollador de AI OCR en tu proyecto para acceder a las funciones de reconocimiento óptico de caracteres y generar un token de API para la autenticación y autorización de solicitudes.
Pídele al administrador de IAM del proyecto que otorgue el rol de desarrollador de AI OCR (ai-ocr-developer) a tu usuario o cuenta de servicio dentro del espacio de nombres de tu proyecto. Para obtener información sobre este rol, consulta
Prepara permisos de IAM.
Habilita la API de OCR
Debes habilitar la API de OCR preentrenada para tu proyecto. Si está habilitada, puedes ver el estado y el extremo del servicio para la API de OCR preentrenada.
Instala bibliotecas cliente
Las bibliotecas cliente están disponibles para el lenguaje de programación Python. Te recomendamos que uses estas bibliotecas cliente para hacer llamadas a la API de OCR, ya que facilitan el acceso a las APIs.
El método recomendado para instalar esta biblioteca es dentro de un entorno virtual, con venv.
Usar venv ofrece varias ventajas clave:
- Crea entornos aislados de Python para alojar diferentes versiones de paquetes.
- Evita conflictos entre las dependencias del proyecto y las instalaciones en todo el sistema.
- Permite la instalación de bibliotecas sin necesidad de permisos a nivel del sistema.
Instala la biblioteca cliente de OCR y sigue estos pasos para asegurarte de tener la versión correcta:
Verifica si está instalada la biblioteca cliente de OCR y obtén el número de versión:
pip freeze | grep visionSi la biblioteca cliente ya está instalada, obtendrás un resultado similar al siguiente ejemplo:
google-cloud-vision==3.0.0El número de versión que obtengas debe coincidir con la biblioteca cliente en el siguiente extremo:
https://GDC_URL/.well-known/static/client-librariesReemplaza
GDC_URLpor la URL de tu organización en GDC.Si los números de versión no coinciden, desinstala la biblioteca cliente:
pip uninstall google-cloud-visionSi desinstalaste la biblioteca cliente de OCR, debes volver a instalarla especificando el nombre de archivo correspondiente a tu sistema operativo.
Configura las variables de entorno
Después de instalar la biblioteca cliente de OCR, puedes interactuar con la API desde una secuencia de comandos de Python.
Si configuras una cuenta de servicio en tu proyecto para realizar llamadas autorizadas a la API de forma programática, puedes definir variables de entorno en la secuencia de comandos de Python para acceder a valores como las claves de la cuenta de servicio cuando se ejecuta.
Sigue estos pasos para configurar las variables de entorno necesarias en una secuencia de comandos de Python:
Crea un notebook de JupyterLab para interactuar con la API de OCR preentrenada.
Crea una secuencia de comandos de Python en el notebook de JupyterLab.
Agrega el siguiente código a la secuencia de comandos de Python:
import os os.environ["GOOGLE_APPLICATION_CREDENTIALS"] = "APPLICATION_DEFAULT_CREDENTIALS_FILENAME"Reemplaza
APPLICATION_DEFAULT_CREDENTIALS_FILENAMEpor el nombre del archivo JSON que contiene las claves de la cuenta de servicio que creaste en el proyecto, comomy-service-key.json.Guarda la secuencia de comandos de Python con un nombre, como
vision.py.Ejecuta la secuencia de comandos de Python para configurar las variables de entorno:
python SCRIPT_NAMEReemplaza
SCRIPT_NAMEpor el nombre que le diste a tu secuencia de comandos de Python, comovision.py.
Configura la autenticación
Antes de comenzar a usar la API de OCR, debes autenticar tus credenciales de cliente y solicitar acceso a la cuenta de tus recursos del proyecto. Para obtener más información, consulta Autentica solicitudes a la API.