Document AI vous permet d'entraîner de nouvelles versions de processeur à l'aide de vos propres données d'entraînement et d'évaluer la qualité de votre version de processeur par rapport à vos propres données de test.
Cela est utile lorsque vous souhaitez utiliser un processeur personnalisé. Il existe un processeur Document AI pour votre type de document, mais vous pouvez en entraîner une version personnalisée pour répondre à vos besoins.
L'entraînement et l'évaluation sont généralement effectués en parallèle pour itérer vers une version de processeur utilisable et de haute qualité.
Document AI
Document AI vous permet de créer votre propre extracteur personnalisé, qui extrait des entités de documents d'un type particulier, par exemple les éléments d'un menu ou le nom et les coordonnées d'un candidat à partir d'un CV.
Contrairement aux autres processeurs, les processeurs personnalisés ne sont fournis avec aucune version de processeur pré-entraînée et ne peuvent donc traiter aucun document tant que vous n'avez pas entraîné une version à partir de zéro.
Pour commencer à utiliser Document AI, consultez Créer votre propre processeur personnalisé.
Surentraîner un processeur
Vous pouvez surentraîner de nouvelles versions de processeur pour améliorer la justesse de vos données, extraire des champs personnalisés supplémentaires de vos documents et ajouter la prise en charge de nouvelles langues.
Le surentraînement fonctionne en appliquant l'apprentissage par transfert aux versions de processeur pré-entraînées de Google et nécessite généralement moins de données que l'entraînement à partir de zéro.
Pour commencer, consultez Surentraîner un processeur pré-entraîné.
Processeurs compatibles
Tous les processeurs spécialisés ne sont pas compatibles avec le surentraînement. Voici les processeurs compatibles avec le surentraînement.
Remarques et recommandations concernant les données
La qualité et la quantité de vos données déterminent la qualité de l'entraînement, du surentraînement et de l'évaluation.
L'obtention d'un ensemble de documents représentatifs et concrets, ainsi que la fourniture d'un nombre suffisant d'étiquettes de haute qualité sont souvent les étapes les plus longues et les plus gourmandes en ressources du processus.
Nombre de documents
Si tous vos documents ont un format similaire (par exemple, un formulaire fixe avec très peu de variations), moins de documents sont nécessaires pour atteindre la précision souhaitée. Plus la variation est élevée, plus le nombre de documents requis est important.
Les graphiques suivants fournissent une estimation approximative du nombre de documents requis pour qu'un extracteur de documents personnalisé atteigne un score de qualité particulier.
| Faible variation | Forte variation |
|---|---|
![]() |
![]() |
Étiquetage des données
Examinez vos options d'étiquetage des documents et assurez-vous de disposer de suffisamment de ressources pour annoter les documents de votre ensemble de données.
Entraîner des modèles
Les processeurs d'extracteur personnalisé peuvent utiliser différents types de modèles en fonction du cas d'utilisation spécifique et des données d'entraînement disponibles.
- Modèle personnalisé : modèle utilisant des données d'entraînement étiquetées.
- Basé sur un modèle : documents avec une mise en page fixe.
- Basé sur le modèle : documents avec une certaine variation de mise en page.
- Modèle d'IA générative : basé sur des modèles de fondation pré-entraînés qui nécessitent un entraînement supplémentaire minimal.
Le tableau suivant illustre les cas d'utilisation correspondant à chaque type de modèle.
| Modèle personnalisé | IA générative | ||
|---|---|---|---|
| Basé sur un modèle | Basé sur le modèle | ||
| Variation de mise en page | Aucune | Faible à moyenne | Élevée |
| Quantité de texte libre (par exemple, paragraphes dans un contrat) | Faible | Faible | Élevée |
| Quantité de données d'entraînement requise | Faible | Élevée | Faible |
| Précision avec des données d'entraînement limitées | Plus élevée | Plus faible | Plus élevée |
Découvrez comment affiner un processeur avec des descriptions de propriétés.
Quand utiliser un autre processeur
Voici quelques cas dans lesquels vous pouvez envisager d'autres options que Document AI Document AI Workbench ou adapter votre workflow.
- Certains formats d'entrée basés sur du texte (.txt, .html, .docx, .md, etc.) ne sont pas compatibles avec Document AI Document AI Workbench. Envisagez d'autres offres de traitement du langage prédéfinies ou personnalisées dans Google Cloud, telles que l' API Cloud Natural Language.
- Le schéma de l'extracteur de documents personnalisé accepte jusqu'à 150 étiquettes d'entité. Si votre logique métier nécessite plus de 150 entités dans la définition du schéma, envisagez d'entraîner plusieurs processeurs, chacun ciblant un sous-ensemble d'entités.
Comment entraîner un processeur
En supposant que vous ayez déjà créé un processeur compatible avec l'entraînement ou le surentraînement et que vous ayez étiqueté votre ensemble de données, vous pouvez entraîner une nouvelle version de processeur à partir de zéro. Vous pouvez également surentraîner une nouvelle version de processeur à partir d'une version existante.
Entraîner une version de processeur
UI Web
Dans la Google Cloud console, accédez à l'onglet Entraînement de votre processeur.
Cliquez sur Modifier le schéma pour ouvrir la page Gérer les étiquettes. Vérifiez les étiquettes du processeur.
Les étiquettes activées au moment de l'entraînement déterminent les entités que votre nouvelle version de processeur extrait. Si une étiquette est inactive dans le schéma, la version du processeur ne l'extrait pas, même si les documents sont étiquetés.
Dans l'onglet Entraînement , cliquez sur Afficher les statistiques des étiquettes , puis vérifiez votre ensemble de test et votre ensemble d'entraînement. Les documents étiquetés automatiquement, non étiquetés ou non attribués sont exclus de l'entraînement et de l'évaluation.
Cliquez sur Entraîner une nouvelle version.
Le nom de la version définit le champ
namedeprocessorVersion.
Cliquez sur Démarrer l'entraînement et attendez que votre nouvelle version de processeur soit entraînée et évaluée.
Vous pouvez surveiller la progression de l'entraînement dans l'onglet Gérer les versions :

Cliquez sur l'onglet Évaluer et tester pour voir les performances de votre nouvelle version de processeur sur l'ensemble de test. Pour en savoir plus, consultez Évaluer une version de processeur.
Python
Pour en savoir plus, consultez la documentation de référence de l' API Python Document AI.
Pour vous authentifier auprès de Document AI, configurez le service Identifiants par défaut de l'application. Pour en savoir plus, consultez Configurer l'authentification pour un environnement de développement local.
Déployer et utiliser la version du processeur
Vous pouvez déployer et gérer vos versions de processeur comme n'importe quelle autre version de processeur. Pour en savoir plus, consultez Gérer les versions de processeur.
Une fois le déploiement effectué, vous pouvez envoyer une requête de traitement à votre processeur personnalisé.
Désactiver ou supprimer un processeur
Si vous ne souhaitez plus utiliser un processeur, vous pouvez le désactiver ou le supprimer. Si vous désactivez un processeur, vous pouvez le réactiver. Si vous supprimez un processeur, vous ne pouvez pas le récupérer.
Dans le panneau Document AI à gauche, cliquez sur Mes processeurs.
Cliquez sur les trois points verticaux à droite du nom du processeur. Cliquez sur Désactiver le processeur ou Supprimer le processeur.
Pour en savoir plus, consultez Gérer les versions de processeur.
Mettre à niveau une version de processeur affinée
Vous pouvez mettre à niveau les versions de processeur d'extracteur personnalisé affinées custom extractor vers une version de base plus récente. Les configurations de la version de base la plus récente seront basées sur l'ancienne. Elle utilisera les données d'entraînement du processeur qui se trouvent dans les versions d'origine.
Dans la console Google Google Cloud , accédez à l'onglet Déployer et utiliser de votre processeur, puis cochez la case d'une version de processeur compatible pour la mise à niveau. Il s'agit de la configuration sur laquelle la nouvelle version de processeur sera basée.

Sélectionnez l'option Mettre à niveau activée. Saisissez le nom et la version de base de la nouvelle version de processeur.

Cliquez sur Mettre à niveau et attendez que votre nouvelle version de processeur soit entraînée.
Utiliser l'API pour effectuer la mise à niveau
Vous pouvez également utiliser des appels d'API pour mettre à niveau les versions de processeur d'extracteur personnalisé affinées vers une version de base plus récente.
curl
Cet exemple montre comment migrer un processor affiné existant à l'aide du champ FoundationModelTuningOptions
dans le TrainingMethod.
Avant d'utiliser les données de requête, remplacez les éléments suivants par les informations de la console Présentation Document AI Google Cloud pour votre processeur.
- LOCATION : emplacement de votre processeur .
- PROJECT_ID : ID du projet.
- PROCESSOR_ID : ID de votre processeur.
- DISPLAY_NAME : nouveau nom à afficher de votre processeur.
- BASE_PROCESSOR_VERSION : nom de la version de processeur du modèle actuel.
PROCESSOR_VERSION : ID de votre processeur actuel à mettre à niveau.
curl -X POST -v -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json" \ "https://LOCATION-documentai.googleapis.com/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/processorVersions:train" \ -d '{ "processor_version": { "display_name": "DISPLAY_NAME" }, "base_processor_version": "projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/processorVersions/BASE_PROCESSOR_VERSION", "foundation_model_tuning_options": { "train_steps": 10, "learning_rate_multiplier": 1, "previous_fine_tuned_processor_version_name": "projects/PROJECT_ID/locations/LOCATION/processors/PROCESSOR_ID/processorVersions/PROCESSOR_VERSION", } }'
Chiffrement des données d'entraînement
Les données d'entraînement de Document AI sont enregistrées dans Cloud Storage et peuvent être chiffrées avec des clés de chiffrement gérées par le client si nécessaire.
Suppression des données d'entraînement
Une fois une tâche d'entraînement Document AI terminée, toutes les données d'entraînement enregistrées dans Cloud Storage expirent après une période de conservation de deux jours. Les activités de suppression de données ultérieures respectent le processus décrit dans Suppression de données sur Google Cloud.
Tarifs
L'entraînement et le surentraînement ne sont pas facturés. Vous payez l'hébergement et la prédiction. Pour en savoir plus, consultez Tarifs de Document AI.

