Entraîner son propre modèle de traitement de documents dans AI Builder
Comment entraîner dans AI Builder un modèle de traitement de documents personnalisé pour vos documents spécifiques à l'entreprise et l'utiliser dans Power Automate.
Les factures ont un aspect différent selon chaque fournisseur, mais AI Builder dispose au moins d'un modèle d'IA prêt à l'emploi pour les factures. Pour des documents spécifiques à l'entreprise comme les bons de livraison internes, les protocoles de maintenance, les formulaires de commande individuels ou les rapports de contrôle, il n'existe aucun modèle préconçu qui connaisse les champs adaptés. C'est précisément pour cela qu'AI Builder permet d'entraîner un modèle de traitement de documents personnalisé qui extrait exactement les informations réellement nécessaires dans votre entreprise, sans aucune connaissance en data science.
Cet article montre quand un modèle personnalisé est rentable, quels types de modèles sont disponibles, quelles exigences vos documents d'exemple doivent remplir, et comment entraîner, publier puis utiliser le modèle étape par étape dans un flux Power Automate. La seule source utilisée est la documentation officielle de Microsoft sur AI Builder.
Quand un modèle personnalisé est-il préférable à un modèle préconçu ?
AI Builder fournit déjà des modèles préconçus pour les types de documents courants comme les factures, les reçus, les cartes de visite ou les pièces d'identité. Mais dès que vos documents ont une mise en page propre qu'aucun modèle standard ne reconnaît, par exemple un formulaire interne, un bon de livraison avec des colonnes spécifiques à l'entreprise ou un rapport de contrôle sur plusieurs pages, vous avez besoin d'un modèle personnalisé. Selon la vue d'ensemble du modèle de traitement de documents cinq documents d'exemple suffisent généralement pour entraîner un modèle qui fournit des résultats adaptés à votre contenu spécifique. Vous n'avez besoin ni de programmer des champs ni de construire un réseau de neurones à partir de zéro, AI Builder se charge de l'entraînement en arrière-plan.
Les trois types de modèles en un coup d'œil
Lors de la création d'un modèle, vous choisissez, selon le guide de création d'un modèle personnalisé entre trois types de documents :
- Documents à modèle fixe (anciennement « structuré ») : idéal lorsque les champs, tableaux, cases à cocher et signatures se trouvent toujours à des emplacements similaires pour une mise en page donnée. Le modèle peut aussi être entraîné sur plusieurs mises en page fixes en même temps et a un temps d'entraînement court.
- Documents généraux (anciennement « non structuré ») : adapté aux documents sans structure fixe ou au format complexe. Ce type de modèle est particulièrement puissant, mais nécessite en contrepartie un temps d'entraînement nettement plus long.
- Factures : étend le modèle de factures préconçu existant avec des champs supplémentaires ou des exemples de factures qui n'avaient pas été extraites correctement, au lieu d'entraîner un modèle entièrement nouveau.
Exigences relatives à vos documents d'exemple
Avant de commencer, il vaut la peine de consulter les exigences et limitations pour les modèles de traitement de documents. Les points essentiels à retenir :
- Les formats autorisés sont JPG, PNG et PDF, les PDF à base de texte étant préférables aux documents numérisés car la reconnaissance de caractères y est plus précise.
- Les fichiers TIFF ne peuvent pas être utilisés pour l'entraînement, mais un modèle déjà entraîné peut traiter des fichiers TIFF sans problème dans un flux Power Automate.
- Un document individuel ne doit pas dépasser 20 Mo, et les images doivent mesurer entre 50×50 et 10 000×10 000 pixels.
- Chaque collection, c'est-à-dire chaque mise en page distincte, nécessite au moins cinq documents d'exemple, et un modèle peut contenir jusqu'à 200 collections.
- Dans un flux cloud, la limite de champs pouvant être marqués est de 300 par modèle de traitement de documents.
- L'allemand est pris en charge aussi bien pour les documents à modèle fixe que pour les documents généraux, tout comme de nombreuses autres langues.
Créer, entraîner et publier un modèle
L'assistant d'AI Builder vous guide, selon Microsoft, à travers l'ensemble du processus :
1. Se connecter à Power Apps ou Power Automate et ouvrir Plus > Hub IA dans le volet gauche.
2. Sous Découvrir une fonctionnalité d'IA, choisir l'option Modèles d'IA, puis Extraire des informations personnalisées à partir de documents et enfin sélectionner Créer un modèle personnalisé.
3. Définir le type de document (modèle fixe, documents généraux ou factures) et définir les champs, tableaux et cases à cocher à extraire.
4. Créer une collection pour chaque mise en page et charger au moins cinq documents d'exemple. Ensuite, marquer dans les exemples quels passages de texte correspondent à quel champ.
5. Cliquer sur Entraîner. Une fois l'entraînement terminé, vous pouvez tester le modèle directement via Test rapide avec un autre document avant de le publier et de le mettre ainsi en production.
Utiliser le modèle dans Power Automate
Vous utilisez un modèle publié dans un flux cloud via l'action Traiter des documents, qui, selon le guide d'utilisation dans Power Automate porte ce nom depuis mai 2025 et s'appelait auparavant Extraire des informations de documents. Vous sélectionnez votre modèle et le type de document correspondant, associez dans le champ Formulaire le contenu du fichier issu de votre déclencheur, et pouvez éventuellement indiquer dans le paramètre Pages une plage de pages précise, par exemple pour des documents volumineux à plusieurs pages ne contenant qu'un seul formulaire pertinent. Dans les étapes suivantes, tous les champs extraits sont disponibles sous la forme Valeur {nom du champ}, accompagnés chacun d'un score de confiance compris entre 0 et 1, avec lequel vous pouvez rediriger automatiquement les extractions incertaines vers une vérification manuelle.
Pour le traitement ultérieur, quelques expressions proposées directement par Microsoft dans la documentation sont utiles : `replace()` supprime les symboles monétaires ou les espaces, `int()` et `float()` convertissent respectivement les chaînes extraites en nombres, et `formatDateTime()` met les valeurs de date dans le format souhaité. Pour les e-mails entrants via le connecteur Outlook, il est également utile d'ajouter une condition qui filtre les signatures intégrées en ligne à l'aide de l'attribut Pièces jointes est en ligne afin qu'elles ne soient pas traitées par erreur comme un document.
Si vous souhaitez intégrer proprement votre propre modèle dans des processus d'approbation ou de comptabilité existants, un conseil Power Automate de NordFlux vous aide à harmoniser dès le départ les données d'entraînement, la structure des champs et le processus en aval. Vous gardez ainsi le contrôle sur les documents traités automatiquement et ceux envoyés en vérification.
Questions fréquentes
Combien de documents d'exemple me faut-il au minimum ?
Pour chaque collection, c'est-à-dire chaque mise en page distincte, AI Builder exige au moins cinq documents d'exemple au format JPG, PNG ou PDF. Davantage d'exemples avec une variance réaliste dans le remplissage et la qualité d'image améliorent généralement sensiblement la précision de reconnaissance, en particulier pour les documents remplis à la main ou numérisés.
Quelle est la différence entre les documents à modèle fixe et les documents généraux ?
Les documents à modèle fixe conviennent aux documents où les champs se trouvent toujours à une position similaire au sein d'une mise en page, l'entraînement est donc rapide. Les documents généraux sont destinés aux documents sans mise en page fixe ou à la structure complexe, mais impliquent en contrepartie un temps d'entraînement nettement plus long, car le modèle doit réagir de manière plus flexible à des structures changeantes.
Puis-je étendre un modèle de factures existant au lieu d'en entraîner un nouveau ?
Oui. Via l'option Factures vous complétez le modèle de factures préconçu avec des champs supplémentaires ou des exemples de factures qui avaient été mal extraites jusque-là. C'est généralement plus rapide que d'entraîner un modèle entièrement nouveau de type documents à modèle fixe ou documents généraux.
Quels formats de fichiers l'entraînement accepte-t-il ?
Sont autorisés les formats JPG, PNG et PDF, les PDF avec texte intégré offrant de meilleurs résultats que les images numérisées. Les fichiers TIFF ne peuvent certes pas être utilisés pour l'entraînement, mais un modèle déjà entraîné peut les traiter ultérieurement sans problème dans un flux Power Automate.
Quelle est la fiabilité des valeurs extraites ?
Chaque champ extrait fournit, en plus de la valeur, un score de confiance compris entre 0 et 1. Des valeurs proches de 1 indiquent une grande fiabilité de la prédiction. En pratique, il est utile de déclencher automatiquement une vérification manuelle à partir d'un seuil défini, plutôt que de faire aveuglément confiance à chaque valeur extraite.
NordFlux UG (haftungsbeschränkt)
NordFlux construit des employés numériques pour les organisations : des automatisations et des agents KI qui prennent en charge le travail répétitif. Vous gardez le contrôle.
Des questions concrètes sur l’automatisation ou l’IA ?
Lors d’une analyse initiale gratuite, nous discutons directement de votre cas. Sans engagement.