Entrenar tu propio modelo de procesamiento de documentos en AI Builder
Cómo entrenar en AI Builder tu propio modelo de procesamiento de documentos para documentos específicos de tu empresa y usarlo en Power Automate.
Las facturas tienen un aspecto distinto según cada proveedor, pero al menos para las facturas AI Builder cuenta con un modelo de IA ya preparado. Para documentos específicos de la empresa, como albaranes internos, protocolos de mantenimiento, formularios de pedido individuales o informes de inspección, no existe ningún modelo predefinido que conozca los campos adecuados. Precisamente para eso, en AI Builder se puede entrenar un modelo de procesamiento de documentos personalizado que extrae exactamente la información que realmente se necesita en tu empresa, sin necesidad de conocimientos de ciencia de datos.
Este artículo muestra cuándo merece la pena un modelo propio, qué tipos de modelo puedes elegir, qué requisitos deben cumplir tus documentos de ejemplo y cómo entrenar, publicar y luego usar el modelo paso a paso en un flujo de Power Automate. La única fuente utilizada es la documentación oficial de Microsoft sobre AI Builder.
¿Cuándo merece la pena un modelo propio en lugar de uno predefinido?
AI Builder ya ofrece modelos predefinidos para tipos de documentos habituales como facturas, recibos, tarjetas de visita o documentos de identidad. Pero en cuanto tus documentos tengan un diseño propio que ningún modelo estándar reconozca, por ejemplo un formulario interno, un albarán con columnas específicas de la empresa o un informe de inspección de varias páginas, necesitas un modelo propio. Según la descripción general del modelo de procesamiento de documentos suelen bastar cinco documentos de ejemplo para entrenar un modelo que ofrezca resultados adaptados a tu contenido específico. Para ello no necesitas programar campos ni construir una red neuronal desde cero, AI Builder se encarga del entrenamiento en segundo plano.
Los tres tipos de modelo de un vistazo
Al crear un modelo, según la guía para crear un modelo personalizado eliges entre tres tipos de documento:
- Documentos de plantilla fija (antes «estructurado»): ideal cuando los campos, tablas, casillas de verificación y firmas siempre aparecen en posiciones similares para un diseño determinado. El modelo también se puede entrenar simultáneamente con varios diseños fijos y tiene un tiempo de entrenamiento corto.
- Documentos generales (antes «no estructurado»): adecuado para documentos sin estructura fija o con un formato complejo. Este tipo de modelo es especialmente potente, pero a cambio necesita un tiempo de entrenamiento considerablemente más largo.
- Facturas: amplía el modelo de facturas predefinido ya existente con campos adicionales o con ejemplos de facturas que hasta ahora no se habían extraído correctamente, en lugar de entrenar un modelo completamente nuevo.
Requisitos de tus documentos de ejemplo
Antes de empezar, merece la pena echar un vistazo a los requisitos y limitaciones para los modelos de procesamiento de documentos. Los puntos más importantes son:
- Los formatos permitidos son JPG, PNG y PDF, siendo preferibles los PDF basados en texto a los documentos escaneados porque el reconocimiento de caracteres es más preciso.
- Los archivos TIFF no se pueden usar para el entrenamiento, pero un modelo ya entrenado puede procesar archivos TIFF sin problemas en un flujo de Power Automate.
- Un solo documento no puede superar los 20 MB, y las imágenes deben tener entre 50×50 y 10.000×10.000 píxeles.
- Cada colección, es decir, cada diseño independiente, requiere al menos cinco documentos de ejemplo, y un modelo puede contener hasta 200 colecciones.
- En un flujo en la nube, el límite de campos marcables es de 300 por modelo de procesamiento de documentos.
- El alemán es compatible tanto con los documentos de plantilla fija como con los documentos generales, al igual que numerosos otros idiomas.
Crear, entrenar y publicar un modelo
Según Microsoft, el asistente de AI Builder te guía a través de todo el proceso:
1. Inicia sesión en Power Apps o Power Automate y abre Más > Centro de IA en el panel izquierdo.
2. En Descubrir una funcionalidad de IA elige la opción Modelos de IA, luego Extraer información personalizada de documentos y a continuación selecciona Crear un modelo personalizado.
3. Define el tipo de documento (plantilla fija, documentos generales o facturas) y define los campos, tablas y casillas de verificación que se van a extraer.
4. Crea una colección para cada diseño y sube al menos cinco documentos de ejemplo. Después marca en los ejemplos qué fragmentos de texto pertenecen a qué campo.
5. Haz clic en Entrenar. Una vez finalizado el entrenamiento, puedes comprobar el modelo directamente mediante Prueba rápida con otro documento antes de publicarlo y habilitarlo así para el uso en producción.
Usar el modelo en Power Automate
Un modelo publicado se usa en un flujo en la nube mediante la acción Procesar documentos, que, según la guía de uso en Power Automate se llama así desde mayo de 2025 y antes se llamaba Extraer información de documentos. Seleccionas tu modelo y el tipo de documento correspondiente, vinculas en el campo Formulario el contenido del archivo procedente de tu desencadenador y, opcionalmente, puedes indicar en el parámetro Páginas un rango de páginas concreto, por ejemplo en documentos extensos de varias páginas con un único formulario relevante. En los pasos siguientes tienes a tu disposición todos los campos extraídos como Valor de {nombre de campo}, cada uno con una puntuación de confianza entre 0 y 1, con la que puedes derivar automáticamente las extracciones inciertas a una revisión manual.
Para el procesamiento posterior son útiles algunas expresiones que Microsoft propone directamente en la documentación: `replace()` elimina símbolos de moneda o espacios, `int()` y `float()` convierten respectivamente las cadenas extraídas en números, y `formatDateTime()` da a los valores de fecha el formato deseado. En los correos entrantes a través del conector de Outlook, también merece la pena añadir una condición que filtre las firmas incrustadas en línea mediante el atributo Los datos adjuntos son en línea para que no se procesen por error como un documento.
Si quieres integrar tu propio modelo de forma limpia en procesos de aprobación o contabilidad ya existentes, una consultoría de Power Automate de NordFlux te ayuda a alinear desde el principio los datos de entrenamiento, la estructura de campos y el proceso posterior. Así mantienes el control sobre qué documentos se procesan automáticamente y cuáles se envían a revisión.
Preguntas frecuentes
¿Cuántos documentos de ejemplo necesito como mínimo?
Para cada colección, es decir, cada diseño independiente, AI Builder exige al menos cinco documentos de ejemplo en formato JPG, PNG o PDF. Más ejemplos con una varianza realista en el modo de rellenado y en la calidad de imagen suelen mejorar notablemente la precisión de reconocimiento, especialmente en documentos rellenados a mano o escaneados.
¿Cuál es la diferencia entre documentos de plantilla fija y documentos generales?
Los documentos de plantilla fija son adecuados para documentos en los que los campos siempre aparecen en una posición similar dentro de un diseño, por lo que el entrenamiento es correspondientemente rápido. Los documentos generales están pensados para documentos sin diseño fijo o con una estructura compleja, pero a cambio requieren un tiempo de entrenamiento considerablemente más largo, porque el modelo debe reaccionar de forma más flexible ante estructuras cambiantes.
¿Puedo ampliar un modelo de facturas existente en lugar de entrenar uno nuevo?
Sí. Mediante la opción Facturas amplías el modelo de facturas predefinido con campos adicionales o con ejemplos de facturas que hasta ahora se habían extraído incorrectamente. Esto suele ser más rápido que entrenar un modelo completamente nuevo del tipo documentos de plantilla fija o documentos generales.
¿Qué formatos de archivo acepta el entrenamiento?
Se permiten JPG, PNG y PDF, y los PDF con texto incrustado ofrecen mejores resultados que las imágenes escaneadas. Los archivos TIFF no se pueden usar para el entrenamiento, pero un modelo ya entrenado puede procesarlos más tarde sin problemas en un flujo de Power Automate.
¿Cómo de fiables son los valores extraídos?
Cada campo extraído ofrece, además del valor, una puntuación de confianza entre 0 y 1. Los valores cercanos a 1 indican una alta fiabilidad de la predicción. En la práctica, merece la pena activar automáticamente una revisión manual a partir de un umbral definido, en lugar de confiar ciegamente en cada valor extraído.
NordFlux UG (haftungsbeschränkt)
NordFlux crea empleados digitales para las organizaciones: automatizaciones y agentes KI que asumen el trabajo repetitivo. Usted mantiene el control.
¿Preguntas concretas sobre automatización o IA?
En un análisis inicial gratuito hablamos directamente de su caso. Sin compromiso.