OCR en n8n: extraer recibos sin servicio en la nube
OCR en n8n sin nube: integra Tesseract u Ollama Vision para recibos, incluidos errores frecuentes de la práctica.

Extraer automáticamente recibos, facturas y albaranes sin enviarlos a una API en la nube: esto es posible con OCR en n8n, ya sea con el motor clásico Tesseract o con un modelo de visión de IA local a través de Ollama. Para documentos estructurados con una impresión limpia, Tesseract ofrece resultados útiles; en escaneos deficientes o con diseños complejos, un modelo de visión suele ir por delante, pero requiere bastante más potencia de cálculo. Fecha: agosto de 2026.
¿Qué vías existen para el OCR en n8n?
n8n no incluye un nodo OCR integrado, por lo que el camino pasa o bien por nodos de la comunidad o por el nodo Execute Command combinado con una herramienta de línea de comandos. La segunda opción es la más habitual en instancias autoalojadas, porque no requiere paquetes npm adicionales y se puede integrar en una imagen Docker propia.
¿Cómo se monta la variante con Tesseract?
El núcleo es el Execute Command Node, que ejecuta comandos de shell en la máquina donde se ejecuta n8n. Según la documentación, este nodo está desactivado de forma predeterminada por motivos de seguridad desde la versión 2.0 y no está disponible en absoluto en n8n Cloud, porque supone un riesgo en entornos con usuarios no confiables. Sin embargo, para una instancia autoalojada con un círculo fijo de usuarios se puede activar de forma específica.
- Escribir los datos binarios en disco: El Read/Write Files from Disk Node guarda el PDF o la imagen entrante como archivo antes de que Tesseract pueda acceder a él. En n8n Cloud, el acceso está limitado a `/home/node/`; en modo autoalojado, esta zona se puede restringir o ampliar mediante una variable de entorno.
- Convertir el PDF en imagen: Para PDF de varias páginas, Tesseract necesita primero un formato de imagen; para ello es adecuado `pdftoppm` del paquete poppler-utils, instalado en la imagen de n8n mediante un Dockerfile propio.
- Reconocer el texto: El comando `tesseract` propiamente dicho lee la imagen y devuelve el texto reconocido. Tesseract es un motor OCR de código abierto que, según la descripción del proyecto en GitHub reconoce texto en más de 100 idiomas.
- Volver a leer el resultado: Un segundo nodo Read/Write Files vuelve a leer el archivo de texto y lo pasa a los siguientes pasos del flujo de trabajo.
¿Dónde están los límites de Tesseract en la práctica?
Tesseract alcanza sus límites con recibos mal escaneados o con diseños complejos. En la comunidad de n8n esto se describe abiertamente: un usuario relata en el hilo Local OCR in n8n with Ollama que la calidad de Tesseract fue sencillamente mala en sus documentos, mientras que modelos de visión como minicpm-v o llava-llama3 rinden mejor con texto denso y estructurado. Esta observación procede de la experiencia práctica de usuarios individuales y no es un benchmark de validez general, pero coincide con la debilidad conocida de los motores OCR clásicos ante plantillas poco limpias.
¿Cuál es la alternativa de Ollama Vision, y dónde falla?
En lugar de Tesseract, se puede usar un modelo de visión local a través de Ollama, capaz de describir imágenes directamente y extraer texto de ellas. Según informes de la comunidad, este camino también tiene obstáculos prácticos raramente documentados: los PDF grandes de varias páginas superan la ventana de contexto del modelo y hacen que el contenedor de Ollama se bloquee cuando se envían todas las páginas a la vez. La solución habitual es procesar página por página de forma individual e insertar un nodo Wait entre las solicitudes para que el contenedor local no se sobrecargue. Para ambas variantes: quien use con frecuencia `/tmp` o rutas similares para archivos temporales debería comprobar si la variable de entorno que restringe el acceso a archivos lo permite.
¿Merece la pena el esfuerzo frente a una API de OCR en la nube?
El esfuerzo merece la pena sobre todo si los recibos no deben enviarse a un proveedor externo por motivos de RGPD o de confidencialidad. Quien no tenga este requisito suele llegar más rápido a resultados estables con una API de OCR en la nube, ya que ahí se elimina el mantenimiento de modelos y el escalado. Para empresas que ya alojan su propia automatización y quieren mantener el control sobre sus datos, la solución local es el siguiente paso lógico. Quien quiera que se le configure una instancia de n8n con una base sólida para este tipo de workflows encontrará información de fondo en /leistungen/n8n.
Preguntas frecuentes sobre OCR en n8n
¿Necesito obligatoriamente el nodo Execute Command para el OCR en n8n?
No, también existen nodos de la comunidad como n8n-nodes-tesseractjs, que encapsulan Tesseract directamente como nodo, sin necesitar comandos de shell. Sin embargo, la vía de Execute Command es más flexible, porque se puede combinar con cualquier herramienta de línea de comandos, no solo con Tesseract.
¿Funciona el OCR con Tesseract en n8n Cloud?
No, el nodo Execute Command no está disponible en absoluto en n8n Cloud, y el acceso a archivos está limitado a una ruta restringida. Para este caso de uso se necesita una instancia de n8n autoalojada con una imagen Docker propia.
¿Es un modelo de visión a través de Ollama siempre la mejor opción frente a Tesseract?
No siempre, porque los modelos de visión necesitan bastante más potencia de cálculo y tampoco están libres de errores con escaneos muy deficientes. Para documentos nítidos y bien impresos, Tesseract suele ser suficiente; con plantillas densas o poco limpias, los usuarios de la práctica reportan mejores resultados con modelos de visión.
¿Cómo manejo los PDF de varias páginas sin sobrecargar el servidor local?
El procedimiento probado en la práctica es procesar cada página individualmente en lugar de enviar todo el documento de una vez, e insertar tiempos de espera cortos entre los pasos de procesamiento. Esto evita que el contenedor de Ollama o el proceso de Tesseract se bloqueen por demasiadas solicitudes simultáneas.
Simon Glowik
Fundador de NordFlux. Siete años de experiencia, desde la web y el SEO hasta la automatización a escala de grupo, hoy de forma pragmática para las pymes y con soberanía de datos alemana.
Certificaciones
- Certificado Microsoft — PL-900 y AZ-900
- Certificado UiPath — Automation Developer Associate
¿Preguntas concretas sobre automatización o IA?
En una primera reunión gratuita de 30 minutos hablamos directamente de su caso. Sin compromiso.