OCR in n8n: Belege auslesen ohne Cloud-Dienst

n8n OCR ohne Cloud: Tesseract oder Ollama-Vision fuer Belege einbinden, inklusive haeufiger Fehler aus der Praxis.

Handgezeichnete Skizze: Eine Lupe schwebt ueber einem Beleg mit Scanlinien, die Lupe ist teal eingefaerbt.

Belege, Rechnungen und Lieferscheine automatisch auslesen, ohne sie an eine Cloud-API zu schicken: Das ist mit OCR in n8n moeglich, entweder mit dem klassischen Tesseract-Engine oder mit einem lokalen KI-Vision-Modell ueber Ollama. Fuer strukturierte Dokumente mit sauberem Druckbild liefert Tesseract brauchbare Ergebnisse, bei schlechten Scans oder komplexen Layouts liegt ein Vision-Modell meist vorn, braucht dafuer aber deutlich mehr Rechenleistung. Stand: August 2026.

Welche Wege gibt es fuer OCR in n8n?

n8n bringt keinen eingebauten OCR-Node mit, deshalb fuehrt der Weg entweder ueber Community-Nodes oder ueber den Execute-Command-Node in Kombination mit einem Kommandozeilen-Tool. Die zweite Variante ist bei selbst gehosteten Instanzen die verbreitetste, weil sie ohne zusaetzliche npm-Pakete auskommt und sich in ein eigenes Docker-Image einbauen laesst.

Wie baut man die Tesseract-Variante auf?

Der Kern ist der Execute Command Node, der Shell-Befehle auf dem Rechner ausfuehrt, auf dem n8n laeuft. Laut Dokumentation ist dieser Node aus Sicherheitsgruenden ab Version 2.0 standardmaessig deaktiviert und auf n8n Cloud gar nicht verfuegbar, weil er in Umgebungen mit nicht vertrauenswuerdigen Nutzern ein Risiko darstellt. Fuer eine selbst gehostete Instanz mit einem festen Nutzerkreis laesst er sich aber gezielt aktivieren.

  • Binaerdaten auf die Platte schreiben: Der Read/Write Files from Disk Node speichert das eingehende PDF oder Bild als Datei, bevor Tesseract darauf zugreifen kann. Auf n8n Cloud ist der Zugriff auf `/home/node/` beschraenkt, self-hosted laesst sich der Bereich per Umgebungsvariable einschraenken oder erweitern.
  • PDF zu Bild konvertieren: Fuer mehrseitige PDFs braucht Tesseract vorher ein Bildformat, dafuer eignet sich `pdftoppm` aus dem Paket poppler-utils, das per eigenem Dockerfile in das n8n-Image installiert wird.
  • Text erkennen: Der eigentliche `tesseract`-Befehl liest das Bild und gibt den erkannten Text zurueck. Tesseract ist ein quelloffener OCR-Engine, der laut Projektbeschreibung auf GitHub Text in mehr als 100 Sprachen erkennt.
  • Ergebnis zurueck einlesen: Ein zweiter Read/Write-Files-Node liest die Textdatei wieder ein und uebergibt sie an die naechsten Workflow-Schritte.

Wo liegen die Grenzen von Tesseract in der Praxis?

Tesseract stoesst bei schlecht gescannten oder komplex layouteten Belegen an Grenzen. In der n8n-Community wird das offen so beschrieben: Ein Nutzer berichtet im Thread Local OCR in n8n with Ollama, die Tesseract-Qualitaet sei bei seinen Dokumenten schlicht schlecht gewesen, waehrend Vision-Modelle wie minicpm-v oder llava-llama3 auf dichtem und strukturiertem Text besser abschneiden. Diese Beobachtung stammt aus der Praxis einzelner Nutzer und ist keine allgemeingueltige Benchmark, deckt sich aber mit der bekannten Schwaeche klassischer OCR-Engines bei unsauberen Vorlagen.

Was ist die Ollama-Vision-Alternative, und wo hakt es dort?

Statt Tesseract laesst sich ein lokales Vision-Modell ueber Ollama einsetzen, das Bilder direkt beschreiben und Text daraus extrahieren kann. Auch dieser Weg hat laut Community-Berichten praktische Stolpersteine, die selten dokumentiert sind: grosse mehrseitige PDFs sprengen das Kontextfenster des Modells und bringen den Ollama-Container ins Stocken, wenn alle Seiten auf einmal geschickt werden. Die gaengige Loesung ist, Seite fuer Seite einzeln zu verarbeiten und zwischen den Anfragen einen Wait-Node einzubauen, damit der lokale Container nicht ueberlastet wird. Fuer beide Varianten gilt: Wer haeufiger `/tmp` oder aehnliche Pfade fuer Zwischendateien nutzt, sollte pruefen, ob die Umgebungsvariable zur Einschraenkung des Dateizugriffs das zulaesst.

Lohnt sich der Aufwand gegenueber einer Cloud-OCR-API?

Der Aufwand lohnt sich vor allem, wenn Belege aus DSGVO- oder Vertraulichkeitsgruenden nicht an einen externen Anbieter geschickt werden sollen. Wer diese Anforderung nicht hat, kommt mit einer Cloud-OCR-API oft schneller zu stabileren Ergebnissen, weil dort Modellpflege und Skalierung wegfallen. Fuer Unternehmen, die ihre Automatisierung ohnehin selbst hosten und die Kontrolle ueber ihre Daten behalten wollen, ist die lokale Loesung der konsequente naechste Schritt. Wer eine n8n-Instanz mit einer sauberen Basis fuer solche Workflows aufsetzen laesst, findet dazu Hintergrund unter /leistungen/n8n.

Haeufige Fragen zu OCR in n8n

Brauche ich fuer OCR in n8n zwingend den Execute Command Node?

Nein, es gibt auch Community-Nodes wie n8n-nodes-tesseractjs, die Tesseract direkt als Node kapseln, ohne dass Shell-Befehle noetig sind. Der Execute-Command-Weg ist aber flexibler, weil er sich mit jedem Kommandozeilen-Tool kombinieren laesst, nicht nur mit Tesseract.

Funktioniert OCR mit Tesseract auf n8n Cloud?

Nein, der Execute Command Node ist auf n8n Cloud grundsaetzlich nicht verfuegbar, und der Dateizugriff ist auf einen eingeschraenkten Pfad begrenzt. Fuer diesen Anwendungsfall braucht es eine selbst gehostete n8n-Instanz mit eigenem Docker-Image.

Ist ein Vision-Modell ueber Ollama immer die bessere Wahl als Tesseract?

Nicht immer, denn Vision-Modelle brauchen deutlich mehr Rechenleistung und sind bei sehr schlechten Scans ebenfalls nicht fehlerfrei. Fuer klar gedruckte, saubere Dokumente reicht Tesseract oft aus, bei dichten oder unsauberen Vorlagen berichten Praxisanwender von besseren Ergebnissen mit Vision-Modellen.

Wie gehe ich mit mehrseitigen PDFs um, ohne den lokalen Server zu ueberlasten?

Die in der Praxis bewaehrte Vorgehensweise ist, jede Seite einzeln zu verarbeiten statt das gesamte Dokument auf einmal zu senden, und zwischen den Verarbeitungsschritten kurze Wartezeiten einzubauen. Das verhindert, dass der Ollama-Container oder der Tesseract-Prozess durch zu viele gleichzeitige Anfragen blockiert.

Simon Glowik, Gründer von NordFlux
Über den Autor

Gründer von NordFlux. Sieben Jahre Erfahrung von Web und SEO bis zur Automatisierung im Konzern-Maßstab, heute pragmatisch für den Mittelstand und mit deutscher Datenhoheit.

Zertifizierungen

  • Microsoft zertifiziert — PL-900 und AZ-900
  • UiPath zertifiziert — Automation Developer Associate
Alle Beiträge
Kostenloses Erstgespräch

Konkrete Fragen zu Automatisierung oder KI?

Im kostenlosen Erstgespräch (30 Minuten) besprechen wir Ihren Fall direkt. Unverbindlich.