RAG mit n8n bauen: Firmenwissen als Chatbot, Schritt für Schritt

So bauen Sie mit n8n einen RAG-Chatbot: Vector Store, Embeddings und Tool-Anbindung Schritt für Schritt erklärt.

Retrieval-Augmented Generation (RAG) verbindet ein Sprachmodell mit den eigenen Firmendokumenten, damit ein Chatbot Antworten auf Basis von echtem internem Wissen liefert statt nur auf Basis des allgemeinen Trainingswissens des Modells. In n8n bauen Sie ein RAG-System in der Praxis als zwei getrennte Workflows: Der erste Workflow lädt Dokumente, zerlegt sie in Textabschnitte, wandelt diese über ein Embedding-Modell in Vektoren um und speichert sie in einem Vector-Store-Node. Der zweite Workflow verbindet diesen Vector Store über einen AI Agent Node als durchsuchbares Werkzeug, sodass der Chatbot bei jeder Anfrage passende Textstellen selbst nachschlägt und in seine Antwort einbaut. Stand: Juli 2026.

Welche Bausteine braucht ein RAG-Workflow in n8n?

Ein RAG-Workflow in n8n besteht laut n8n-Dokumentation aus vier zusammenspielenden Komponenten: Document Loader, Text Splitter, Embeddings und Vector Store mit Retriever. Der Document Loader holt die externen Ausgangsdaten, etwa aus einer Datei, einem Webhook oder einer Datenbankabfrage. Der Text Splitter zerlegt lange Dokumente in kleinere Abschnitte, sogenannte Chunks, damit das Embedding-Modell sie sinnvoll verarbeiten kann. Embeddings wandeln Text in Vektoren um, also in numerische Darstellungen von Bedeutung, wobei n8n laut Dokumentation ausschließlich Text-Embeddings unterstützt. Der Retriever schließlich holt bei einer Anfrage die passenden Vektoren aus der Datenbank zurück und übersetzt sie wieder in nutzbaren Text. Details zu diesen Komponenten beschreibt die offizielle Dokumentation unter Store and search data with vectors.

Wie bauen Sie den ersten Workflow, um Dokumente in den Vector Store zu laden?

Für die Ingestion fügen Sie einen Vector-Store-Node mit der Operation "Insert Documents" hinzu, verbinden ein Embedding-Modell und ergänzen einen Default Data Loader Node für die Aufteilung in Chunks.

  • Chunkgröße: Die n8n-Dokumentation empfiehlt Abschnitte von 200 bis 500 Token für eine feingranulare Suche, ergänzt um eine gewisse Überlappung zwischen den Chunks, damit der Kontext an den Grenzen nicht verloren geht.
  • Splitter-Wahl: Zur Auswahl stehen der Character Text Splitter, der nach Zeichenlänge trennt, der Token Text Splitter, der nach Tokenzahl trennt, und der Recursive Character Text Splitter, den n8n für die meisten Anwendungsfälle empfiehlt, weil er sich an Markdown-, HTML- oder Code-Strukturen orientiert.
  • Metadaten: Optional lassen sich Chunks mit Zusatzinformationen wie Quelle, Dokumenttyp oder Datum anreichern, was spätere Filterung erleichtert.
  • Clear Store: Eine Option im Insert-Modus, um den bestehenden Speicher vor dem erneuten Befüllen zu leeren.

Zum schnellen Testen eignet sich der Simple Vector Store (In-Memory) Node, der Vektoren direkt im Arbeitsspeicher von n8n hält. Laut der offiziellen Node-Dokumentation ist dieser Node ausdrücklich nur für die Entwicklung gedacht.

Wie machen Sie den Vector Store für einen KI-Chatbot durchsuchbar?

Für den Abruf verbinden Sie denselben Vector-Store-Node im Modus "Retrieve Documents (As Tool for AI Agent)" mit einem AI Agent Node, der die Suche dann selbstständig auslöst, wenn er sie für eine Antwort braucht. In diesem Modus konfigurieren Sie Name und Description des Tools, damit der Agent versteht, wann er darauf zugreifen soll, sowie ein Limit für die Anzahl der zurückgegebenen Chunks und optional "Include Metadata", um Quellenangaben mitzuliefern. Wichtig ist laut Dokumentation, dass Sie beim Abfragen dasselbe Embedding-Modell verwenden wie beim Einfügen der Daten, sonst passen Vektorräume nicht zusammen und die Suche liefert schlechte Treffer. Alternativ gibt es die direkte Abfrage über die Operation "Get Many", bei der Sie selbst eine feste Suchanfrage stellen, statt sie dem Agenten zu überlassen. Der genaue Ablauf ist in Retrieve relevant context beschrieben. Wer diesen Aufbau nicht selbst pflegen möchte, findet in der Leistung KI-Agenten von NordFlux eine Umsetzung mit Festpreis und deutscher Datenhoheit.

Wo liegen die Grenzen von RAG mit n8n?

RAG ist kein Wundermittel: Die Qualität der Antworten hängt direkt von der Struktur der Quelldokumente ab, und der in n8n eingebaute Simple Vector Store ist laut Dokumentation ausdrücklich nur für die Entwicklung gedacht, weil Daten bei einem Neustart verloren gehen und laut Dokumentation instanzweit für alle Nutzerinnen und Nutzer sichtbar sind, unabhängig von den Berechtigungen des einzelnen Workflows. Für den Produktivbetrieb brauchen Sie deshalb einen persistenten externen Vector Store, für den n8n eigene Nodes bereitstellt, etwa für PGVector oder Azure AI Search. Schlecht strukturierte Ausgangsdokumente, etwa gescannte PDFs ohne echte Textebene oder große, unübersichtliche Tabellen, führen zu ungünstig geschnittenen Chunks und damit zu ungenauen oder lückenhaften Antworten des Chatbots. Saubere, gut gegliederte Quelldaten sind für die Ergebnisqualität oft wichtiger als die Wahl eines größeren Embedding-Modells.

Häufige Fragen zu RAG mit n8n

Was ist der Unterschied zwischen dem Vector Store als Tool und der direkten Abfrage über Get Many?

Bei "Get Many" stellen Sie dem Vector Store eine feste, fest verdrahtete Suchanfrage, während der Modus "Retrieve Documents (As Tool for AI Agent)" die Entscheidung dem Agenten überlässt. Der Agent prüft anhand von Name und Description des Tools selbst, ob und wann eine Suche im Vector Store für die aktuelle Nutzerfrage überhaupt sinnvoll ist. Das macht den Aufbau flexibler für einen Chatbot, der auch allgemeine Fragen ohne Dokumentbezug beantworten soll.

Welches Embedding-Modell sollten Sie für einen Firmenwissen-Chatbot wählen?

Kleinere Embedding-Modelle sind laut n8n-Dokumentation schneller und günstiger und eignen sich für allgemeine Dokumente, während größere Modelle ein besseres semantisches Verständnis für komplexe Fachthemen bieten. Entscheidend ist in jedem Fall, dass Sie beim Einfügen der Daten und beim späteren Abfragen dasselbe Modell verwenden, da unterschiedliche Modelle unterschiedliche Vektorräume erzeugen.

Kann ich den Simple Vector Store von n8n produktiv einsetzen?

Nein, laut n8n-Dokumentation ist der Simple Vector Store (In-Memory) Node ausdrücklich nur für die Entwicklung gedacht, weil Daten bei einem Neustart der Instanz verloren gehen und laut Dokumentation instanzweit für alle Nutzerinnen und Nutzer sichtbar sind. Für einen produktiv genutzten Firmenwissen-Chatbot benötigen Sie einen persistenten, extern gehosteten Vector Store.

Wie groß sollten die Textabschnitte für die Suche sein?

Für eine feingranulare Suche empfiehlt die n8n-Dokumentation Chunkgrößen zwischen 200 und 500 Token, kombiniert mit einer gewissen Überlappung zwischen benachbarten Abschnitten, damit an den Chunk-Grenzen kein Kontext verloren geht. Als Splitter-Strategie schlägt n8n für die meisten Anwendungsfälle den Recursive Character Text Splitter vor, weil er sich an der natürlichen Struktur des Dokuments orientiert statt willkürlich nach Zeichenzahl zu trennen.

Über NordFlux

NordFlux UG (haftungsbeschränkt)

NordFlux baut Organisationen digitale Mitarbeiter: Automatisierungen und KI-Agenten, die wiederkehrende Arbeit abnehmen. Sie behalten die Kontrolle.

Mehr über uns
Kostenlose Erstanalyse

Konkrete Fragen zu Automatisierung oder KI?

In der kostenlosen Erstanalyse besprechen wir Ihren Fall direkt. Unverbindlich.