Automatisation du web dans n8n: HTML-Node, Puppeteer et Playwright en comparaison

n8n lit les pages web avec le noeud HTML ou utilise Playwright/Puppeteer via un service de navigateur propre. Les différences en un coup d'oeil.

Pour un web scraping simple sans rendu JavaScript, le noeud HTML intégré de n8n avec les sélecteurs CSS suffit amplement. Pour les portails qui chargent d'abord le contenu via JavaScript, vous avez besoin d'un vrai navigateur en arrière-plan, que n8n ne fournit pas. En pratique, les utilisateurs de n8n résolvent généralement ce problème via un conteneur Browserless ou Playwright auto-hébergé, qu'ils appellent via le noeud HTTP-Request, au lieu de laisser Puppeteer ou Playwright s'exécuter directement dans le noeud Code. État: août 2026.

Que peut faire le noeud HTML intégré?

Selon la documentation officielle, le noeud HTML couvre trois tâches: extraire le contenu HTML d'une source à l'aide de sélecteurs CSS, générer un modèle HTML à partir des données du flux de travail, ou convertir le contenu en un tableau HTML. Lors de l'extraction, vous sélectionnez les éléments souhaités à l'aide de sélecteurs CSS et spécifiez si les valeurs d'attribut, le contenu HTML, le texte brut ou les valeurs de formulaire doivent être retournés. L'option « Return Array » détermine si plusieurs résultats sont renvoyés sous forme de tableau ou fusionnés en une seule chaîne, et vous disposez également de « Trim Values » et « Clean Up Text » pour nettoyer les valeurs extraites.documentation officielle

Pourquoi le noeud HTML ne suffit-il pas pour de nombreux sites web modernes?

Le noeud HTML traite uniquement les sources HTML que vous transmettez comme propriété JSON ou comme fichier binaire, il ne dispose pas lui-même d'un navigateur ni d'exécution JavaScript. Pour une page rendue côté serveur classique, cela suffit car le noeud HTTP-Request charge le code HTML fini via un appel REST et le noeud HTML peut l'évaluer directement. Si cependant une page construit son contenu d'abord dans le navigateur via JavaScript, l'appel HTTP pur ne fournit qu'un squelette vide, et le noeud HTML n'a rien à évaluer.

Comment les utilisateurs de n8n intègrent-ils Playwright ou Puppeteer en pratique?

Un modèle récurrent s'est établi dans la communauté n8n: au lieu d'exécuter Playwright directement dans le noeud Code, un conteneur Browserless auto-hébergé avec Playwright s'exécute en arrière-plan, que n8n appelle via le noeud HTTP-Request. Un exemple bien documenté dans le forum n8n utilise pour cela des points de terminaison tels que « /content », « /screenshot » et « /pdf », sécurisés via un identifiant d'authentification Header avec jeton personnel. Cette approche sépare proprement l'automatisation du navigateur, qui consomme beaucoup de mémoire, du flux de travail n8n réel, qui ne traite que les réponses HTTP.

Existe-t-il un noeud Playwright prêt à l'emploi pour n8n?

n8n n'offre pas de noeud Playwright officiel prêt à l'emploi. Dans un fil de discussion sur le forum n8n concernant l'utilisation locale de Playwright sans service payant, il est clair que les utilisateurs s'arrangent généralement par eux-mêmes, soit avec un noeud personnalisé basé sur Playwright, soit avec la route HTTP Browserless. Quiconque a besoin régulièrement de captures d'écran, de PDF ou de contenu de pages chargées en JavaScript ne peut guère éviter un service de navigateur auto-géré, qu'il s'agisse d'un noeud personnel ou d'un appel HTTP.

Questions fréquemment posées sur le web scraping dans n8n

Le noeud HTML peut-il lire directement les pages chargées en JavaScript?

Non. Le noeud HTML n'évalue que la source HTML qu'il reçoit comme données JSON ou binaires, il n'exécute pas lui-même JavaScript. Pour les pages avec du contenu chargé dynamiquement, vous avez besoin d'un navigateur réel au préalable, par exemple via un service Browserless ou Playwright auto-hébergé.

Ai-je besoin d'un service payant pour le web scraping dans n8n?

Non. Les solutions documentées dans la communauté reposent sur un conteneur Browserless ou Playwright auto-hébergé que vous gérez via Docker et appelez via le noeud HTTP-Request. Les coûts d'exploitation se limitent alors à votre propre infrastructure serveur, par exemple dans le cadre d'une installation n8n existante.

Quel est l'effet de l'option « Return Array » dans le noeud HTML?

Elle détermine si plusieurs résultats trouvés via un sélecteur CSS sont retournés sous forme de tableau avec plusieurs entrées ou fusionnés en une seule chaîne. Pour les listes dont vous souhaitez traiter ultérieurement des éléments individuels, la variante de tableau est généralement le choix le plus pratique.

Sur quoi devriez-vous faire attention avec le scraping basé sur des sélecteurs?

Le scraping basé sur des sélecteurs avec des sélecteurs CSS se casse régulièrement en pratique dès que le site cible change sa mise en page ou ses noms de classe. Les rapports de la communauté sur les flux de travail Puppeteer et Playwright confirment ce schéma de manière répétée, c'est pourquoi un flux de travail de scraping productif devrait prévoir une certaine maintenance au lieu de rester inchangé une fois configuré.

Simon Glowik, fondateur de NordFlux
À propos de l’auteur

Fondateur de NordFlux. Sept ans d'expérience, du web et du SEO jusqu'à l'automatisation à l'échelle d'un groupe, aujourd'hui pragmatique pour les PME et avec une souveraineté des données allemande.

Certifications

  • Certifié Microsoft — PL-900 et AZ-900
  • Certifié UiPath — Automation Developer Associate
Tous les articles
Analyse initiale gratuite

Des questions concrètes sur l’automatisation ou l’IA ?

Lors d’une analyse initiale gratuite, nous discutons directement de votre cas. Sans engagement.