Automatización web en n8n: Comparación de nodos HTML, Puppeteer y Playwright
n8n lee páginas web con el nodo HTML o utiliza Playwright/Puppeteer a través de un servicio de navegador propio. Las diferencias de un vistazo.
Para web scraping simple sin renderización de JavaScript, el nodo HTML integrado de n8n con selectores CSS es completamente suficiente. Para portales que cargan contenido inicialmente mediante JavaScript, además necesita un navegador real en segundo plano, que n8n no incluye. En la práctica, los usuarios de n8n generalmente resuelven esto usando un contenedor Browserless o Playwright auto-hospedado, al que acceden a través del nodo HTTP-Request en lugar de ejecutar Puppeteer o Playwright directamente en el nodo Code. Estado: agosto de 2026.
¿Qué puede hacer el nodo HTML integrado?
De acuerdo con la documentación oficial, el nodo HTML realiza tres tareas: extraer contenido HTML usando selectores CSS de una fuente, generar una plantilla HTML a partir de datos del flujo de trabajo, o convertir contenido a una tabla HTML. Al extraer, selecciona los elementos deseados usando selectores CSS y especifica si desea devolver valores de atributos, contenido HTML, texto puro o valores de formularios. La opción "Return Array" determina si varios resultados se devuelven como una matriz o como una única cadena fusionada, además están disponibles "Trim Values" y "Clean Up Text" para limpiar los valores extraídos.
¿Por qué el nodo HTML no es suficiente para muchas páginas web modernas?
El nodo HTML procesa exclusivamente fuentes HTML que le proporciona como propiedad JSON o como archivo binario, no incluye un navegador ni ejecución de JavaScript. Para una página renderizada clásicamente en el servidor, esto es suficiente, porque el nodo HTTP-Request descarga el código HTML finalizado mediante una llamada REST y el nodo HTML puede evaluarlo directamente. Sin embargo, si una página construye su contenido en el navegador mediante JavaScript, la llamada HTTP pura solo proporciona un esqueleto vacío que el nodo HTML no puede evaluar.
¿Cómo integran los usuarios de n8n Playwright o Puppeteer en la práctica?
En la comunidad de n8n se ha establecido un patrón recurrente: en lugar de ejecutar Playwright directamente en el nodo Code, un contenedor Browserless auto-hospedado con Playwright se ejecuta en segundo plano, que n8n accede a través del nodo HTTP-Request. Un ejemplo ampliamente documentado en el foro de n8n utiliza para ello puntos de acceso como "/content", "/screenshot" y "/pdf", asegurados mediante una credencial de autenticación de encabezado con token propio. Este enfoque separa limpiamente la automatización del navegador, que requiere mucha memoria, del flujo de trabajo n8n real, que solo procesa respuestas HTTP.
¿Existe un nodo Playwright listo para n8n?
n8n no ofrece un nodo Playwright oficial y completo. En un hilo en el foro de n8n sobre el uso local de Playwright sin servicio pagado se ve que los usuarios generalmente se ayudan a sí mismos, ya sea con un nodo personalizado propio basado en Playwright o con la ruta HTTP de Browserless. Quien necesita regularmente capturas de pantalla, PDF o contenido de páginas cargadas de JavaScript, difícilmente puede prescindir de un servicio de navegador auto-operado, independientemente de si es como nodo propio o como llamada HTTP.
Preguntas frecuentes sobre web scraping en n8n
¿Puede el nodo HTML leer directamente páginas cargadas de JavaScript?
No. El nodo HTML evalúa solo la fuente HTML que recibe como datos JSON o binarios, no ejecuta JavaScript por sí mismo. Para páginas con contenido cargado dinámicamente, primero necesita un navegador real, por ejemplo a través de un servicio Browserless o Playwright auto-hospedado.
¿Necesito necesariamente un servicio pagado para web scraping en n8n?
No. Las soluciones documentadas en la comunidad se basan en un contenedor Browserless o Playwright auto-hospedado, que opera mediante Docker y accede a través del nodo HTTP-Request. Los costos operativos se limitan entonces a su propia infraestructura de servidor, por ejemplo como parte de una instalación de n8n existente.
¿Qué hace la opción "Return Array" en el nodo HTML?
Determina si varios resultados encontrados mediante selector CSS se devuelven como una matriz con múltiples entradas o se fusionan en una única cadena. Para listas que desea procesar más adelante elemento por elemento, la variante de matriz generalmente es la opción más práctica.
¿En qué debe prestar atención al web scraping basado en selectores?
El web scraping basado en selectores con selectores CSS falla regularmente en la práctica una vez que el sitio de destino cambia su diseño o nombres de clase. Los informes de la comunidad sobre flujos de trabajo de Puppeteer y Playwright confirman este patrón repetidamente, por lo que un flujo de trabajo de scraping productivo debe planificar cierto mantenimiento en lugar de ejecutarse sin cambios una vez configurado.
Simon Glowik
Fundador de NordFlux. Siete años de experiencia, desde la web y el SEO hasta la automatización a escala de grupo, hoy de forma pragmática para las pymes y con soberanía de datos alemana.
Certificaciones
- Certificado Microsoft — PL-900 y AZ-900
- Certificado UiPath — Automation Developer Associate
¿Preguntas concretas sobre automatización o IA?
En un análisis inicial gratuito hablamos directamente de su caso. Sin compromiso.