DADES DE QUALSEVOL WEB, A PUNT PER FER SERVIR

Web scraping amb IA per a empreses

Extraiem, netegem i estructurem dades de webs, marketplaces i comparadors, i les lliurem on les necessites: a la teva base de dades, en un full de càlcul o en una API. Combinem l'enginyeria clàssica de scraping amb models d'IA perquè les dades arribin completes, normalitzades i a temps.

Actualitzat:

Què és el web scraping i què ha canviat amb la IA

El web scraping és l'extracció automatitzada d'informació de pàgines web: preus, fitxes de producte, anuncis, empreses, ressenyes, notícies. Serveix per saber què fa la competència, alimentar un catàleg, detectar oportunitats comercials o tenir dades de mercat que no són a cap informe.

Fins fa poc, cada scraper era un conjunt de regles fràgils: si la web canviava un botó de lloc, el procés es trencava. Avui els models d'IA entenen el contingut d'una pàgina com ho faria una persona, i això permet extreure dades de webs desordenades, classificar-les i adaptar-se als canvis sense començar de zero.

Què fem

Un servei complet, de la primera anàlisi a les dades funcionant cada dia al teu negoci.

Extracció a escala

Navegadors automatitzats amb Playwright per a webs amb JavaScript, inici de sessió o scroll infinit, i peticions directes quan la web ho permet, que és més ràpid i barat.

De deu pàgines a milions, amb cues, reintents i ritmes que no saturen la web d'origen.

IA per entendre les dades

Models de llenguatge amb sortides estructurades per llegir fitxes desordenades, PDFs o text lliure i convertir-los en camps nets: marca, model, preu, talla, ubicació, categoria.

També per classificar, traduir, resumir i aparellar el mateix producte entre botigues diferents.

Lliurament on el necessites

Base de dades (PostgreSQL, BigQuery), Google Sheets, CSV o Excel programats, una API pròpia o integració directa amb el teu CRM, el teu ERP o la teva botiga online.

Amb avisos automàtics quan passa alguna cosa rellevant: una baixada de preu, un anunci nou, un competidor nou.

Manteniment continu

Les webs canvien i els scrapers es trenquen: és inevitable. Vigilem cada procés, validem les dades a cada execució i ho reparem abans que ho notis.

Si el volum de dades cau o apareixen valors estranys, ens salta una alerta a nosaltres, no a tu.

Experiència en sectors molt diferents

Des del 2016 extraiem dades de la web. Cada sector té els seus paranys, i ja els coneixem.

Marketplaces

Catàlegs, preus, venedors, valoracions i disponibilitat en marketplaces generalistes i de segona mà.

Comparadors de preus

Seguiment diari de preus i promocions de la competència, i aparellament del mateix producte entre botigues.

Directoris i mapes

Fitxes de negocis, dades de contacte públiques, horaris i ressenyes per a estudis de mercat i bases de dades sectorials.

Ecommerce i catàlegs

Importació de catàlegs de proveïdors a la teva botiga online, amb fotos, descripcions i atributs normalitzats.

Immobiliari

Anuncis de portals, evolució de preus per zona i alertes d'ofertes noves.

Ocupació i licitacions

Ofertes de feina, concursos públics i subvencions filtrats i classificats per IA segons els teus criteris.

Mitjans i notícies

Monitoratge de mitjans, notícies i mencions de marca, amb resum i classificació automàtica.

Administració i dades públiques

Butlletins oficials, registres i portals institucionals convertits en bases de dades consultables.

Scraping amb IA, però ben fet

Avui qualsevol pot demanar a un agent d'IA que llegeixi una web. Funciona per a una consulta puntual, però no per a un negoci que depèn d'aquestes dades cada dia. La nostra diferència és fer servir la IA on aporta i l'enginyeria on cal.

Un agent d'IA genèricSitelabs
CostPaga tokens per cada pàgina, també pel que es podria llegir amb una regla simple.IA només als passos que la necessiten. La resta, codi. Molt més barat a gran volum.
FiabilitatRespostes que varien entre execucions i dades inventades quan no troba alguna cosa.Esquemes validats, comprovacions a cada execució i no s'inventa res: si una dada no hi és, queda buida.
VolumLent, pàgina a pàgina.Milers de pàgines per hora amb cues, paral·lelisme i reintents.
Canvis a la webEs trenca sense avisar.Monitoratge i reparació inclosos al servei.
DadesUn text o una taula solta.Base de dades històrica, integrada amb les teves eines i amb alertes.
LegalitatSense criteri.Anàlisi prèvia de quines dades es poden extreure i com, d'acord amb el RGPD.

De Puppeteer a Playwright

Durant anys vam treballar amb Puppeteer, la llibreria de Google per controlar Chrome des de Node.js. Va ser l'eina que va fer possible scrapejar webs modernes fetes amb JavaScript.

Avui l'estàndard és Playwright: controla Chromium, Firefox i WebKit amb la mateixa API, funciona en Python i en Node.js, espera automàticament que la pàgina estigui a punt i gestiona diverses sessions en paral·lel. És més estable, més ràpid de desenvolupar i més fàcil de mantenir, i és el que fem servir als projectes nous.

Sobre aquesta base hi afegim IA: models que llegeixen la pàgina renderitzada, decideixen on és cada dada i la retornen ja estructurada.

Les eines que fem servir

Triem a cada projecte la combinació més simple que resol el problema:
  • Playwright (Python i Node.js) per a webs dinàmiques, amb inici de sessió o amb molt de JavaScript.
  • Scrapy i Crawlee per a rastrejos grans amb cues, reintents i control de ritme.
  • httpx, selectolax i BeautifulSoup quan n'hi ha prou amb HTTP i HTML: el més ràpid i barat.
  • Models d'IA (Gemini, Claude, GPT) amb sortides estructurades en JSON per extreure, classificar i normalitzar.
  • Crawl4AI i Firecrawl per convertir webs en text net per a IA i sistemes RAG.
  • Agents de navegació per a fluxos que canvien sovint o que requereixen decisions.
  • PostgreSQL, BigQuery i Google Sheets per guardar i explotar les dades.
  • Docker, execucions programades i alertes perquè tot funcioni sol cada dia.

Com treballem

Sense sorpreses: abans de desenvolupar res sabràs si és viable, quines dades tindràs i quant costarà.

1. Anàlisi

Revisem les webs d'origen, les dades que necessites i la freqüència. Et diem què és viable tècnicament i legalment.

2. Mostra

Et lliurem una mostra real de les dades amb el format final perquè validis que és el que esperaves.

3. Producció

Posem en marxa el procés complet: extracció, IA, validació i lliurament a les teves eines.

4. Manteniment

Vigilem cada execució, reparem el que es trenca i ampliem fonts quan ho necessitis.

És legal el web scraping?

Extreure informació pública d'una web és legal en la majoria de casos, però hi ha límits: les dades personals estan protegides pel RGPD, alguns continguts tenen drets d'autor o de base de dades, i cal respectar el funcionament de la web d'origen.

Per això cada projecte comença amb una anàlisi de què es pot extreure i per a què. Treballem a un ritme que no afecta la web d'origen i no extraiem dades personals sense una base legal clara. Si alguna cosa no es pot fer bé, t'ho diem.

Preguntes freqüents

Sobre el servei de web scraping.

Quant costa un projecte de web scraping?

Depèn del nombre de webs, de la seva complexitat, del volum de dades i de la freqüència d'actualització. Després de l'anàlisi inicial et donem un pressupost tancat per al desenvolupament i una quota mensual per a l'execució i el manteniment.

Podeu extreure dades de webs que demanen inici de sessió?

Sí, sempre que tinguis accés legítim a aquest compte i les condicions d'ús ho permetin. Playwright manté la sessió igual que un navegador normal.

Què passa quan la web d'origen canvia?

És el més habitual. Cada execució es valida automàticament: si falten dades o canvien els formats, rebem una alerta i ho reparem. Amb IA, molts canvis de disseny ni tan sols trenquen el procés.

Amb quina freqüència s'actualitzen les dades?

La que necessitis: una vegada, cada mes, cada dia o cada pocs minuts per a preus o estoc. Ajustem la freqüència al valor de la dada i al respecte per la web d'origen.

Feu servir ChatGPT per scrapejar?

Fem servir models d'IA (Gemini, Claude o GPT, segons el cas) només als passos on aporten: entendre textos desordenats, classificar o aparellar productes. La navegació i l'extracció repetitiva es fan amb codi, que és més ràpid, més barat i més fiable.

En quin format rebo les dades?

En el que et sigui útil: Google Sheets, Excel o CSV, una base de dades, una API o directament integrades a la teva botiga online, el teu CRM o el teu ERP.

Quines dades necessites?

Explica'ns quines webs t'interessen i què vols fer amb les dades. Et direm si és viable i com ho faríem.