Web scraping

  • Autor Autor Andresledo
  • Fecha de inicio Fecha de inicio
A

Andresledo

Gamma
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
Buenos días,

Estoy trabajando con un afiliado que me ofrece una serie de artículos, sin embargo, no tienen API. Había pensado en hacer Web scraping de la misma con PHP y agregarlos a una bd MYSQL.
Por internet he visto que la mayoría utilizan CURL para realizar el trabajo, el problema es que no me acaba de funcionar ningún source que funcione bien para poder adaptarlo a mi sitio Web, ¿alguien conoce algún tutorial más o menos bueno para realizar esto?

¿Curl es la mejor opción o hay otras?

Gracias!
 
Yo también uso la libreria que el compañero acaba de mencionar, excelente.
 
Exacto con DOM parser lo haces , solo es de que analices la web a la que le quieres hacer scraping.
 
Gracias por las respuestas.

El problema es que el anunciante muestra el nombre del artículo con ng-show que creo que proviene de Javascript, con DOM obtengo {ccTldDomain.NameWithoutExtension} cuando en el navegador me muestra el dominio, (estoy hablando de los dominios de Godaddy)

Si lo cargan desde javascript el DOM creo que no me vale o al menos no soy capaz de usarlo...
 
Gracias por las respuestas.

El problema es que el anunciante muestra el nombre del artículo con ng-show que creo que proviene de Javascript, con DOM obtengo {ccTldDomain.NameWithoutExtension} cuando en el navegador me muestra el dominio, (estoy hablando de los dominios de Godaddy)

Si lo cargan desde javascript el DOM creo que no me vale o al menos no soy capaz de usarlo...

Hola, eso pasa porque está usando AngularJS, ng-show es un etiqueta propia. Te comento si está usando javascript lo mejor es que te pases a algo un poco más potente para hacer scraping, con PHP es complicado cargar webs dinámicas. Te recomiendo Selenium (Python), que emula un navegador. Tutotial: Selenium Tutorial: Web Scraping with Selenium and Python
Un saludo
 
Atrás
Arriba