¿Cómo evitar los crawlers?

  • Autor Autor xcodex
  • Fecha de inicio Fecha de inicio
X

xcodex

¡Hola estimados!..
Me estaba preguntando cuales serían los métodos mas eficientes para evitar los crawlers.
¿Qué métodos utilizan ustedes?.
 
Cloudflare + Procotols y headers clousters
 
Pero a que tipo de crawlers te refieres a al tipo google, bing, yahoo, yandex que indexan contenido o rastreadores que se crean para hacer scraping o como lo llamo yo vaciar un sitio web.

Por ejemplo en el caso uno se podria bloquear así(hay muchas maneras)

Esta la dijo ciclow en una publicación: https://forobeta.com/tutoriales/535615-gana-armando-tus-propias-publicidades-movil.html

if(strstr(strtolower($_SERVER['HTTP_USER_AGENT']), "google")){
die();
}

Es decir se verifica el user agent y si contiene la palabra google entonces es el robot.

En el segundo caso y por base a mi experiencia es imposible detener a alguien que quiera robarte el contenido, así coloquen cloudflare (bueno hay metodos de hotlink para evitar robo de enlaces directos como de películas que solo servirán en un determinado dominio, etc), en fin casi todo se puede saltar, el html siempre se podrá sacar de alguna manera y si por algún motivo bloquean la ip del scraper se usan proxy, en fin muy difícil...
 
Última edición:
Atrás
Arriba