Atunci când analizați jurnalele site-ului web, activitatea firewall-ului sau statisticile de trafic, este posibil să observați cereri provenite de la crawlere automate, cunoscute și sub denumirea de boți sau spideri.
Acești boți sunt folosiți în mod obișnuit de motoarele de căutare și de platformele online pentru:
- Indexarea conținutului site-ului web.
- Generarea rezultatelor motoarelor de căutare.
- Crearea previzualizărilor linkurilor pe rețelele sociale.
- Analizarea structurii site-ului web.
- Colectarea informațiilor disponibile public.
Fiecare crawler se identifică folosind un șir User-Agent, care vă poate ajuta să stabiliți dacă traficul neobișnuit provine de la un serviciu legitim sau de la un bot potențial dăunător.
Cuprins
De ce sunt utile aceste informații?
Cunoașterea numelor comune ale User-Agent-urilor vă poate ajuta să:
- Analizați vârfurile de trafic.
- Identificați crawlerele motoarelor de căutare.
- Verificați activitatea de indexare.
- Creați reguli de firewall sau de securitate.
- Depanați performanța site-ului web.
- Detectați activități suspecte care se dau drept roboți ai motoarelor de căutare.
Cum să verificați informațiile User-Agent
Informațiile despre User-Agent pot fi găsite, de obicei, în:
- Jurnalele serverului web
- Jurnalele de acces
- Platforme de analiză
- Instrumente de securitate
- Rapoarte ale firewall-ului
Când investigați activitatea crawlerelor, căutați câmpul User-Agent în detaliile cererii.
Crawler-e populare ale motoarelor de căutare
Google – Googlebot
Denumire scurtă
Googlebot
Exemplu de User-Agent
Mozilla/5.0 (compatibil; Googlebot/2.1; +http://www.google.com/bot.html)
Microsoft Bing – Bingbot
Denumire scurtă
Bingbot
Exemplu de User-Agent
Mozilla/5.0 (compatible; Bingbot/2.0; +http://www.bing.com/bingbot.htm)
Yahoo – Slurp
Denumire scurtă
Slurp
Exemplu de User-Agent
Mozilla/5.0 (compatible; Yahoo! Slurp; http://help.yahoo.com/help/us/ysearch/slurp)
DuckDuckGo – DuckDuckBot
Denumire scurtă
DuckDuckBot
Exemplu de User-Agent
DuckDuckBot/1.0; (+http://duckduckgo.com/duckduckbot.html)
Baidu – Baiduspider
Denumire scurtă
Baiduspider
Exemplu de User-Agent
Mozilla/5.0 (compatibil; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)
Yandex – YandexBot
Denumire scurtă
YandexBot
Exemplu de User-Agent
Mozilla/5.0 (compatibil; YandexBot/3.0; +http://yandex.com/bots)
Alte crawlere populare
Sogou Spider
Exemple comune de User-Agent:
Sogou Pic Spider/3.0
Sogou head spider/3.0
Sogou web spider/4.0
Sogou Orion spider/3.0
Sogou-Test-Spider/4.0
ExaLead – Exabot
Denumire scurtă
Exabot
Exemple de agenți de utilizator
Mozilla/5.0 (compatibil; Exabot/3.0; +http://www.exabot.com/go/robot)
Mozilla/5.0 (compatibil; Konqueror/3.5; Linux) KHTML/3.5.5 (ca Gecko) (Exabot-Thumbnails)
Crawlere de rețele sociale
Botul de previzualizare a linkurilor de pe Facebook
Când un link este distribuit pe Facebook, Meta folosește un crawler pentru a prelua informații despre pagină și a genera o previzualizare.
Denumire scurtă
facebookexternalhit
Exemple de agenți de utilizator
facebookexternalhit/1.0
facebookexternalhit/1.1
Crawlere de analiză și clasificare
Crawlerul Alexa
Denumire scurtă
ia_archiver
Exemplu de User-Agent
ia_archiver (+http://www.alexa.com/site/help/webmasters; [email protected])
Verificarea unui Googlebot suspect
Nu orice bot care pretinde că este Googlebot este legitim.
Unele crawlere rău intenționate falsifică în mod intenționat șirurile User-Agent ale Googlebot.
Dacă trebuie să verificați dacă o solicitare provine într-adevăr de la Google, Google pune la dispoziție documentație privind validarea adreselor IP ale crawlerelor.
De asemenea, puteți utiliza:
Google Search Central – Verificarea Googlebot
Blocarea sau permiterea crawlerelor
Dacă este necesar, accesul crawlerelor poate fi gestionat prin:
robots.txt
Exemplu:
User-agent: Googlebot
Disallow:
.htaccess
Exemplu:
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} BadBot [NC]
RewriteRule .* - [F,L]
Notă: Blocarea crawlerelor legitime ale motoarelor de căutare poate afecta negativ vizibilitatea site-ului dvs. în rezultatele căutării.
Notă importantă privind securitatea
Nu toți roboții care vizitează site-ul dvs. sunt benefici.
Deși crawlerele motoarelor de căutare ajută la indexarea conținutului dvs., unii roboți automați pot:
- Să caute vulnerabilități.
- Să încerce atacuri de tip "brute-force".
- Să extragă conținutul site-ului web.
- Să testeze software-ul învechit.
Pentru a reduce riscul:
- Mențineți CMS-ul actualizat.
- Actualizați regulat pluginurile și temele.
- Monitorizați jurnalele de acces.
- Utilizați pluginuri de securitate și firewall-uri.
- Blocați roboții cunoscuți ca fiind rău intenționați, atunci când este cazul.
Rezumat
Șirurile User-Agent vă permit să identificați sursa traficului automat.
Printre cele mai comune denumiri de crawlere se numără:
| Serviciu | User-Agent |
|---|---|
| Googlebot | |
| Bing | Bingbot |
| Yahoo | Slurp |
| DuckDuckGo | DuckDuckBot |
| Baidu | Baiduspider |
| Yandex | YandexBot |
| facebookexternalhit | |
| Alexa | ia_archiver |
| ExaLead | Exabot |
Înțelegerea acestor identificatori vă poate ajuta să analizați tiparele de trafic, să remediați problemele de indexare și să distingeți crawlerele legitime de boții potențial rău intenționați.