Atunci când un site web sau anumite pagini nu apar în rezultatele de căutare Google, acest lucru indică o defecțiune în procesul de crawling, evaluare sau indexare. Googlebot funcționează sub constrângeri stricte de resurse și limite tehnice stricte.
Dacă conținutul dvs. nu este indexat, acest lucru este de obicei legat de blocaje tehnice explicite, izolare structurală sau semnale tehnice slabe. Iată o analiză arhitecturală a motivelor pentru care Google ignoră paginile dvs. și cum să remediați aceste probleme.
Cuprins
1. Bariere tehnice ale directivei: meta-tagul "Noindex" și fișierul robots.txt
Motivul principal pentru care o pagină nu va fi indexată este o comandă explicită din codul site-ului tău care îi spune lui Googlebot să nu o acceseze.
- Directiva meta
noindex: Dacă un document HTML conțineîn secțiunea, Googlebot îl va elimina imediat din procesul de indexare. Această directivă este adesea lăsată activă din greșeală în mediile de producție după migrarea unui site dintr-un container de testare sau după finalizarea unei reproiectări majore a temei. - Configurarea incorectă a fișierului
robots.txt: Fișierulrobots.txteste primul element pe care Googlebot îl solicită atunci când accesează un host. Dacă fișierul dvs. conține o restricție generală precumDisallow: /, împiedicați crawlerul să acceseze întreaga structură de directoare. - Capcana între directive: O eroare tehnică frecventă este blocarea unei adrese URL în
robots.txtcare conține, de asemenea, o etichetănoindex. Deoarece Googlebot nu are voie să acceseze pagina prinrobots.txt, acesta nu poate citi niciodată etichetanoindex. În consecință, dacă pagina are linkuri externe care trimit către ea, Google poate indexa totuși adresa URL simplă, fără conținutul acesteia, creând o listă de indexare de calitate scăzută.
2. Constrângeri de resurse: epuizarea bugetului de indexare
Google nu dispune de o putere de calcul infinită pentru a indexa fiecare colț al web-ului. Acesta alocă fiecărui domeniu un buget de indexare specializat, care reprezintă minimul matematic al limitei de capacitate de indexare (ceea ce poate gestiona serverul dvs.) și Cererea de indexare (cât de mult dorește Google să-l indexeze).
- Timpii de răspuns lenți ai serverului (TTFB): Google alocă un interval specific de timp pentru a indexa site-ul dvs. Dacă serverul dvs. are nevoie de peste 1 secundă pentru a livra primul octet, Googlebot va reduce limita ratei de indexare. Un server lent reduce direct numărul de pagini indexate pe zi.
- Limita de trunchiere HTML de 2 MB: Googlebot a impus o limită strictă de 2 MB pentru fișierele sursă HTML brute (inclusiv anteturile de răspuns HTTP). Dacă codul neoptimizat, fișierele SVG încorporate de dimensiuni mari sau codul CSS/JS încorporat voluminos fac ca fișierul sursă să depășească 2 MB, Googlebot oprește preluarea, trunchiind tot ce se află sub această limită. Etichetele SEO esențiale, linkurile canonice sau conținutul care depășesc pragul de 2 MB sunt complet invizibile pentru indexator.
- Risipa de indexare și capcanele infinite: Site-urile web care generează URL-uri infinite prin combinarea mai multor filtre (de exemplu, sortarea simultană a produselor după mărime, culoare, preț și dată) blochează spiderii de căutare. Googlebot epuizează bugetul zilnic al site-ului dvs. indexând URL-uri cu parametri aproape identici, fără a mai lăsa resurse disponibile pentru a descoperi articole sau produse noi.
3. Izolarea structurală: pagini orfane
Googlebot descoperă marea majoritate a țintelor sale de indexare urmărind structuri de cod cu hyperlinkuri () de la pagini web cunoscute către pagini web necunoscute.
- Deconectarea arborelui de linkuri: O pagină orfană este o adresă URL activă și funcțională de pe serverul dvs. care nu primește niciun link intern de la nicio altă pagină din arhitectura site-ului dvs. Deoarece nicio cale internă nu indică spre ea, robotul de indexare nu are nicio punte naturală prin care să o descopere.
- Limitările sitemap-ului: Deși trimiterea unui sitemap XML către Google Search Console evidențiază existența URL-ului, aceasta este doar o recomandare, nu o comandă. Dacă Google observă că unei pagini îi lipsește contextul intern și se află în totalitate în afara arhitecturii de linkuri a site-ului dvs., va clasifica adesea adresa URL ca “Descoperită – momentan neindexată” și o va ignora.
4. Pragul de calitate: “Indexat – În prezent neindexat”
Sistemele moderne de indexare utilizează filtre sofisticate de calitate. Depășirea barierelor tehnice de indexare nu garantează un loc în index.
- Conținut slab sau derivat: Dacă Googlebot accesează o pagină și constată că conținutul este extrem de repetitiv, nu are o valoare unică sau oferă descrieri sumare, bazate pe șabloane, va refuza în mod intenționat indexarea.
- Conflicte canonice: Dacă site-ul dvs. găzduiește pagini aproape identice (cum ar fi URL-uri de urmărire sau variante alternative ale produselor) fără etichete explicite
care să îndrume Google către versiunea principală preferată, indexatorul va selecta una automat și le va exclude pe restul.