Indexerbaarheidscontrole

Indexeerbaarheid controleren
Volgende

Een pagina kan perfect goed zijn, maar onzichtbaar voor zoekmachines omdat één enkele tag “noindex” bevat of robots.txt de crawler blokkeert. Plak een URL en deze controle onderzoekt elk signaal dat Google gebruikt – robots.txt, meta robots, X-Robots-Tag, canonieke doel-URL en HTTP-status – en geeft aan of de pagina indexeerbaar is, waarom dat zo is en wat u moet wijzigen als dat niet het geval is.

Hoe controleer je de indexeerbaarheid

  1. 1

    Voer een URL in

    De checker haalt de URL op zoals Googlebot dat zou doen.

  2. 2

    Het lost herverwijzingen op.

    Er wordt een keten van 301/302 hops gevolgd; de uiteindelijke URL is die die wordt bepaald.

  3. 3

    Het leest elk indexeerbaarheidssignaal.

    Regels van robots.txt, meta robots, X-Robots-tag, canonieke regels en statuscode.

  4. 4

    Uitspraak en reden

    Indexeerbaar / niet indexeerbaar / gedeeltelijk, met het precieze signaal dat het oordeel heeft veroorzaakt.

Indexeerbaarheidssignalen en hun volgorde

Google beoordeelt een reeks signalen in een specifieke volgorde; één enkel negatief signaal in die keten is voldoende om de indexering te blokkeren.

Volgorde van signaalbeoordeling

  1. HTTP-status: vereist een code van type 2xx. Codes uit de reeks 3xx worden gevolgd; codes van type 4xx en 5xx markeren het einde van de indexering.
  2. robots.txt: als de URL niet toegestaan is voor Googlebot, wordt de pagina nooit gecrawld – waardoor de noindex-tags daarop nooit worden gezien.
  3. X-Robots-tag: De waarde noindex in de HTTP-responsheaders belemmert het indexeren.
  4. Meta robots: <meta name="robots" content="noindex"> belemmert het indexeren.
  5. Canonisch: een canonische verwijzing naar een andere locatie betekent dat Google die andere URL indexeert.
  6. Inhoudskwaliteit en detectie van duplicaten: Google kan indexeren overslaan, zelfs zonder expliciete instructies.

Veelvoorkomende fouten die worden geconstateerd

Probleem Oorzaak
Hele sectie niet geïndexeerd Regel Disallow: in robots.txt
Specifieke pagina niet geïndexeerd noindex in meta robots
Geïndexeerd met een verkeerde URL Canoniek verwijst naar een andere pagina
Blijft hangen op 5xx Serverfout verstoort het crawlen
Conflict Disallow + noindex Robots.txt blokkeert het crawlen, noindex-tag wordt nooit gelezen
Staging lekt naar productie X-Robots-Tag: noindex overgebleven uit een testomgeving

De robots.txt + noindex-valkuil

Als u een URL met Disallow: hebt opgenomen in robots.txt, crawlt Google die nooit en ziet daarom nooit een noindex-tag. De URL kan echter nog steeds verschijnen in zoekresultaten als een ‘lege’ entry met alleen de URL en geen beschrijving. Om een URL correct uit de index te verwijderen, geef toestemming voor scanning en gebruik noindex; blokkeer de scanning pas nadat Google de URL heeft verwijderd uit de index.

Testen vanuit het perspectief van Googlebot

De checker stuurt de Googlebot-useragent zodat alle serverzijde-trucen waarbij ‘crawlers alleen X zien’ zichtbaar zijn. Controleer altijd productie-URL’s, niet staging-URL’s.

Veelgestelde vragen

Het feit dat een pagina indexeerbaar is, betekent alleen dat er geen technische belemmering is; het garandeert echter niet dat de pagina echt wordt geïndexeerd. Google bepaalt ook of een pagina wordt geïndexeerd op basis van de waargenomen kwaliteit, het bestaan van duplicaatinhoud en het beschikbare crawlingbudget. Voor een definitieve antwoord van Google zelf kunt u gebruikmaken van de URL-inspectie in Search Console.

Meestal is alleen een meta-robottag (of X-Robot-Tag) de juiste oplossing. Robots.txt belemmert het crawlen; meta robots belet het indexeren. Voor pagina’s die niet moeten worden geïndexeerd, moet het crawlen worden toegestaan zodat Google uw noindex-tag kan lezen.

Google beoordeelt het eindbestemmingpunt van een redirectketen. Een 301-redirection van A naar B betekent dat Google uiteindelijk pagina B indexeert, niet pagina A. De beoordelaar simuleert dit door alle redirects eerst op te lossen voordat de beoordeling plaatsvindt.

Nee: pagina’s die authenticatie vereisen, zijn per definitie niet indexeerbaar. Als u SEO voor deze pagina’s nodig hebt, kunt u een openbare voorlopige versie overwegen.

Gerelateerde tools

Tool beschikbaar in andere talen