Kunnen zoekmachines de juiste pagina’s vinden en indexeren?
Gevonden worden in zoekmachines zijn twee klussen: crawlers uw pagina’s laten ontdekken, en de juiste pagina’s geïndexeerd krijgen terwijl de verkeerde erbuiten blijven. Een robots.txt-bestand is daar één klein onderdeel van — en wie het als het hele verhaal ziet, verbergt zijn website per ongeluk of lekt juist pagina’s die privé hadden moeten blijven.
De hulpmiddelen, en waar elk voor dient
- robots.txt — sturing van het crawlen. Het vraagt brave crawlers om bepaalde paden over te slaan en wijst ze naar uw sitemap. Het is geen manier om een URL uit de resultaten te houden — een geblokkeerde URL die via links wordt gevonden, kan nog steeds vermeld worden, en Google ziet nooit een
noindexop een pagina die het niet mag crawlen — en het is geen beveiliging: alles wat u „blokkeert”, blijft openbaar bereikbaar. De regels gelden bovendien alleen voor het exacte protocol, de hostnaam en de poort waarop het bestand wordt aangeboden — controleer dus elke openbaar bereikbare hostnaam. - XML-sitemap — ontdekking. Een lijst van de canonieke, indexeerbare URL’s die u door zoekmachines ontdekt en gecrawld wilt zien. Een sitemap is een hint, geen garantie op crawlen of indexeren. Verwijs ernaar vanuit robots.txt.
- noindex — uitsluiting van indexering. Een metatag of header die een crawlbare pagina uit de ondersteunde zoekresultaten houdt — het juiste gereedschap voor een bedankpagina of een pagina die volgens u niet vermeld hoort te worden. Hij werkt pas nadat de zoekmachine de pagina opnieuw heeft gecrawld, geldt alleen voor crawlers die hem respecteren, en verandert niets aan wie de URL kan openen: vertrouwelijke inhoud vraagt authenticatie, geen
noindex. - canonical — signaal voor de voorkeurs-URL. Een
<link rel="canonical">op dubbele of sterk gelijkende URL’s, die aangeeft welke versie uw voorkeur heeft. De zoekmachine maakt de uiteindelijke keuze — houd de tag consistent met uw doorverwijzingen, interne links en sitemap, zodat alle signalen hetzelfde zeggen.
De klassieke valkuil: blokkeren wat u gevonden wilt zien
Een gevaarlijke lanceerfout is Disallow: / meenemen van de testomgeving naar productie: brave crawlers kunnen dan niets ophalen, waardoor een nieuwe website niet fatsoenlijk geïndexeerd raakt — terwijl eerder bekende URL’s in de resultaten kunnen blijven hangen met weinig of geen beschrijvende tekst. Vlak daarachter: CSS/JS blokkeren die pagina’s nodig hebben om correct te verschijnen. Zulke fouten kunnen onopgemerkt blijven tot de indexering of het bezoek verandert — test robots.txt dus en inspecteer belangrijke URL’s vóór én na de lancering. Ter contrast: een gezond, minimaal robots.txt-bestand blokkeert niets en wijst naar uw sitemap:
User-agent: *
Disallow:
Sitemap: https://www.example.com/sitemap.xml
En controleer de basis: open /robots.txt in een privévenster en kijk of het het bedoelde platte-tekstbestand teruggeeft — geen inlogpagina, doorverwijslus of serverfout.
Controleer wat er echt geïndexeerd is
Ga er niet van uit dat uw configuratie gewerkt heeft — toets ze aan de werkelijkheid. Het rapport „Pagina-indexering” van Search Console toont indexeringspatronen, en „URL-inspectie” toont de status die Google heeft voor een specifieke URL die u opgeeft. Gebruik ze om uw belangrijke pagina’s na te lopen — in het besef dat het rapport alleen URL’s dekt die Google gezien heeft, en steekproeven uit zijn lijsten toont. Een site:-zoekopdracht is hooguit een ruwe diagnose.
Kern: stuur ontdekking en indexering als één geheel — sitemap en robots.txt om het crawlen te leiden, noindex om uit te sluiten, canonical-tags om uw voorkeur uit te spreken — controleer daarna wat Google echt in zijn index heeft, en verwar niets hiervan ooit met toegangscontrole.
Wat u moet doen
- Publiceer een XML-sitemap met uw canonieke, indexeerbare URL’s, verwijs ernaar vanuit
/robots.txten controleer of het bestand op elke openbare hostnaam correct antwoordt. - Gebruik robots.txt alleen om crawlers weg te sturen van echte rommel — interne zoekresultaten, winkelwagen-URL’s — en test elke regel eerst op representatieve URL’s, zodat een breed patroon niet ook nuttige pagina’s of vereiste bronnen meepakt. Het bestand is openbaar: adverteer er geen beheer- of privépaden in; bescherm die met authenticatie.
- Gebruik
noindex, geenDisallow, voor crawlbare pagina’s die niet vermeld mogen worden — en combineer de twee nooit op één URL, anders blijft de tag ongezien. - Zet nauwkeurige canonical-tags op dubbele of sterk gelijkende URL’s, en gebruik de voorkeurs-URL consequent in interne links en de sitemap — de zoekmachine hakt uiteindelijk zelf de knoop door.
- Blokkeer nooit CSS/JS die de pagina nodig heeft om correct te verschijnen.
- Controleer de werkelijkheid in Search Console — het rapport „Pagina-indexering” en „URL-inspectie” — voor en na wijzigingen, en zeker meteen na de lancering.
Veelgestelde vragen
- Houdt robots.txt een pagina uit Google?
- Nee. Google kan een geblokkeerde URL die het via links ontdekt nog steeds tonen, vaak met weinig of geen beschrijvende tekst — en het kan geen noindex zien op een pagina die het niet mag crawlen. Wilt u een openbare pagina uitsluiten, sta het crawlen dan toe en gebruik een noindex-tag of een X-Robots-Tag-header; de wijziging landt pas nadat de pagina opnieuw gecrawld is. Vertrouwelijke inhoud vraagt authenticatie — noindex is geen toegangscontrole.
- Wat is het verschil tussen robots.txt, noindex en canonical?
- robots.txt bepaalt welke paden brave crawlers mogen opvragen; noindex zegt tegen zoekmachines die het ondersteunen dat ze een pagina die ze kunnen crawlen niet mogen indexeren; een canonical-tag geeft bij dubbele of sterk gelijkende pagina’s uw voorkeurs-URL aan, waarbij de zoekmachine de uiteindelijke keuze maakt. Alle drie kunnen nuttig zijn op één website — maar blokkeer nooit een URL waarvan de crawler de noindex- of canonical-tag moet kunnen lezen.
- Hoe weet ik wat er echt geïndexeerd is?
- Gebruik het rapport „Pagina-indexering” van Search Console om patronen te zien en „URL-inspectie” om specifieke, bekende URL’s te controleren. Geen van beide is een volledige inventaris — het rapport dekt URL’s die Google kent en toont steekproeven uit zijn lijsten — en een site:-zoekopdracht is hooguit een ruwe diagnose. Bescherm privé-inhoud met toegangscontrole en controleer die apart; een SEO-tool is geen privacycontrole.
Was dit nuttig?
Vragen over uw eigen website? Neem contact op – we lezen elk bericht.
Bron: “Kunnen zoekmachines de juiste pagina’s vinden en indexeren?” — https://www.siteadvice.be/nl/tips/robots-txt-toevoegen/ · © 2026 EUREGIO.NET AG. Alle rechten voorbehouden.