De meeste websites hebben een robots.txt-bestand. Zoals de naam doet vermoeden, is dat geen bestand voor mensen maar voor robots. Denk aan de crawlers van Google en Bing, en tegenwoordig ook die van AI-bedrijven.
In het bestand staat welke delen van je website die robots mogen bezoeken. Vaak staat er ook de URL van je sitemap in, zodat ze meteen weten welke pagina's er allemaal zijn.
Je vindt het bestand altijd op dezelfde plek: jouwdomeinnaam.be/robots.txt. Bij de meeste websites ziet het er ongeveer zo uit:
User-agent: *
Disallow:
Sitemap: https://jouwdomeinnaam.be/sitemap.xml
Veel is het niet, en voor de meeste websites is dat ook genoeg. User-agent: * betekent "dit geldt voor alle robots". Een lege Disallow betekent "je mag overal kijken".
Wil je niet dat robots een bepaald deel van je website bezoeken, bijvoorbeeld een map met testpagina's, dan zet je dat erbij:
User-agent: *
Disallow: /test/
Een vraag, geen slot
Twee dingen om te onthouden. Robots.txt is een beleefde vraag. Google en co houden zich eraan, maar een kwaadwillige bot trekt er zich niets van aan. Wat echt geheim moet blijven, bescherm je met een wachtwoord.
En een pagina blokkeren in robots.txt betekent niet dat ze uit de zoekresultaten verdwijnt. Linken andere sites ernaar, dan kan Google ze toch tonen. Wil je een pagina echt uit Google houden, gebruik dan een noindex-tag op die pagina zelf. Die pagina mag je dan net nĂet blokkeren in robots.txt, anders ziet Google die tag nooit.