Beveiliging

Valse Googlebots Op Uw Website Herkennen en Blokkeren met .htaccess

  • Leestijd: 13 minuten
  • Hostragons Team
Valse Googlebots Op Uw Website Herkennen en Blokkeren met .htaccess

Het herkennen en blokkeren van valse Googlebots met .htaccess is een effectieve manier om schadelijke bots die zich voordoen als Googlebot te onderscheiden op basis van gebruikersagent, IP-verificatie en toeganglogs, en deze te blokkeren met een 403-status zonder de echte Google-crawlers te hinderen. De veiligste aanpak is om niet alleen op de User-Agent te vertrouwen, maar ook de officiële Google IP-bereiken of reverse DNS-lookup te verifiëren, eerst te loggen en vervolgens gecontroleerd .htaccess-regels toe te passen om de toegang te weigeren.

Veel kwaadwillende bots proberen beveiligingsmuren en simpele botfilters te omzeilen door zich voor te doen als Googlebot, Google-InspectionTool, AdsBot-Google of Googlebot-Image. Website-eigenaren zijn vaak terughoudend om Googlebot te blokkeren, wat deze bots een achterdeur geeft. Dit leidt tot problemen zoals content scraping, hoge serverbelasting, nepverkeer, spam in formulieren, inlogpogingen en vervuiling van SEO-data. Vooral bij shared hosting, WordPress, WooCommerce, nieuwssites en regelmatig bijgewerkte blogs kan deze verkeerstoename snel CPU-, RAM- en I/O-limieten bereiken. In deze gids leggen we stap voor stap uit hoe u valse Googlebot-activiteiten herkent, hoe u veilige .htaccess-regels opstelt en hoe u voorkomt dat u per ongeluk de echte Googlebot blokkeert. Heeft u behoefte aan een snelle, veilige en schaalbare infrastructuur voor uw website? Neem dan ook een kijkje bij Hostragons web hosting oplossingen en installatie van SSL certificaat voor aanvullende oplossingen.

Wat is een Valse Googlebot en Waarom is Die Gevaarlijk?

Een valse Googlebot is een automatische crawler die in de HTTP-aanvraag de User-Agent instelt alsof het Googlebot is, maar afkomstig is van IP-adressen die niet aan Google toebehoren. De User-Agent is een eenvoudige tekst die aangeeft wie de client is; technisch gezien kan iedereen deze naar “Googlebot” veranderen. Daarom is alleen controle op User-Agent geen betrouwbare beveiligingsmaatregel.

Het doel van de echte Googlebot is uw site te crawlen, pagina’s te indexeren, updates te ontdekken en kwaliteitsdata te verzamelen voor de zoekresultaten. Valse Googlebots daarentegen hebben vaak andere motieven. Ze kunnen bijvoorbeeld productprijzen verzamelen, content kopiëren, adminpagina’s proberen te bereiken, uw zoekpagina’s belasten of kwetsbaarheden in plugins scannen. Sommige aanvallers sturen tientallen verzoeken per seconde, wat zelfs bij kleine sites tot prestatieproblemen leidt.

In de praktijk merkt u valse bots vaak aan de volgende signalen:

  • Honderden verzoeken binnen korte tijd die 404-, 403- of 500-responses teruggeven.
  • Scans op gevoelige paden zoals wp-login.php, xmlrpc.php, admin, phpmyadmin, backup.zip.
  • De User-Agent lijkt Googlebot, maar het IP-adres valt niet binnen Google’s ASN of officiële IP-bereiken.
  • Bezoeken van filter-, zoek-, winkelwagen- of accountpagina’s zonder zich aan robots.txt te houden.
  • Verzoeken met een veel hogere frequentie naar dezelfde URL dan een normale Googlebot zou doen.

Waarom Is Alleen User-Agent Controle Niet Genoeg?

Dat een bot in de HTTP-header “Googlebot” vermeldt, betekent niet dat deze ook echt van Google is. Een simpele curl-opdracht kan de User-Agent moeiteloos namaken. Daarom is het onjuist om in .htaccess simpelweg alle verzoeken met “Googlebot” te blokkeren of juist toe te staan. Het eerste kan de echte crawler blokkeren, het tweede geeft kwaadwillenden vrij spel.

De SEO- en beveiligingsstrategie voor 2026 bestaat uit drie lagen: verifiëren van de geclaimde identiteit, authenticatie via IP of DNS en het monitoren van afwijkend gedrag in logs. Zo behoudt u uw Google-zichtbaarheid en houdt u uw server schoon van onnodige bots.

Hoe Verifieert u de Echte Googlebot?

Google raadt twee hoofdmethodes aan om de echte crawler te verifiëren: reverse DNS-lookup en gebruik van officiële IP-bereiken. Bij reverse DNS moet het IP-adres terugverwijzen naar een domein dat eindigt op googlebot.com of google.com, en dit domein moet op zijn beurt weer naar hetzelfde IP-adres wijzen. Deze dubbele check voorkomt dat een valse PTR-record u om de tuin leidt.

De tweede methode is het gebruik van de officiële IP-bereiken die Google publiceert. Er zijn verschillende JSON-lijsten voor Googlebot, speciale crawlers en user-triggered fetchers. Omdat deze lijsten dynamisch zijn, is het niet betrouwbaar om langdurig te vertrouwen op handmatig geschreven verouderde IP-lijsten. Beheert u uw eigen VPS of server, dan is het verstandig om deze lijsten regelmatig automatisch op te halen en te verwerken in uw firewall of Apache includes. Bij shared hosting kunt u met toeganglogs, .htaccess en eventueel beschikbare beveiligingsmodules een gecontroleerde aanpak hanteren.

De Werking van Valse Googlebot Blokkeren met .htaccess

.htaccess stelt u in staat om op directory-niveau regels te definiëren voor Apache-webservers. Dit wordt gebruikt voor URL-redirects, toegangscontrole, compressie, caching en basis beveiligingsmaatregelen. Bij het blokkeren van valse Googlebots is de taak van .htaccess om binnenkomende verzoeken te evalueren op specifieke voorwaarden en verdachte verzoeken af te wijzen met een 403 Forbidden.

Er is echter een belangrijke beperking: standaard .htaccess is niet geschikt voor real-time reverse DNS-checks, omdat HostnameLookups in Apache vaak vanwege performance uitstaan. Daarom is de praktischste methode binnen .htaccess om User-Agent Googlebot te matchen en het IP-adres te vergelijken met een whitelist, of verdachte paden strenger te filteren. Voor geavanceerdere verificatie gebruikt men WAF, server-firewall, CDN of geautomatiseerde log-analyse. wat is CDN en de impact op websiteprestaties helpt u bij het plannen van zo’n beschermingslaag.

Stap-voor-stap Aanpak: Valse Googlebots Opsporen en Blokkeren

1. Analyseer Toeganglogs

Voordat u regels gaat schrijven, bekijkt u minstens 24 tot 72 uur aan access logs. Bij veel verkeer kan zelfs één uur al voldoende zijn. Let op IP-adres, datum, opgevraagde URL, HTTP-statuscode, bytes, referer en User-Agent. Bijvoorbeeld: als één IP in tien minuten 800 verzoeken doet waarvan veel 404’s zijn en zich voordoet als Googlebot, dan is dat een sterke verdenking.

U kunt raw access logs downloaden via cPanel of vergelijkbare beheerpaneel. Met SSH kunt u met grep, awk en sort de gedragspatronen van IP’s die zich als Googlebot voordoen analyseren. Het doel is niet elk Googlebot-verzoek, maar het gedrag van die IP-adressen te beoordelen.

2. Verifieer IP-adressen die zich als Googlebot voordoen

Nadat u verdachte IP’s hebt geïdentificeerd, voert u reverse en forward DNS-controles uit. Heeft een IP een PTR-record dat bijvoorbeeld crawl-66-249-66-1.googlebot.com toont, dan is dat een eerste stap. Dit domein moet bij een forward lookup weer naar hetzelfde IP verwijzen. Ontbreekt een PTR-record, wijst het naar een ander domein of geeft de forward lookup een ander IP, dan is het geen echte Googlebot.

Deze controle is cruciaal om te voorkomen dat u per ongeluk de echte Googlebot blokkeert. Deze blokkade kan leiden tot vertraagde indexatie, verminderde actualiteit van zoekresultaten, crawl fouten in Google Search Console en uiteindelijk verlies van organisch verkeer. Maak daarom uw blokkades niet op basis van een enkele User-Agent check, maar op een gedegen verificatieproces.

3. Eerst Loggen, Dan Blokkeren

Een veilige werkwijze is om niet meteen te blokkeren, maar eerst een observatiefase te houden. Noteer verdachte IP’s en User-Agents, en beperk in een tweede fase alleen duidelijk schadelijk gedrag. Pas in een derde fase blokkeert u verzoeken die zich als Googlebot voordoen maar niet binnen Google’s IP-bereik vallen.

Deze aanpak is vooral belangrijk voor e-commerce sites omdat een foutieve regel betalingsprocessen, winkelwagentjes, productvariaties of voorraadintegraties kan verstoren. Bij druk verkeer test u eerst in een staging-omgeving. WordPress site verhuizing en testomgeving opzetten maakt dat veiliger.

Veilige Voorbeelden van .htaccess Regels

De onderstaande voorbeelden moeten vóór implementatie getest worden op uw serverconfiguratie, Apache-versie en hosting-beperkingen. Apache 2.4 en mod_rewrite worden meestal ondersteund, maar sommige shared hosting-omgevingen beperken bepaalde directives. Maak altijd een back-up van uw .htaccess voordat u wijzigingen doorvoert. Een kleine syntaxisfout kan leiden tot een 500 Internal Server Error.

Eenvoudige Gedragsfilter: Valse Bots Blokkeren op Gevoelige Paden

Deze regel voorkomt dat bots die zich voordoen als Googlebot toegang krijgen tot gevoelige en aanvalsgedoelde bestanden. De echte Googlebot hoeft bijvoorbeeld niet wp-login.php, phpmyadmin of back-up zipbestanden te scannen. Dit vermindert het risico op false positives.

  • RewriteEngine On
  • RewriteCond %{HTTP_USER_AGENT} (Googlebot|Google-InspectionTool|AdsBot-Google|Mediapartners-Google) [NC]
  • RewriteCond %{REQUEST_URI} (wp-login[.]php|xmlrpc[.]php|phpmyadmin|adminer|backup|[.]sql|[.]zip) [NC]
  • RewriteRule ^ - [F,L]

Deze regel geeft een 403 als een client die zich als Googlebot voordoet een gevoelig pad probeert te bereiken. Dit heeft weinig impact op SEO omdat deze paden normaal niet geïndexeerd worden. Let op: bij WordPress moet u rekening houden met beveiligingsplugins, XML-RPC functionaliteit en externe publicatiediensten.

IP Whitelist Logica: Googlebot Verificatie via Officiële IP-bereiken

Een sterkere methode laat alleen verzoeken met Googlebot User-Agent toe die vanuit betrouwbare IP-bereiken komen. Onderstaand voorbeeld toont het principe; u moet de IP-bereiken automatisch updaten met de actuele JSON-lijsten van Google. Verouderde lijsten kunnen leiden tot false positives en daarmee blokkades van echte Googlebots.

  • RewriteEngine On
  • RewriteCond %{HTTP_USER_AGENT} (Googlebot|Googlebot-Image|Googlebot-News|Google-InspectionTool|AdsBot-Google) [NC]
  • RewriteCond expr "! ( %{REMOTE_ADDR} -ipmatch '66.249.64.0/19' || %{REMOTE_ADDR} -ipmatch '64.233.160.0/19' || %{REMOTE_ADDR} -ipmatch '72.14.192.0/18' )"
  • RewriteRule ^ - [F,L]

De IP-bereiken hierboven zijn slechts voorbeelden. In productie dient u altijd de officiële, actuele Google IP JSON-lijsten te gebruiken. Als uw server de Apache expressie of -ipmatch niet ondersteunt, controleer dan bij uw hostingprovider of Apache 2.4 expressie-ondersteuning beschikbaar is. Alternatief kunt u IP-whitelists toepassen op CDN- of WAF-niveau.

Vertragingsmaatregelen bij Verdacht Verzoekvolume

.htaccess is niet het beste middel voor geavanceerde rate limiting, maar kan wel helpen om bepaalde misdragingen vroegtijdig te stoppen. Voor echte snelheidsbeperkingen gebruikt u mod_evasive, mod_security, CDN rate limiting of applicatie-laag bescherming. Bots die meer dan 5-10 verzoeken per seconde sturen veroorzaken ook bij kleine sites extra databasebelasting. Vooral bij WordPress kunnen zoekpagina’s, gefilterde categorieën en tags door bots worden uitgebuit. Voor deze pagina’s is een combinatie van robots.txt, canonical tags, noindex en beveiligingsregels aan te raden. WordPress snelheid optimalisatie gids biedt extra prestatieadvies.

Vergelijkingstabel: Wanneer Welke Methode Toepassen?

Vergelijkingstabel: Wanneer Welke Methode Toepassen?
MethodeSterke puntenZwakke puntenAanbevolen gebruik
Alleen User-Agent controleHeel eenvoudig te implementerenGemakkelijk te vervalsen, hoge kans op foutenNiet alleen toepassen; alleen als voorfilter gebruiken
Reverse DNS verificatieBetrouwbare authenticatie van echte GooglebotNiet praktisch binnen .htaccess, automatische tooling nodigToepassen bij loganalyse, WAF of serverzijde verificatie
Google IP whitelistSnel en effectief blokkerenFoute blokkades bij verouderde lijstenIdeaal in Apache, firewall of CDN regels
Gedragsgebaseerde blokkadeBeschermt gevoelige paden en aanvalspatronenGeen identiteit verificatieEffectief bij wp-login, xmlrpc, backup en admin scans
CDN/WAF beschermingRate limiting, bot scoring en centrale regelbeheerFoutieve configuratie kan echte gebruikers treffenAan te raden bij druk verkeer, e-commerce en enterprise sites

Checklist om Per Ongelijk de Echte Googlebot Niet te Blokkeren

Checklist om Per Ongelijk de Echte Googlebot Niet te Blokkeren

Het grootste risico bij het blokkeren van valse Googlebots is dat u ook de echte Google crawlers afsluit. Voer na elke wijziging onderstaande controles uit:

  • Controleer in Google Search Console Crawlstatistieken op plotselinge dalingen of stijgingen in 403-responses.
  • Bekijk serverlogs of verzoeken van echte Google IP’s correcte 200, 301 of andere geldige statuscodes terugkrijgen.
  • Zorg dat uw robots.txt geen essentiële mappen voor Googlebot blokkeert, behalve waar strikt nodig.
  • Test na .htaccess-aanpassingen belangrijke pagina’s zoals sitemap, homepage, categorieën en productpagina’s.
  • Documenteer de bron en updatefrequentie van uw IP-whitelist.

Een 403-response is een sterke signaal naar bots. Als de echte Googlebot vaak 403 tegenkomt op belangrijke pagina’s, kan dat leiden tot minder crawlen. Gebruik 403 daarom alleen voor echt ongewenste bots en gevoelige paden. Bij onderhoud of tijdelijke pieken kan een 429 Too Many Requests soms beter zijn; maar voor eenvoudige botblokkades is 403 gebruikelijk en duidelijk.

Aanvullende Maatregelen voor WordPress en E-commerce

Bij WordPress ligt valse Googlebot-activiteit vaak op xmlrpc.php, wp-login.php, REST API endpoints, zoek-URL’s en auteursarchieven. E-commerce sites krijgen te maken met filterparameters, voorraadchecks, winkelwagen endpoints en productvariaties. Daarom is het belangrijk niet alleen Googlebot-imitators aan te pakken, maar ook de algemene bothygiëne.

  • Gebruik tweefactorauthenticatie en beperk het aantal inlogpogingen op loginpagina’s.
  • Schakel ongebruikte XML-RPC functionaliteit uit of beperk deze.
  • Plan noindex, canonical en robots.txt strategieën samen voor zoek- en filter-URL’s.
  • Gebruik up-to-date PHP-versies, actuele thema’s en betrouwbare plugins.
  • Houd uw SSL-certificaat actief voor veilige sessies en formulierverkeer via HTTPS. Hostragons SSL certificaten
  • Controleer regelmatig uw DNS-records; verkeerde DNS of zwakke e-mailinstellingen vergroten risico’s. Domeinsopzoeking en DNS-beheer

Impact op Prestaties: Hoe Botverkeer Serverbronnen Opvreet

Botverkeer is niet alleen een beveiligingsprobleem, maar ook een prestatieprobleem. Een statisch plaatje kost weinig resources, maar een WordPress-zoekpagina of WooCommerce-filterverzoek veroorzaakt database-queries. Als een valse Googlebot 300 dynamische verzoeken per minuut doet, kunnen PHP-workers uitputten, databaseverbindingen toenemen en echte gebruikers vertragen.

Neem als voorbeeld een productfilterpagina die gemiddeld 250 ms PHP-tijd nodig heeft. 600 botverzoeken per minuut genereren dan 150 seconden aan verwerking. Door parallelle verwerking raakt de CPU snel overbelast en stijgen de TTFB-waarden (Time To First Byte). Dit vertraagt de serverrespons en verslechtert de Core Web Vitals, wat de gebruikerservaring en conversies negatief beïnvloedt. Botblokkades zijn daarom essentieel voor zowel beveiliging als SEO en performance-optimalisatie.

Testen: Werken Uw Regels Echt?

Voer na het toevoegen van .htaccess-regels drie tests uit. Controleer eerst met een gewone browser of homepage, categorieën en inlogpagina’s gewoon bereikbaar zijn. Test daarna een belangrijke URL live met de URL Inspectie-tool in Google Search Console. Controleer tenslotte in de logs dat verdachte IP’s met Googlebot User-Agent een 403 krijgen, terwijl geverifieerde Google IP’s doorgelaten worden.

Met de commandline kunt u uzelf ook als Googlebot voordoen; dit toont alleen of de User-Agent-regel werkt, niet of de IP-verificatie klopt. De echte validatie gebeurt via IP en DNS. Krijgt u een 500-error? Dan is er waarschijnlijk een syntaxfout of een niet-ondersteunde directive in uw .htaccess. Verwijder de laatst toegevoegde regels, bekijk de error logs en controleer welke Apache-functies uw hosting ondersteunt.

Onderhoud: Hoe Vaak Regels Bijwerken?

Botblokkering is geen eenmalige klus. Google’s IP-bereiken veranderen, aanvallers passen hun User-Agents aan en uw site-structuur wijzigt. Voor sites met weinig verkeer volstaat maandelijks logcontrole. Drukke nieuws-, e-commerce- of campagnewebsites doen er goed aan wekelijks te controleren. Grote projecten kunnen automatische alerts instellen die u waarschuwen als het aantal ongeregistreerde “Googlebot” verzoeken een drempel overschrijdt.

Versiebeheer van uw .htaccess is ook een aanrader. Maak regelmatige back-ups met datums in de bestandsnaam, zoals htaccess-2024-06-15.bak, zodat u snel kunt terugrollen bij problemen. Documenteer ook wie welke regels heeft toegevoegd en waarom, zeker als meerdere mensen de site beheren. Dit voorkomt onnodige onderbrekingen.

Conclusie

Het herkennen en blokkeren van valse Googlebots met .htaccess beschermt uw SEO-positie en serverprestaties als het goed wordt toegepast. De belangrijkste regel is: vertrouw User-Agent niet alleen, maar combineer IP-, DNS-verificatie en gedragsanalyse via logs. Begin met observeren, beperk eerst risicovolle paden en pas daarna blokkeerregels toe op basis van actuele Google IP-whitelists.

Met Hostragons als uw hostingpartner bouwt u aan een stabiele website met veilige hosting, up-to-date SSL, correcte DNS-instellingen en regelmatige back-ups. U kunt starten met het analyseren van uw huidige botverkeer en indien nodig upgraden naar een krachtiger en veiliger pakket via Hostragons hosting pakketten.

Veelgestelde Vragen

Beïnvloedt een valse Googlebot mijn echte Google rankings?

Indirect wel. Valse Googlebots kunnen serverbronnen opslokken, waardoor echte gebruikers en Googlebot trager worden bediend. Daarnaast kan vervuiling van logbestanden uw SEO-analyse verstoren. Correct blokkeren beschermt uw crawlbudget en performance.

Is het verstandig om alle Googlebot User-Agent verzoeken via .htaccess te blokkeren?

Nee. Daarmee blokkeert u ook de echte Googlebot, wat tot indexatieproblemen leidt. Controleer User-Agents eerst via IP/DNS en blokkeer alleen verdachte verzoeken. De veiligste aanpak combineert whitelists met gedragsregels.

Hoe vaak moet ik Googlebot IP-lijsten updaten?

Voor drukke sites wekelijks, voor kleinere sites maandelijks. De beste methode is het automatisch ophalen van Google’s officiële IP JSON-bronnen. Handmatig beheer van verouderde lijsten veroorzaakt fouten en kan echte bots blokkeren.

Ik kreeg een 500-fout na het toevoegen van een .htaccess-regel, wat nu?

Een 500-fout wijst meestal op een syntaxfout, niet-ondersteunde directive of onjuiste escape-tekens. Verwijder recent toegevoegde regels, controleer de error logs en bevestig dat uw hosting Apache 2.4, mod_rewrite en expressies ondersteunt. Maak altijd eerst een backup.

Is een .htaccess-regel nodig als ik een CDN of WAF gebruik?

CDN en WAF bieden sterke botfilters, maar .htaccess blijft een nuttige back-up en beschermingslaag dicht bij de applicatie. De beste resultaten bereikt u door geavanceerde botverificatie en rate limiting in CDN/WAF te combineren met gevoelige padbeperkingen in .htaccess.

Deel dit artikel:

Hostragons Team

Actuele handleidingen van ons expertteam over hosting, servers en domeinnamen. Laten we samen de juiste oplossing voor uw project vinden.

Neem contact met ons op