Wie buiten de index valt, verliest niet van de concurrent — die doet niet eens mee aan de wedstrijd. Dit artikel laat zien waarom ontdekking, crawlen en indexering drie losse fasen zijn, wat de Indexing Hub van het Semalt-paneel daarvan meetbaar maakt, en welke grenzen dat instrument bewust stelt.
Bijna elk SEO-plan begint bij teksten, zoekwoorden en links, en dat is begrijpelijk: daar is het werk zichtbaar en bespreekbaar. De stap ervoor blijft ondertussen onbesproken. Kent de zoekmachine uw pagina eigenlijk, en heeft hij besloten haar te bewaren? Zolang dat open blijft, sleutelt u aan iets waarvan de zoekmachine het bestaan niet erkent.
Dit is bovendien geen kwestie van grote portalen alleen. Een Amsterdams evenementenplatform met duizenden losse voorstellingen, een webshop in de creatieve sector met een breed assortiment, een softwarebedrijf met tweetalige documentatie: in al die gevallen komen er adressen bij in een tempo dat niemand nog met de hand volgt. Dat er een achterstand is, blijkt meestal pas wanneer het organische verkeer stilvalt terwijl de redactie wekelijks publiceert.
Drie fasen die vaak voor één worden aangezien
De hardnekkigste denkfout behandelt indexering als één gebeurtenis die wel of niet plaatsvindt. In werkelijkheid zijn het drie opeenvolgende fasen met een eigen logica en een eigen soort blokkade. Een probleem dat in de eerste fase ontstaat, laat zich in de derde niet repareren, hoeveel indieningen u er ook tegenaan gooit.
- Ontdekking. De zoekmachine verneemt dat een adres bestaat, via interne verwijzingen, een sitemap, een externe link of een actieve melding. Zonder route naartoe bestaat de pagina niet in zijn wereldbeeld.
- Crawlen. De bot haalt het adres daadwerkelijk op. Hoeveel ophaalacties uw domein binnen een periode krijgt, heet crawlbudget en volgt uit serverprestaties, eerdere antwoordkwaliteit en de ingeschatte waarde van het domein.
- Indexering. De opgehaalde pagina wordt beoordeeld en bewaard, of juist niet. Dit besluit gaat over inhoud, dubbelingen en signalen die elkaar al dan niet tegenspreken.
Tussen die drie handelingen kunnen weken zitten. Een adres kan al maanden bekend zijn zonder ooit te zijn opgehaald; een adres kan opgehaald zijn en toch geweigerd. Wie dat onderscheid vasthoudt, stelt de enige vraag die verder helpt: bij welke stap loopt het vast? Een breder overzicht van alle modules staat in de beschrijving van het vernieuwde Semalt-paneel; hier gaat het uitsluitend over het indexeringsdeel.
| Wat u waarneemt | Fase waarin het misgaat | Wat u doet |
|---|---|---|
| Geen bot heeft de URL ooit bezocht | Ontdekking | Interne verwijzing maken, sitemap aanvullen, actief melden |
| Bezoek geregistreerd, maar met een serverfout | Crawlen | Infrastructuur en responstijden onder belasting nakijken |
| Bezoek geslaagd, pagina blijft buiten de index | Indexering | Inhoud, canonieke URL en interne signalen op één lijn brengen |
| Alleen diepe pagina's blijven achter | Ontdekking en crawlen | Klikdiepte verkleinen, paginering en filters opschonen |
| Nieuwe pagina's verschijnen pas na weken | Ontdekking | Actieve melding inzetten in plaats van op een routinebezoek wachten |
Zes oorzaken die zich steeds herhalen
Bij audits keren dezelfde oorzaken terug met een voorspelbaarheid die bijna komisch is. De zes hieronder dekken het overgrote deel van de gevallen, geordend naar de fase waarin ze ontstaan.
| Oorzaak | Fase | Hoe u het herkent | Wat het oplost |
|---|---|---|---|
| Weespagina zonder inkomende links | Ontdekking | Antwoordt met status 200, komt in geen enkele sitemap of navigatie voor | Opnemen in een relevante rubriek en in de sitemap |
| Te grote klikdiepte | Ontdekking | Twaalf kliks vanaf de homepage, alleen bereikbaar via paginering | Plattere structuur, hubpagina's, betere interne verwijzingen |
| Dubbele inhoud door parameters | Indexering | Hetzelfde artikel via drie paden, met sorteer- en filtervarianten | Eén canonieke URL kiezen en die consequent gebruiken |
| Tegenstrijdige canonicals | Indexering | Paginering wijst naar pagina één, doelen redirecten of ontbreken | Canonical laten wijzen naar een bestaande, indexeerbare URL |
| robots.txt verward met noindex | Crawlen | Geblokkeerde URL blijft in de index staan, want de noindex is onleesbaar | Toegang openzetten en de noindex laten lezen |
| Trage of instabiele levering | Crawlen | Responstijden lopen op onder belasting, 5xx-fouten in pieken | Caching, hosting en foutafhandeling op orde brengen |
Twee van deze zes verdienen een waarschuwing apart. De verwarring tussen robots.txt en noindex kost bij elke livegang opnieuw weken: een geblokkeerd adres wordt niet gelezen, dus de instructie erin ook niet. En een canonical is een aanbeveling, geen bevel; de zoekmachine mag een andere variant kiezen dan u bedoelde.
Amsterdam voegt daar een eigen verzwaring aan toe. Een bedrijf dat zijn aanbod in het Nederlands én het Engels publiceert — en dat is hier eerder regel dan uitzondering — verdubbelt zijn voorraad adressen. Het crawlbudget verdubbelt niet mee. Wie grote volumes beheert zonder de responstijden in de hand te hebben, begint dus niet bij de indiening maar bij de technische basis.
De Indexing Hub: de grenzen zijn het ontwerp
Drie functies zitten in de Indexing Hub bij elkaar: adressen aanmelden, sitemaps uitlezen en registreren wat de bots er vervolgens mee doen. Het bruikbaarst eraan zijn niet de mogelijkheden maar de limieten, want die bepalen wat er binnen welke termijn haalbaar is.
Het kleinste getal is het interessantste. Duizend adressen per dag is ruim bemeten voor een bedrijfssite van zeventig pagina's, maar bij een catalogus van tienduizenden adressen wordt het een schaars middel dat om verdeling vraagt, net als mediabudget. Precies daarin zit de winst van die limiet: ze dwingt tot een keuze die anders eindeloos vooruit wordt geschoven.
Massa-indiening van adressen
Voor momenten waarop veel URL's tegelijk veranderen: een migratie, een restyling, een nieuw seizoen.
- Eén verzending, geen porties. De hele lijst gaat in één keer de deur uit; het opdelen in hanteerbare stukken vervalt.
- Het dagbudget blijft de rem. Tienduizend adressen in één keer aanleveren levert nog altijd tien dagen verwerking op. De omvang van de batch verandert de doorlooptijd dus niet.
- De sortering is de eigenlijke beslissing. Bij een krap budget is de rangschikking het enige wat u nog kunt sturen, en zij bepaalt de opbrengst van week één.
- Voor uitzonderingen, niet voor de routine. Het dagelijkse publicatietempo van een normale site komt nooit in de buurt van deze grens.
Sitemapverwerking
Voor verzamelingen die al in sitemap-indexen zijn georganiseerd, bijvoorbeeld per taal of per categorie.
- Upload of verwijzing. Zowel een geüpload bestand als een openbaar adres wordt geaccepteerd, zodat u een opzet ook kunt doorrekenen voordat die live staat.
- Ketens tot drie lagen diep. Verwijst een index naar een volgende index, dan wordt die keten uitgeklapt tot drie lagen. Wie dieper nest, kan de opzet beter platslaan.
- Duizend bestanden in één taak. Daarmee dekt één ronde de complete opsplitsing van een grote site naar taal, rubriek of soort inhoud.
- Twee tegelijk, twintig wachtend. Genoeg voor een bureau met een handvol Amsterdamse klanten, mits iemand de volgorde bewaakt: de livegang van vrijdag hoort vóór het routineonderhoud te staan.
Beide ingangen monden uit in dezelfde waarneming en delen hetzelfde dagbudget. Hoe de indexeringsmodule van Semalt zich verhoudt tot de analyse- en campagneonderdelen, staat beschreven in het platformoverzicht.
Duwen in plaats van wachten
Van oudsher haalt de zoekmachine op wanneer het hém uitkomt. Op een domein met weinig activiteit kan een diepe pagina daar weken op wachten, en bij een prijswijziging of een sluitende inschrijving zijn dat precies de weken die tellen. De IndexNow-koppeling keert die richting om: de site geeft zelf een signaal af aan GoogleBot en BingBot zodra er iets is veranderd.
Bij wijzigingen levert dat vooral doorlooptijd op. Een aangepaste omschrijving, een nieuwe prijs, een geopende agenda of een heropende rubriek hoeft niet te wachten tot er toevallig iemand langskomt. Voor alles wat aan een kalender hangt — evenementen, toerisme, horeca, seizoensaanbod — beslist dat of u zichtbaar bent terwijl de vraag er is, of pas daarna.
Wat er wél verandert, is de vraag die u kunt stellen. Niet langer: kent de zoekmachine deze pagina eigenlijk? Maar: hij kent haar, hij heeft haar opgehaald en toch staat ze er niet — wat houdt hem tegen? Dat tweede is te onderzoeken.
Inhoud die net is veranderd
Een nieuwe prijs, een gewijzigde openingstijd, een bijgewerkte omschrijving: hier telt elke dag die u eerder bent.
- Aanbod met een einddatum
- Pagina's die het seizoen dragen
Adressen die net bereikbaar zijn
Een opgeheven blokkade, een verwijderde noindex of een nieuwe rubriek die nog nergens vandaan wordt aangeklikt.
- Na een livegang of migratie
- Na het repareren van robots.txt
Pagina's die niet zijn gewijzigd
Opnieuw melden zonder wijziging kost dagbudget en levert niets op. De zoekmachine heeft zijn oordeel al gevormd.
- Herhalen versnelt geen besluit
Pagina's die worden geweigerd
Dunne inhoud, een duplicaat of een tegenstrijdige canonical wordt door een melding niet acceptabeler.
- Eerst de oorzaak, dan de indiening
Van vermoeden naar statuscode
Niet het versturen maar het bijhouden maakt deze module bruikbaar. Voor elk adres wordt vastgelegd wanneer er een bot langskwam, welke status hij aantrof en welk foutdetail daarbij hoorde. Daarnaast lopen drie tellers mee — ingediend, gevonden, mislukt — die tijdens een lopende taak al meebewegen, zodat u niet in het duister zit te wachten.
De drie gegevens werken alleen samen. Uit het tijdstip blijkt of er überhaupt is opgehaald, de status verraadt of u met een technische of een inhoudelijke kwestie te maken hebt, en het foutdetail wijst aan waar de reparatie zit. Daarmee eindigt een discussie die in veel projecten jarenlang kan blijven hangen — dat Google een bepaalde pagina om onnavolgbare redenen zou weren — en begint een takenlijst met eigenaren.
- Gemeld, nooit opgehaald. De teller registreert de indiening, het logboek blijft leeg. Kijk dan naar robots.txt, naar de belasting van de server en naar een mogelijke afremming van het hele domein.
- Opgehaald, maar de server bezweek. Een 5xx tijdens het bezoek is zelden een probleem van deze ene pagina; het drukt op de doorvoer van het hele domein.
- Opgehaald, maar er stond niets. Status 404 of 410 wijst op een verouderde regel in de sitemap of een verwijzing naar verwijderde inhoud. Schrappen dus, niet opnieuw versturen.
- Opgehaald, maar doorgestuurd. U hebt een tussenstation aangemeld in plaats van de eindbestemming. Meld voortaan het definitieve adres.
- Opgehaald, gelezen, geweigerd. Technisch is alles in orde. De oorzaak ligt dan in de inhoud, in de canonieke verwijzing of in het ontbreken van interne links.
Veertigduizend adressen bij duizend per dag
Het volgende rekenvoorbeeld dient om de ordegrootte voelbaar te maken; het is nadrukkelijk geen meting aan een bestaand project.
Een Amsterdams handelsplatform heeft 40.000 adressen in zijn sitemaps staan, Nederlandse en Engelse versies bij elkaar opgeteld. Met 1.000 adressen per dag kost één complete ronde veertig dagen, en dat cijfer geldt alleen bij een volledig benut budget zonder enige herhaling. Tel de correctierondes erbij op en u zit op zes tot acht weken. Een batchgrootte van tienduizend verandert daar niets aan; die neemt alleen het knip- en plakwerk weg.
Zes weken is te lang voor een aanbod met een houdbaarheidsdatum. Dat pleit niet tegen het instrument maar vóór sorteren. Een aannemelijke opdeling van diezelfde veertigduizend ziet er als volgt uit.
- Ongeveer 14.500 filter- en parametervarianten. Sorteringen, prijsbereiken, sessieparameters. Dit is een canoniseringsvraagstuk; verbruikt budget: nul.
- Ongeveer 9.200 verlopen items. Afgelopen data, uit de handel genomen artikelen. Die vragen om een redirect of om een nette 410, niet om indiening.
- Ongeveer 260 rubriek- en landingspagina's. Zij dragen het leeuwendeel van de omzet en passen samen in een kwart dagbudget.
- Ongeveer 4.400 actuele aanbodpagina's in beide talen. Die volgen in vier tot vijf dagen en dekken de lopende handel.
- Ongeveer 11.640 archief- en longtailpagina's. Die lopen daarna op de achtergrond mee, zonder deadline en zonder druk.
Wat op veertig dagen leek, krimpt zo tot vijf dagen voor alles wat geld oplevert. Die winst komt uit de sortering en niet uit de techniek. Voor een tweetalige site komt er één criterium bij: beslis expliciet welke taalversie voorgaat. Een Engelse productpagina die niet is opgenomen kost bij een internationale klantenkring evenveel als de Nederlandse tegenhanger, maar in een gemiddelde over het hele domein valt dat verlies weg. De zichtbaarheidsrapportages van hetzelfde platform staan in hetzelfde account, zodat u die controle niet apart hoeft in te richten.
Sitemaphygiëne en een werkbare volgorde
Een sitemap is geen voorraadlijst maar een voordracht: met elke regel zegt u dat déze pagina het bewaren waard is. Bestaat een kwart van het bestand uit doorverwijzingen, foutpagina's en adressen met noindex, dan zakt het gezag van het geheel — inclusief dat van de regels die er volkomen terecht in staan.
Indexeerbare eindbestemmingen
Alleen canonieke adressen met status 200, precies zoals ze definitief geschreven worden.
- Waarheidsgetrouwe lastmod, geen nachtelijke opfrisbeurt
- Aparte bestanden per taal en per soort inhoud
- Een overkoepelende index die binnen drie lagen blijft
Alles wat toch wordt geweigerd
Elk adres dat de zoekmachine hoe dan ook afwijst, verzwakt de strekking van het bestand.
- Noindex, geblokkeerde adressen, redirects
- Gefilterde varianten en interne zoekresultaten
- Winkelwagen, klantomgeving, testhosts, foutpagina's
De werkvolgorde begint daarom met schoonmaken en niet met verzenden. Saneer eerst de bestanden en laat ze daarna uitlezen, als upload of als verwijzing, afhankelijk van of ze al openbaar staan. Wat terugkomt is een nulmeting: hoeveel adressen gevonden zijn, hoeveel er struikelden en welke statuscodes zich opstapelen.
Die lijst met fouten ruimt u op voordat er ook maar één dagbudget aan opgaat. Pas dan gaat de gesorteerde lijst de deur uit, met de dragende pagina's bovenaan. Een week later bevat het logboek genoeg materiaal voor drie stapels: opgehaald en bewaard, opgehaald en geweigerd, en nooit bezocht. De laatste stapel is technisch werk, de middelste redactioneel.
Veelgestelde vragen
Hoe lang duurt het voordat een ingediend adres in de index staat?
Een harde termijn bestaat niet, en elk getal dat u ergens leest is een schatting. Wat u wél verkort is de weg naar ontdekking en naar het eerste ophaalmoment. De opname zelf blijft een besluit van de zoekmachine. Het logboek toont in ieder geval of dat ophalen heeft plaatsgevonden, en daarmee hebt u de helft van het antwoord al binnen.
Zijn duizend adressen per dag genoeg voor een middelgrote webshop?
Voor het dagelijkse ritme vrijwel altijd. Zelfs een druk publicatieschema blijft ver onder duizend gewijzigde adressen per etmaal. Krap wordt het bij een eerste volledige inventarisatie, bij een restyling of bij een migratie — precies de momenten waarop voorsorteren zich uitbetaalt, omdat het commercieel dragende deel van een catalogus doorgaans klein is.
Hoe pakt u een site aan die zowel Nederlands als Engels bedient?
Beide versies zijn zelfstandige adressen en trekken allebei aan hetzelfde dagbudget. Zet de bestanden per taal apart onder één overkoepelende index — die keten klapt de verwerking zonder moeite uit — en leg daarna vast welke taal voorrang krijgt. Taalherkenning zit niet in het instrument; die keuze komt uit uw eigen structuur en prioriteiten.
Wat gebeurt er als ik hetzelfde adres meerdere keren indien?
Dan gaat er budget op aan niets. Een pagina die niet is veranderd, wordt door herhaling niet sneller beoordeeld. Een tweede melding loont alleen na een echte wijziging: andere inhoud, een gecorrigeerde canonical of een blokkade die u zojuist hebt weggehaald.
Waarom staan er pagina's in de index die ik juist wilde uitsluiten?
Vrijwel altijd door de verwarring tussen robots.txt en noindex. Een via robots.txt geblokkeerd adres wordt niet opgehaald, dus de noindex erin wordt nooit gelezen, en de pagina kan op basis van externe verwijzingen toch in de index blijven staan. Zet de toegang open, laat de noindex lezen en blokkeer pas daarna weer, als dat nog nodig is.
Waar zichtbaarheid werkelijk begint
Indexering is een onderschat knelpunt omdat het zich nooit als storing aandient. Er gaat geen alarm af en er kleurt geen balk rood; er zijn alleen pagina's die nul vertoningen halen. Wie dat niet meet, kan maanden aan teksten en links besteden terwijl de blokkade een fase eerder zit.
De Indexing Hub lost dat niet met één druk op de knop op. Hij zet drie dingen naast elkaar die afzonderlijk weinig betekenen: een doorvoerlimiet die u dwingt te kiezen, een signaal dat de weg naar ontdekking bekort, en een registratie die gissen vervangt door tijdstippen en statuscodes. De begrenzingen horen bij dat beeld — duizend adressen per etmaal is eindig, twee parallelle taken ook, en een melding blijft een melding.
Die nuchterheid is nu juist wat het werk planbaar maakt. Wie op papier heeft staan dat veertigduizend adressen bij vol budget veertig dagen vragen, maakt andere afspraken dan wie op verzenden drukt en er het beste van hoopt. Wilt u weten hoeveel van uw eigen pagina's werkelijk worden opgehaald, begin dan met één sitemapronde via het Semalt-paneel en uw eerste indexeringstaak. Die eerste stand van zaken is doorgaans leerzamer dan verwacht — en op tweetalige Amsterdamse sites zit de grootste verrassing bijna altijd in de taalversie waar niemand naar keek.
Hulp Nodig met Uw SEO?
Onze Amsterdam SEO-experts kunnen u helpen deze strategieën te implementeren en uw rankings te verbeteren.
Gratis Consult Aanvragen