Een artikel dat drie minuten geleden is gepubliceerd en dat de volgende dag pas in Google News verschijnt, is een dood artikel. Op een nieuwswebsite bepaalt de snelheid van indexering de zichtbaarheid. De speciale sitemap voor nieuws is de technische hefboom die deze opname door de robots versnelt.
Hier gaat het niet om de klassieke sitemap die voor bezoekers wordt weergegeven. De XML-sitemap voor nieuws is een gestructureerd bestand dat door zoekmachines wordt gelezen en dat in real-time de recent gepubliceerde inhoud signaleert. De configuratie verschilt radicaal van een standaard sitemap, en het is precies dit verschil dat problemen oplevert voor de meeste online redacties.
Venster van 48 uur en limiet van 1.000 artikelen: de specifieke beperkingen van de nieuws-sitemap
Wanneer je een informatiewebsite beheert, ontdek je al snel dat Google strikte regels toepast op de News sitemap. Het bestand mag alleen artikelen bevatten die in de afgelopen twee dagen zijn gepubliceerd. Daarboven hebben de URL’s geen plaats meer in dit bestand (ze blijven in de algemene sitemap van de site).
De tweede beperking betreft het volume: elk bestand is beperkt tot 1.000 news:news tags. Voor een redactie die massaal publiceert, moet de sitemap in meerdere bestanden worden opgesplitst en worden samengevoegd via een index. Deze limiet negeren betekent het risico lopen dat Google slechts een deel van het bestand leest, waardoor recente artikelen buiten zijn radar blijven.
Voor elke URL moeten verplichte velden in de XML staan: de exacte naam van de publicatie, de taal, de datum van de eerste publicatie in W3C-formaat en de titel van het artikel. De titel mag noch de naam van het medium, noch die van de auteur bevatten. Dit laatste punt is vaak slecht geconfigureerd, wat leidt tot stille afwijzingen in de Search Console.
Om te observeren hoe een informatiewebsite deze structuur concreet opbouwt, kan men de sitemap van La Gazette de Constantine raadplegen en controleren hoe de URL’s zijn georganiseerd per categorie en per datum.

Nieuws-sitemap als realtime feed: waarom automatische updates alles veranderen
Een statische sitemap, die eenmaal per dag wordt vernieuwd, is niet meer voldoende voor een nieuwswebsite. De trend die bij uitgevers de afgelopen jaren is waargenomen, is om de News sitemap te behandelen als een dynamische feed, die in de minuten na elke publicatie wordt bijgewerkt.
Concreet betekent dit dat het CMS (WordPress, Drupal of een eigen systeem) de regeneratie van het XML-bestand moet activeren zodra een artikel de status “gepubliceerd” krijgt. Op WordPress beheren extensies zoals SEO Press of Yoast deze automatisering. Bij een eigen CMS is het aan de ontwikkelaar om deze trigger te coderen.
Een sitemap die per minuut wordt bijgewerkt, vermindert de indexeringstijd aanzienlijk in vergelijking met een dagelijkse regeneratie. De terugkoppeling varieert op dit punt afhankelijk van de crawlfrequentie die Google aan het domein toekent, maar het principe blijft hetzelfde: hoe verser het bestand, hoe sneller de robot voorbij komt.
De valkuilen van automatische updates
Automatiseren betekent niet vergeten. Drie fouten komen regelmatig voor in redacties:
- Artikelen in concept of “voorpublicatie” in de sitemap laten verschijnen, wat Google URL’s stuurt die een 404-fout of een beveiligde pagina teruggeven.
- Artikelen ouder dan 48 uur niet uit de News sitemap verwijderen, wat de versheidsbeperking schendt en kan leiden tot een waarschuwing in de Search Console.
- De titel van een artikel na publicatie wijzigen zonder dat de
news:newstag in de XML wordt bijgewerkt, wat een inconsistentie creëert tussen het bestand en de werkelijke pagina.
Verplichte XML-tags voor een Google Nieuws-sitemap
De nieuws-sitemap gebruikt een specifieke XML-namespace die aan het standaard sitemapprotocol wordt toegevoegd. Zonder deze namespace negeert Google de nieuwsinhoud volledig en behandelt het bestand als een gewone sitemap.
Hier zijn de tags die voor elk artikel moeten worden opgenomen:
news:publicationbevat twee sub-tags:news:name(de exacte naam van het medium zoals geregistreerd in Google News) ennews:language(ISO-taalcode, bijvoorbeeld “fr”).news:publication_dategeeft de datum en tijd van de eerste publicatie aan, in volledig W3C-formaat (jaar-maand-dagTuur:minuut:secondeTtijdzone).news:titleherhaalt de titel van het artikel, zonder vermelding van het medium of de auteur. Een verkeerd geformatteerde titel veroorzaakt een stille afwijzing in de News-index.
De naam van de publicatie in de news:name tag moet exact overeenkomen met die in het Google Publisher Center. Een te veel aan hoofdletters, een ontbrekende accent, en de link tussen de sitemap en het uitgeversaccount is verbroken.

Controle in de Search Console
Na indiening van de sitemap in Google Search Console (sectie Sitemaps, directe URL van het bestand), houdt men twee indicatoren in de gaten: het aantal gedetecteerde URL’s en het aantal geïndexeerde URL’s. Een groot verschil tussen de twee wijst op een probleem met het formaat of de inhoud. De console toont ook de specifieke fouten met betrekking tot de nieuws-tags, wat het mogelijk maakt om snel een defecte configuratie te corrigeren.
HTML-sitemap en XML-sitemap: twee verschillende toepassingen voor een nieuwswebsite
Men verwart vaak de XML-sitemap (bedoeld voor robots) en de HTML-sitemap (bedoeld voor lezers). Op een nieuwswebsite hebben beide hun nut, maar ze vervullen niet dezelfde functie.
De HTML-sitemap is een navigatiepagina die toegankelijk is voor bezoekers, die de secties, categorieën en soms recente artikelen opsomt. Het helpt een verloren lezer om een sectie van de site terug te vinden. Voor SEO distribueert het interne links naar diepere pagina’s die niet worden benadrukt door de hoofdnavige.
De XML-sitemap daarentegen wordt nooit door lezers gezien. Het spreekt uitsluitend de zoekmachines aan. Voor een nieuwswebsite onderhoudt men in werkelijkheid meerdere XML-bestanden: een algemene sitemap (alle blijvende pagina’s), een nieuws-sitemap (artikelen van de afgelopen 48 uur) en eventueel een afbeeldingen- of video-sitemap als de site deze regelmatig publiceert.
Het scheiden van deze bestanden voorkomt dat verse artikelen in een massa oude URL’s worden verdrongen. Google kent een andere crawprioriteit toe afhankelijk van het type sitemap, en deze scheiding vergemakkelijkt het werk voor hen.
Het technische punt dat vaak over het hoofd wordt gezien: een sitemapindex (bestand dat alle subsitemaps opsomt) moet worden verklaard in het robots.txt-bestand in de root van de site. Zonder deze verklaring ontdekken de robots de secundaire bestanden niet automatisch, zelfs als ze correct zijn geformatteerd.



