Skip to content

Descubra como navegar de forma fácil e eficiente com um sitemap de site de notícias

Um artigo publicado há três minutos que não aparece no Google News antes do dia seguinte é um artigo morto. Em um site…

Femme professionnelle étudiant un sitemap de site d'actualité imprimé sur un bureau en bois dans un bureau moderne

Um artigo publicado há três minutos que não aparece no Google News antes do dia seguinte é um artigo morto. Em um site de notícias, a velocidade de indexação condiciona a visibilidade. O sitemap dedicado às notícias é o mecanismo técnico que acelera essa consideração pelos robôs.

Não estamos falando aqui do sitemap clássico exibido para os visitantes. O sitemap XML para notícias é um arquivo estruturado, lido pelos motores de busca, que sinaliza em tempo real os conteúdos recém-publicados. Sua configuração difere radicalmente de um sitemap padrão, e é precisamente essa diferença que causa problemas para a maioria das redações online.

Janela de 48 horas e limite de 1.000 artigos: as restrições específicas do sitemap de notícias

Quando se gerencia um site de informação, descobre-se rapidamente que o Google aplica regras rigorosas ao News sitemap. O arquivo deve conter apenas artigos publicados nos últimos dois dias. Além disso, as URLs não têm mais lugar nesse arquivo (elas permanecem no sitemap geral do site).

A segunda restrição diz respeito ao volume: cada arquivo é limitado a 1.000 tags news:news. Para uma redação que publica em grande quantidade, é necessário dividir o sitemap em vários arquivos e agrupá-los por meio de um índice. Ignorar esse limite significa arriscar que o Google leia apenas uma parte do arquivo, deixando artigos recentes fora de seu radar.

Para cada URL, campos obrigatórios devem constar no XML: o nome exato da publicação, o idioma, a data da primeira publicação no formato W3C e o título do artigo. O título não deve conter nem o nome da mídia nem o do autor. Este último ponto é frequentemente mal configurado, o que resulta em rejeições silenciosas na Search Console.

Para observar como um site de informação estrutura concretamente essa árvore, pode-se consultar o sitemap de La Gazette de Constantine e verificar a forma como as URLs estão organizadas por categoria e por data.

Homem apresentando uma arquitetura de sitemap de site de notícias em um quadro de vidro em uma sala de reunião

Sitemap de notícias como fluxo em tempo real: por que a atualização automática muda tudo

Um sitemap estático, regenerado uma vez por dia, não é mais suficiente para um site de notícias. A tendência observada entre os editores nos últimos anos é tratar o News sitemap como um fluxo dinâmico, atualizado nos minutos que se seguem a cada publicação.

Concretamente, isso significa que o CMS (WordPress, Drupal ou sistema próprio) deve acionar a regeneração do arquivo XML assim que um artigo passa para o status “publicado”. No WordPress, extensões como SEO Press ou Yoast gerenciam essa automação. Em um CMS proprietário, cabe ao desenvolvedor codificar esse acionador.

Um sitemap atualizado a cada minuto reduz o tempo de indexação de forma significativa em comparação a uma regeneração diária. Os retornos variam nesse ponto de acordo com a frequência de rastreamento que o Google concede ao domínio, mas o princípio permanece o mesmo: quanto mais fresco o arquivo, mais rápido o robô passa.

Os armadilhas da atualização automática

Automatizar não significa esquecer. Três erros ocorrem regularmente nas redações:

  • Deixar artigos em rascunho ou em “pré-publicação” aparecerem no sitemap, o que envia ao Google URLs que retornam um erro 404 ou uma página protegida.
  • Não remover os artigos com mais de 48 horas do News sitemap, o que viola a restrição de frescor e pode resultar em um aviso na Search Console.
  • Modificar o título de um artigo após a publicação sem que a tag news:news seja atualizada no XML, criando uma incoerência entre o arquivo e a página real.

Tags XML obrigatórias para um sitemap Google Notícias

O sitemap de notícias utiliza um namespace XML específico que se adiciona ao protocolo de sitemap padrão. Sem esse namespace, o Google ignora pura e simplesmente as informações de notícias e trata o arquivo como um sitemap comum.

Abaixo estão as tags a serem integradas para cada artigo:

  • news:publication contém duas sub-tags: news:name (o nome exato da mídia como registrado no Google News) e news:language (código de idioma ISO, por exemplo “pt”).
  • news:publication_date indica a data e a hora da primeira publicação, no formato W3C completo (ano-mês-diaThora:minuto:segundo.fuso horário).
  • news:title retoma o título do artigo, sem menção da mídia ou do autor. Um título mal formatado provoca uma rejeição silenciosa no índice de notícias.

O nome da publicação na tag news:name deve corresponder exatamente ao que foi declarado no Centro para Editores do Google. Uma letra maiúscula a mais, um acento faltando, e o vínculo entre o sitemap e a conta do editor é rompido.

Jovem mulher navegando em um sitemap de site de notícias via tablet em um escritório em casa acolhedor

Verificação na Search Console

Após a submissão do sitemap no Google Search Console (seção Sitemaps, URL direta do arquivo), monitoramos dois indicadores: o número de URLs detectadas e o número de URLs indexadas. Uma grande discrepância entre os dois sinaliza um problema de formato ou de conteúdo. A console também exibe os erros específicos das tags de notícias, o que permite corrigir rapidamente uma configuração defeituosa.

Sitemap HTML e sitemap XML: dois usos distintos para um site de notícias

Confunde-se frequentemente o sitemap XML (destinado aos robôs) e o sitemap HTML (destinado aos leitores). Em um site de notícias, ambos têm sua utilidade, mas não desempenham a mesma função.

O sitemap HTML é uma página de navegação acessível aos visitantes, que lista as seções, categorias e às vezes os artigos recentes. Ele ajuda um leitor perdido a encontrar uma seção do site. Para o SEO, ele distribui links internos para páginas profundas que a navegação principal não destaca.

O sitemap XML, por sua vez, nunca é visto pelos leitores. Ele fala exclusivamente com os motores de busca. Para um site de notícias, na verdade, mantemos vários arquivos XML: um sitemap geral (todas as páginas permanentes), um sitemap de notícias (artigos das últimas 48 horas) e, eventualmente, um sitemap de imagens ou vídeos se o site os publica regularmente.

Separar esses arquivos evita afogar os artigos frescos em uma massa de URLs antigas. O Google concede uma prioridade de rastreamento diferente de acordo com o tipo de sitemap, e essa separação facilita seu trabalho.

O ponto técnico que muitas vezes passa despercebido: um sitemap index (arquivo que lista todos os subsitemas) deve ser declarado no arquivo robots.txt na raiz do site. Sem essa declaração, os robôs não descobrem automaticamente os arquivos secundários, mesmo que estejam formatados corretamente.

Descubra como navegar de forma fácil e eficiente com um sitemap de site de notícias