Translate

sexta-feira, 2 de março de 2018

Blog Analytics : Parte I – Como Descobrir HTML Invisível no Blogger Usando o Feed Atom Quando o Navegador Diz "Está Tudo Certo"... Mas o Feed Conta Outra História

 

Bellacosa Mainframe e o blog analytics parte i

☕ Um Café no Bellacosa Mainframe

Blog Analytics : Parte I – Como Descobrir HTML Invisível no Blogger Usando o Feed Atom

Quando o Navegador Diz "Está Tudo Certo"... Mas o Feed Conta Outra História

☕ Um Café no Bellacosa Mainframe

Durante muitos anos imaginei que o Blogger fazia uma limpeza completa do conteúdo que recebia. Afinal, se um post aparecia corretamente no navegador, por que deveria existir qualquer problema escondido?

Foi somente depois de milhares de publicações, centenas de artigos técnicos e uma curiosidade típica de quem trabalha com sistemas críticos IBM Mainframe que resolvi investigar uma hipótese aparentemente absurda:

Será que o Blogger armazena HTML invisível que nunca aparece para o leitor?

A resposta me surpreendeu.

E talvez surpreenda você também.


O Erro de Todo Blogueiro

A maioria das pessoas verifica apenas uma coisa:

  • o post abriu;

  • as imagens aparecem;

  • os títulos ficaram bonitos;

  • o Google indexou.

Fim.

Mas isso equivale a um programador COBOL que testa somente a saída do relatório sem nunca olhar o dump, o SYSOUT ou o JCL.

Quem trabalha com mainframe sabe:

O que aparece na tela nem sempre representa o que realmente foi gravado.

Foi exatamente isso que aconteceu.


A Investigação Começa

Minha suspeita surgiu após utilizar o ChatGPT para produzir artigos longos.

O fluxo era extremamente comum.

ChatGPT

↓

Copiar

↓

Blogger

↓

Publicar

Visualmente tudo parecia perfeito.

Até que comecei a perceber pequenas inconsistências.

Alguns snippets do Google ficavam estranhos.

Algumas tabelas se comportavam diferente.

Determinados títulos não eram interpretados corretamente.

Nada grave.

Mas havia algo...

Como em toda investigação do CSI.

A cena do crime parecia limpa demais.


O Primeiro Suspeito

Minha primeira hipótese foi simples.

Talvez o navegador estivesse corrigindo erros automaticamente.

Então resolvi olhar não a página publicada.

Mas o banco de dados do Blogger.

Existe uma forma de fazer isso.

Pouquíssima gente conhece.

O Feed Atom.


O Feed Atom

Todo blog Blogger possui um feed semelhante a este:

https://SEUBLOG.blogspot.com/feeds/posts/default

ou

https://SEUBLOG.blogspot.com/feeds/posts/default?max-results=500

Também é possível exportar todo o blog pelo painel do Blogger.

Esse arquivo XML contém praticamente tudo que o Blogger realmente armazenou:

  • título

  • conteúdo

  • categorias

  • datas

  • comentários

  • HTML

Ou seja...

É como abrir diretamente um VSAM KSDS ao invés de confiar apenas no CICS.


O Momento da Verdade

Quando começamos a analisar o XML surgiu uma surpresa enorme.

O conteúdo não era apenas texto.

Existiam dezenas de elementos invisíveis.

Como por exemplo:

data-message-author-role
data-message-id
data-message-model-slug

Além de diversos atributos HTML internos.

Esses elementos nunca apareciam para o leitor.

Mas continuavam gravados.


O Que São Esses data-* ?

Quem conhece HTML moderno sabe que atributos iniciados por

data-

são perfeitamente válidos.

Frameworks como React, Vue e Angular utilizam isso o tempo inteiro.

Exemplo:

<div data-user="1234"
     data-role="admin">

Não existe nada errado nisso.

O problema é outro.

Esses atributos pertencem ao funcionamento interno da interface.

Eles nunca deveriam ser publicados dentro de um artigo.


O Mistério do Copiar e Colar

Foi então que a investigação tomou outro rumo.

Quando copiamos um texto da interface do ChatGPT, normalmente imaginamos que estamos copiando apenas caracteres.

Na realidade não.

Na maioria dos navegadores copiamos um bloco chamado Rich Text.

Esse bloco pode conter:

  • HTML

  • CSS

  • spans

  • divs

  • estilos

  • atributos data-*

  • marcações internas

Dependendo do editor utilizado, tudo isso viaja junto.

O Blogger simplesmente recebe.

E grava.


O Blogger Não Reclama

Aqui veio outra descoberta curiosa.

O Blogger praticamente nunca diz:

"Seu HTML está errado."

Ele simplesmente aceita.

Até mesmo estruturas como:

<p>

<table>

...

</table>

</p>

que são inválidas segundo a especificação HTML.


O Navegador "Conserta"

Chrome.

Firefox.

Edge.

Safari.

Todos eles possuem um parser extremamente tolerante.

Quando encontram algo assim:

<p>

<table>

internamente fazem algo parecido com:

<p></p>

<table>

...

</table>

<p></p>

Para o usuário parece perfeito.

Mas o HTML continua tecnicamente incorreto.

É exatamente como um compilador COBOL que gera um Warning, executa normalmente e produz o resultado esperado.

O programa "funciona".

Mas existe uma dívida técnica escondida.


O Feed Não Mente

Foi aí que compreendi algo importante.

O navegador tenta consertar.

O Blogger tenta publicar.

Mas o Feed Atom mostra praticamente o conteúdo bruto armazenado.

Ele é o equivalente ao dump de memória de um programa COBOL.

Ou ao SYSUDUMP de um ABEND.

Não existe maquiagem.

Existe apenas a verdade.


O Que Encontramos

Depois da primeira auditoria apareceram dezenas de problemas.

Entre eles:

  • resíduos do ChatGPT;

  • HTML mal fechado;

  • <p><table>;

  • <h2><table>;

  • spans desnecessários;

  • HTML herdado do Word;

  • atributos internos;

  • caracteres invisíveis.

Nenhum deles era perceptível durante a leitura do blog.


O Impacto no SEO

Será que isso destrói o ranqueamento?

Provavelmente não.

Mas aumenta o ruído.

Motores de busca precisam reconstruir o DOM.

Quanto mais HTML estranho existir:

  • maior o trabalho do parser;

  • maior a chance de interpretações diferentes;

  • maior a possibilidade de snippets inconsistentes.

Em blogs pequenos isso costuma passar despercebido.

Em um acervo com milhares de artigos, pequenas inconsistências acabam se acumulando.


O Maior Ensinamento

Essa investigação deixou uma lição valiosa.

Não basta olhar a página publicada.

É preciso olhar aquilo que realmente foi gravado.

No universo IBM Mainframe aprendemos isso desde cedo.

Um relatório bonito não significa que o programa esteja correto.

Da mesma forma, um post bonito não significa que o HTML esteja limpo.


O Bellacosa CSI

Essa descoberta acabou originando um novo projeto.

Uma espécie de laboratório forense para Blogger.

A ideia é simples.

Tratar o Feed Atom como um dump de produção.

Analisar automaticamente:

  • HTML inválido;

  • resíduos de IA;

  • problemas de SEO;

  • tabelas incorretas;

  • headings mal estruturados;

  • imagens sem atributos;

  • links defeituosos;

  • caracteres invisíveis.

Em outras palavras...

Construir um verdadeiro CSI Blogspot.


Conclusão

Durante anos imaginei que o Blogger funcionava como um compilador rigoroso, eliminando qualquer imperfeição antes da publicação.

Descobri que ele se comporta muito mais como um repositório: recebe, armazena e confia que o navegador fará os ajustes necessários.

Foi o Feed Atom que revelou aquilo que nem o editor do Blogger, nem o navegador e, muitas vezes, nem o próprio autor percebiam.

Se você possui dezenas, centenas ou milhares de artigos publicados, vale a pena fazer essa investigação. Talvez seu blog esteja impecável na superfície, mas carregando pequenas marcas invisíveis acumuladas ao longo dos anos.

No próximo capítulo, entraremos ainda mais fundo na cena do crime. Vamos aprender a identificar, classificar e remover resíduos deixados por ferramentas modernas — como ChatGPT, Google Docs, Microsoft Word e outros editores — antes que eles se transformem em dívida técnica permanente.

Porque, assim como no mundo dos mainframes, os maiores problemas quase nunca aparecem na tela. Eles ficam escondidos nos bastidores, aguardando alguém curioso o bastante para ler o "dump" da história.

🔎 CSI BLOGSPOT · ARQUIVO DE EVIDÊNCIAS

Blog Analytics: A Investigação Completa

Seis capítulos sobre auditoria de HTML, resíduos invisíveis, limpeza segura, checklist técnico e construção do Bellacosa Blog Doctor.

6 relatórios2018HTML · SEO · Blogger
CASE FILE 01

Blog Analytics — Parte I

Como descobrir evidências invisíveis no HTML de um blog antigo.

HTMLAuditoriaBlogspot
CASE FILE 02

Blog Analytics — Parte II

Os resíduos invisíveis deixados por editores, Word, IA e cópias antigas.

ResíduosWord HTMLIA
CASE FILE 03

Blog Analytics — Parte III

Como limpar milhares de posts sem destruir o acervo editorial.

LimpezaBackupQualidade
CASE FILE 04

Blog Analytics — Parte IV

Checklist de auditoria para blogs antigos e acervos com anos de história.

ChecklistSEO TécnicoAuditoria
CASE FILE 05

Blog Analytics — Parte V

Construindo o Bellacosa Blog Doctor e seu scanner automático.

Blog DoctorScannerJavaScript
CASE FILE 06

Blog Analytics — Parte VI

Criando o motor de regras, scores, prioridades e códigos de retorno.

Motor de RegrasScoreMainframe

Índice textual da série Blog Analytics

Esta série investiga a saúde técnica de blogs antigos no Blogger, cobrindo auditoria de HTML, resíduos de editores, SEO técnico, acessibilidade, limpeza segura, diagnóstico automatizado e motores de regras.

  1. Blog Analytics Parte I — Como descobrir evidências invisíveis
  2. Blog Analytics Parte II — Os resíduos invisíveis do HTML
  3. Blog Analytics Parte III — Como limpar com segurança
  4. Blog Analytics Parte IV — Checklist de auditoria
  5. Blog Analytics Parte V — Construindo o Bellacosa Blog Doctor
  6. Blog Analytics Parte VI — Criando o motor de regras

Sem comentários:

Enviar um comentário

Vagner Renato Bellacosa, IBM Champion e especialista em IBM Mainframe
IBM Z17 SYSTEM ONLINE
Sobre o autor

Vagner Renato Bellacosa

IBM Champion 2026 • Especialista em IBM Mainframe

Vagner Renato Bellacosa trabalha com IBM Mainframe desde 1988 , é IBM Champion e especialista em COBOL, CICS, Db2, z/OS e IBM Z. Compartilha experiências profissionais, conhecimento técnico, história da computação e práticas do universo mainframe para aproximar novas gerações das tecnologias que sustentam empresas, bancos e governos ao redor do mundo.

IBM Champion IBM Z COBOL CICS Db2 z/OS Mainframe desde 1988