| Bellacosa Mainframe e o blog analytics parte i |
☕ Um Café no Bellacosa Mainframe
Blog Analytics : Parte I – Como Descobrir HTML Invisível no Blogger Usando o Feed Atom
Quando o Navegador Diz "Está Tudo Certo"... Mas o Feed Conta Outra História
☕ Um Café no Bellacosa Mainframe
Durante muitos anos imaginei que o Blogger fazia uma limpeza completa do conteúdo que recebia. Afinal, se um post aparecia corretamente no navegador, por que deveria existir qualquer problema escondido?
Foi somente depois de milhares de publicações, centenas de artigos técnicos e uma curiosidade típica de quem trabalha com sistemas críticos IBM Mainframe que resolvi investigar uma hipótese aparentemente absurda:
Será que o Blogger armazena HTML invisível que nunca aparece para o leitor?
A resposta me surpreendeu.
E talvez surpreenda você também.
O Erro de Todo Blogueiro
A maioria das pessoas verifica apenas uma coisa:
o post abriu;
as imagens aparecem;
os títulos ficaram bonitos;
o Google indexou.
Fim.
Mas isso equivale a um programador COBOL que testa somente a saída do relatório sem nunca olhar o dump, o SYSOUT ou o JCL.
Quem trabalha com mainframe sabe:
O que aparece na tela nem sempre representa o que realmente foi gravado.
Foi exatamente isso que aconteceu.
A Investigação Começa
Minha suspeita surgiu após utilizar o ChatGPT para produzir artigos longos.
O fluxo era extremamente comum.
ChatGPT
↓
Copiar
↓
Blogger
↓
Publicar
Visualmente tudo parecia perfeito.
Até que comecei a perceber pequenas inconsistências.
Alguns snippets do Google ficavam estranhos.
Algumas tabelas se comportavam diferente.
Determinados títulos não eram interpretados corretamente.
Nada grave.
Mas havia algo...
Como em toda investigação do CSI.
A cena do crime parecia limpa demais.
O Primeiro Suspeito
Minha primeira hipótese foi simples.
Talvez o navegador estivesse corrigindo erros automaticamente.
Então resolvi olhar não a página publicada.
Mas o banco de dados do Blogger.
Existe uma forma de fazer isso.
Pouquíssima gente conhece.
O Feed Atom.
O Feed Atom
Todo blog Blogger possui um feed semelhante a este:
https://SEUBLOG.blogspot.com/feeds/posts/default
ou
https://SEUBLOG.blogspot.com/feeds/posts/default?max-results=500
Também é possível exportar todo o blog pelo painel do Blogger.
Esse arquivo XML contém praticamente tudo que o Blogger realmente armazenou:
título
conteúdo
categorias
datas
comentários
HTML
Ou seja...
É como abrir diretamente um VSAM KSDS ao invés de confiar apenas no CICS.
O Momento da Verdade
Quando começamos a analisar o XML surgiu uma surpresa enorme.
O conteúdo não era apenas texto.
Existiam dezenas de elementos invisíveis.
Como por exemplo:
data-message-author-role
data-message-id
data-message-model-slug
Além de diversos atributos HTML internos.
Esses elementos nunca apareciam para o leitor.
Mas continuavam gravados.
O Que São Esses data-* ?
Quem conhece HTML moderno sabe que atributos iniciados por
data-
são perfeitamente válidos.
Frameworks como React, Vue e Angular utilizam isso o tempo inteiro.
Exemplo:
<div data-user="1234"
data-role="admin">
Não existe nada errado nisso.
O problema é outro.
Esses atributos pertencem ao funcionamento interno da interface.
Eles nunca deveriam ser publicados dentro de um artigo.
O Mistério do Copiar e Colar
Foi então que a investigação tomou outro rumo.
Quando copiamos um texto da interface do ChatGPT, normalmente imaginamos que estamos copiando apenas caracteres.
Na realidade não.
Na maioria dos navegadores copiamos um bloco chamado Rich Text.
Esse bloco pode conter:
HTML
CSS
spans
divs
estilos
atributos data-*
marcações internas
Dependendo do editor utilizado, tudo isso viaja junto.
O Blogger simplesmente recebe.
E grava.
O Blogger Não Reclama
Aqui veio outra descoberta curiosa.
O Blogger praticamente nunca diz:
"Seu HTML está errado."
Ele simplesmente aceita.
Até mesmo estruturas como:
<p>
<table>
...
</table>
</p>
que são inválidas segundo a especificação HTML.
O Navegador "Conserta"
Chrome.
Firefox.
Edge.
Safari.
Todos eles possuem um parser extremamente tolerante.
Quando encontram algo assim:
<p>
<table>
internamente fazem algo parecido com:
<p></p>
<table>
...
</table>
<p></p>
Para o usuário parece perfeito.
Mas o HTML continua tecnicamente incorreto.
É exatamente como um compilador COBOL que gera um Warning, executa normalmente e produz o resultado esperado.
O programa "funciona".
Mas existe uma dívida técnica escondida.
O Feed Não Mente
Foi aí que compreendi algo importante.
O navegador tenta consertar.
O Blogger tenta publicar.
Mas o Feed Atom mostra praticamente o conteúdo bruto armazenado.
Ele é o equivalente ao dump de memória de um programa COBOL.
Ou ao SYSUDUMP de um ABEND.
Não existe maquiagem.
Existe apenas a verdade.
O Que Encontramos
Depois da primeira auditoria apareceram dezenas de problemas.
Entre eles:
resíduos do ChatGPT;
HTML mal fechado;
<p><table>;<h2><table>;spans desnecessários;
HTML herdado do Word;
atributos internos;
caracteres invisíveis.
Nenhum deles era perceptível durante a leitura do blog.
O Impacto no SEO
Será que isso destrói o ranqueamento?
Provavelmente não.
Mas aumenta o ruído.
Motores de busca precisam reconstruir o DOM.
Quanto mais HTML estranho existir:
maior o trabalho do parser;
maior a chance de interpretações diferentes;
maior a possibilidade de snippets inconsistentes.
Em blogs pequenos isso costuma passar despercebido.
Em um acervo com milhares de artigos, pequenas inconsistências acabam se acumulando.
O Maior Ensinamento
Essa investigação deixou uma lição valiosa.
Não basta olhar a página publicada.
É preciso olhar aquilo que realmente foi gravado.
No universo IBM Mainframe aprendemos isso desde cedo.
Um relatório bonito não significa que o programa esteja correto.
Da mesma forma, um post bonito não significa que o HTML esteja limpo.
O Bellacosa CSI
Essa descoberta acabou originando um novo projeto.
Uma espécie de laboratório forense para Blogger.
A ideia é simples.
Tratar o Feed Atom como um dump de produção.
Analisar automaticamente:
HTML inválido;
resíduos de IA;
problemas de SEO;
tabelas incorretas;
headings mal estruturados;
imagens sem atributos;
links defeituosos;
caracteres invisíveis.
Em outras palavras...
Construir um verdadeiro CSI Blogspot.
Conclusão
Durante anos imaginei que o Blogger funcionava como um compilador rigoroso, eliminando qualquer imperfeição antes da publicação.
Descobri que ele se comporta muito mais como um repositório: recebe, armazena e confia que o navegador fará os ajustes necessários.
Foi o Feed Atom que revelou aquilo que nem o editor do Blogger, nem o navegador e, muitas vezes, nem o próprio autor percebiam.
Se você possui dezenas, centenas ou milhares de artigos publicados, vale a pena fazer essa investigação. Talvez seu blog esteja impecável na superfície, mas carregando pequenas marcas invisíveis acumuladas ao longo dos anos.
No próximo capítulo, entraremos ainda mais fundo na cena do crime. Vamos aprender a identificar, classificar e remover resíduos deixados por ferramentas modernas — como ChatGPT, Google Docs, Microsoft Word e outros editores — antes que eles se transformem em dívida técnica permanente.
Porque, assim como no mundo dos mainframes, os maiores problemas quase nunca aparecem na tela. Eles ficam escondidos nos bastidores, aguardando alguém curioso o bastante para ler o "dump" da história.
Blog Analytics: A Investigação Completa
Seis capítulos sobre auditoria de HTML, resíduos invisíveis, limpeza segura, checklist técnico e construção do Bellacosa Blog Doctor.
Blog Analytics — Parte I
Como descobrir evidências invisíveis no HTML de um blog antigo.
Blog Analytics — Parte II
Os resíduos invisíveis deixados por editores, Word, IA e cópias antigas.
Blog Analytics — Parte III
Como limpar milhares de posts sem destruir o acervo editorial.
Blog Analytics — Parte IV
Checklist de auditoria para blogs antigos e acervos com anos de história.
Blog Analytics — Parte V
Construindo o Bellacosa Blog Doctor e seu scanner automático.
Blog Analytics — Parte VI
Criando o motor de regras, scores, prioridades e códigos de retorno.
Índice textual da série Blog Analytics
Esta série investiga a saúde técnica de blogs antigos no Blogger, cobrindo auditoria de HTML, resíduos de editores, SEO técnico, acessibilidade, limpeza segura, diagnóstico automatizado e motores de regras.
- Blog Analytics Parte I — Como descobrir evidências invisíveis
- Blog Analytics Parte II — Os resíduos invisíveis do HTML
- Blog Analytics Parte III — Como limpar com segurança
- Blog Analytics Parte IV — Checklist de auditoria
- Blog Analytics Parte V — Construindo o Bellacosa Blog Doctor
- Blog Analytics Parte VI — Criando o motor de regras
Sem comentários:
Enviar um comentário