Translate

Mostrar mensagens com a etiqueta PaddleOCR. Mostrar todas as mensagens
Mostrar mensagens com a etiqueta PaddleOCR. Mostrar todas as mensagens

sexta-feira, 10 de fevereiro de 2023

O Cérebro por Trás do Scanner - Parte II : Como o OCR Aprendeu a Ler, Pensar e Preparou o Caminho para a Inteligência Artificial

 

Bellacosa Mainframe e a origem dos ocrs parte ii

☕📠 Um Café no Bellacosa Mainframe — Parte II

O Cérebro por Trás do Scanner

Como o OCR Aprendeu a Ler, Pensar e Preparou o Caminho para a Inteligência Artificial

"Quando olhamos para uma página escaneada, vemos um texto. Quando um computador olha para a mesma página, ele vê apenas milhões de pequenos quadrados coloridos."

Essa talvez seja a melhor maneira de entender por que o OCR foi, durante décadas, um dos maiores desafios da computação.

Na primeira parte desta história, acompanhamos a evolução do reconhecimento óptico de caracteres desde os primeiros experimentos mecânicos até os scanners domésticos dos anos 90, quando um simples "Computador" podia facilmente virar "Cornputad0r".

Agora chegou a hora de abrir a tampa do scanner, remover a carenagem e descobrir o que realmente acontece dentro daquela caixa aparentemente mágica.

Prepare seu café.

Hoje faremos engenharia reversa da visão computacional.


O Grande Mal-Entendido

Existe uma crença bastante comum.

"O scanner lê o texto."

Não.

O scanner nunca leu absolutamente nada.

Ele apenas fotografa.

Isso muda completamente nossa forma de enxergar o problema.

Imagine uma folha A4.

Para nós ela possui:

  • palavras;

  • frases;

  • parágrafos;

  • títulos;

  • tabelas;

  • imagens.

Para o scanner...

ela é apenas uma enorme fotografia.

Nada mais.


A Primeira Missão

Transformar luz em números.

Os antigos scanners CCD utilizavam uma barra de sensores semelhante às câmeras digitais.

Cada pequeno sensor media apenas uma coisa:

Quanto de luz voltou daquele ponto do papel?

Branco?

Muito reflexo.

Preto?

Pouca reflexão.

Cinza?

Um valor intermediário.

Depois de alguns segundos surgia uma gigantesca matriz.

255 255 255 255
255  12  10 255
255   9   7 255
255 255 255 255

Isso não é um texto.

É apenas uma fotografia convertida em números.


O Primeiro Milagre: Binarização

Os computadores logo perceberam um problema.

Fotografias possuem milhões de tons.

Textos normalmente precisam apenas de dois.

Branco.

Preto.

Então surgiu um algoritmo aparentemente simples.

Escolher um limite.

Maior que 128?

Branco.

Menor?

Preto.

Parece trivial.

Mas aqui começou um dos maiores desafios do OCR.

Porque documentos antigos nunca possuem iluminação uniforme.


Quando a Folha Envelhece

Pegue um livro de 1935.

O papel está amarelado.

Existem manchas.

Dobras.

Carimbos.

Marcas de café.

Fungos.

Poeira.

O algoritmo precisa decidir:

"Isto é tinta?"

ou

"Isto é sujeira?"

Esse processo é chamado de Thresholding.

Hoje utilizamos técnicas adaptativas como:

  • Otsu

  • Sauvola

  • Niblack

  • Wolf

Cada uma tentando responder exatamente a mesma pergunta.

"O que realmente pertence ao texto?"


O Segundo Milagre

Agora o OCR precisa descobrir onde existem letras.

Mas...

como encontrar letras numa fotografia?

Entra em cena uma velha conhecida da matemática.

A detecção de componentes conectados.

Imagine derramar tinta sobre uma folha.

Cada grupo conectado de pixels forma uma ilha.

Cada ilha pode ser:

  • uma letra;

  • um ponto;

  • um acento;

  • uma vírgula.

Ou apenas sujeira.


Encontrando Linhas

Curiosamente, localizar palavras é muito mais difícil do que reconhecer letras.

Primeiro é necessário descobrir:

Onde começa a primeira linha?

Onde termina?

Qual é o espaçamento?

Existe uma coluna?

Duas?

Três?

É um jornal?

Uma revista?

Uma tabela?

Esse processo chama-se:

Page Layout Analysis.

Sem ele o OCR mistura linhas completamente diferentes.

Foi exatamente isso que acontecia em muitos scanners domésticos dos anos 90.


O Terror Chamado Tabela

Você provavelmente já percebeu.

OCR odeia tabelas.

Porque tabelas possuem:

  • linhas;

  • caixas;

  • números;

  • textos;

  • alinhamentos diferentes.

Durante muitos anos elas eram praticamente impossíveis.

Hoje modelos de IA conseguem reconstruí-las com enorme precisão.


Segmentando Letras

Finalmente chegamos ao momento esperado.

Encontrar caracteres individuais.

Imagine a palavra:

COMPUTADOR

O algoritmo tenta descobrir:

C

O

M

P

U

...

Parece simples.

Até aparecer isto:

ffi

Em muitas fontes antigas essas três letras são desenhadas como um único símbolo.

Agora imagine o "ç".

Ou o "ã".

Ou um "í" com poeira em cima.

Tudo muda.


A Era das Comparações

Os primeiros OCR funcionavam exatamente como um álbum de figurinhas.

O algoritmo possuía milhares de modelos.

Será que parece um A?

92%

Um B?

15%

Um R?

18%

Escolhia o maior valor.

Era simples.

E muito limitado.

Mudou a fonte?

Fracasso.

Mudou a inclinação?

Fracasso.

Mudou o tamanho?

Fracasso novamente.


Então Vieram as Redes Neurais

Nos anos 1990 começou uma revolução silenciosa.

Em vez de comparar desenhos...

o computador passou a aprender.

Você mostrava milhares de letras.

A

A

A

A

A

Depois mostrava milhares de outras.

B

B

B

B

Após milhões de exemplos...

a máquina começava a criar um conceito abstrato de letra.

Era o nascimento do OCR moderno.


CNNs: Os Especialistas em Enxergar

As Convolutional Neural Networks mudaram completamente o jogo.

Ao invés de perguntar:

"Esta letra parece um A?"

elas perguntavam:

"Quais padrões aparecem repetidamente?"

Curvas.

Linhas.

Cantos.

Texturas.

Essas pequenas características eram combinadas em níveis cada vez mais sofisticados.

De repente o computador conseguia reconhecer letras mesmo deformadas.


O OCR Aprendeu Português

Uma das maiores revoluções não aconteceu na visão.

Aconteceu na linguagem.

Imagine duas possibilidades.

Cornputador

Computador

Visualmente são parecidas.

Mas linguisticamente apenas uma existe.

Então entraram em cena:

  • dicionários;

  • modelos estatísticos;

  • frequência de palavras;

  • análise gramatical;

  • contexto.

Foi assim que muitos erros desapareceram.


A Invenção que Todo Mundo Usou Sem Saber

Você lembra daqueles CAPTCHAs antigos?

Digite as letras abaixo.

Pouca gente sabe...

Você estava treinando OCR.

O sistema mostrava justamente palavras que os computadores não conseguiam reconhecer.

Milhões de pessoas ajudaram gratuitamente a revisar livros inteiros.

Essa genialidade ficou conhecida como reCAPTCHA.

Cada clique corrigia um pedacinho da Biblioteca de Alexandria digital do século XXI.


O Tesseract

Se existe um herói silencioso do OCR moderno...

ele atende pelo nome de Tesseract.

Criado originalmente na Hewlett-Packard entre 1985 e 1995.

Depois liberado como código aberto.

Mais tarde adotado e impulsionado pelo Google.

Hoje é um dos motores OCR mais utilizados do planeta.

Ele suporta centenas de idiomas.

Inclusive português.

E continua evoluindo.


ABBYY: O Ferrari do OCR

Enquanto o Tesseract conquistava o mundo open source...

uma empresa russa construía um verdadeiro monstro.

ABBYY FineReader.

Durante muitos anos ele foi considerado praticamente imbatível.

Reconhecia:

  • livros;

  • contratos;

  • formulários;

  • tabelas;

  • revistas;

  • jornais.

E fazia isso absurdamente bem.

Muitas empresas ainda o utilizam como padrão.


PaddleOCR

Nos últimos anos surgiu outro gigante.

PaddleOCR.

Projeto open source da Baidu.

Especializado em:

  • OCR multilíngue;

  • documentos complexos;

  • reconhecimento de tabelas;

  • layout;

  • manuscritos.

Hoje compete diretamente com soluções comerciais.


EasyOCR

Para quem trabalha com Python.

Existe um nome quase obrigatório.

EasyOCR.

Poucas linhas de código.

Dezenas de idiomas.

Excelente integração com IA.

Perfeito para automação.


TrOCR

Em 2021 a Microsoft apresentou algo extremamente interessante.

Em vez de construir um OCR tradicional...

utilizou Transformers.

Sim.

Os mesmos princípios que deram origem aos LLMs.

O resultado foi surpreendente.

O OCR deixou de reconhecer letras individualmente.

Passou a interpretar a sequência inteira.

Quase como se estivesse lendo.


OCR Multimodal

Hoje um modelo moderno faz algo completamente diferente.

Ele olha para uma página inteira.

Ao mesmo tempo entende:

  • texto;

  • fotografias;

  • diagramas;

  • gráficos;

  • assinaturas;

  • tabelas;

  • fórmulas matemáticas.

Ele já não separa visão de linguagem.

As duas coisas acontecem simultaneamente.

É exatamente esse tipo de abordagem que vemos em muitos modelos multimodais atuais.


Quando o OCR Começou a Entender Documentos

O próximo passo foi inevitável.

Não basta reconhecer:

R$ 12.345,67

É preciso saber:

Aquilo é:

  • valor da nota?

  • desconto?

  • imposto?

  • saldo?

  • total?

Nascia o Document AI.

Hoje utilizado por:

  • bancos;

  • seguradoras;

  • hospitais;

  • cartórios;

  • tribunais;

  • governos.


O Papel da IBM

Seria impossível falar de OCR sem mencionar a IBM.

Ao longo de décadas a empresa desenvolveu soluções para captura documental, leitura automática de formulários, processamento de cheques, classificação inteligente de documentos e integração com grandes ambientes corporativos.

Mais recentemente, tecnologias baseadas em IBM Watson, IBM Datacap, FileNet, Cloud Pak for Business Automation e modelos de IA ampliaram o conceito de OCR para captura inteligente, onde o sistema não apenas lê caracteres, mas interpreta contratos, identifica entidades, extrai metadados e automatiza processos completos.

No mundo mainframe, isso significou integrar documentos físicos diretamente a fluxos em CICS, Db2, IMS e sistemas bancários, reduzindo drasticamente a digitação manual.


O Novo Desafio: Livros do Mundo Inteiro

Quando Google Books começou sua missão de digitalizar milhões de livros, descobriu algo curioso.

Cada biblioteca possuía problemas diferentes.

Livros tortos.

Páginas grudadas.

Margens cortadas.

Letras góticas.

Anotações feitas por leitores há cem anos.

Carimbos.

Bibliotecas inteiras tornaram-se laboratórios de visão computacional.

Hoje, modelos treinados nesses acervos conseguem recuperar textos que seriam praticamente ilegíveis para os algoritmos de vinte anos atrás.


Easter Eggs que Quase Ninguém Conhece

📚 Muitos manuscritos medievais são hoje mais legíveis digitalmente do que a olho nu graças ao processamento de imagem multiespectral.

🔍 Alguns OCR modernos conseguem identificar automaticamente a fonte tipográfica utilizada em um documento.

🧠 Em certos sistemas corporativos, o OCR já identifica o tipo do documento antes mesmo de começar a ler o texto.

📜 Existem algoritmos capazes de reconstruir letras parcialmente queimadas ou apagadas utilizando contexto estatístico.

🤖 Alguns LLMs atuais utilizam OCR apenas como etapa intermediária. Outros enxergam a página inteira diretamente, sem separar explicitamente "leitura" e "interpretação", aproximando-se da forma como nós humanos percebemos um documento.


Um Café Antes de Fechar a Tampa do Scanner

Durante muito tempo acreditamos que ensinar um computador a jogar xadrez era uma das tarefas mais difíceis da inteligência artificial.

Estávamos errados.

Muito mais complicado era ensinar uma máquina a distinguir um "O" de um "0", um "rn" de um "m" ou um simples acento agudo perdido em uma folha amarelada pelo tempo.

O OCR nos ensinou uma lição que continua válida até hoje: inteligência não nasce pronta. Ela é construída pixel por pixel, erro por erro, página por página.

Toda vez que uma IA moderna responde a uma pergunta sobre um livro publicado há cinquenta, cem ou duzentos anos, existe uma boa chance de que, em algum momento de sua jornada, aquele conhecimento tenha passado por um scanner, por um algoritmo de OCR e por incontáveis correções humanas.

É por isso que gosto de pensar que a verdadeira biblioteca da Inteligência Artificial não começou em um data center repleto de GPUs.

Ela começou com o zumbido lento de um scanner doméstico, uma barra luminosa atravessando uma folha de papel e um velho computador tentando descobrir, pela primeira vez, se aquilo era um "Computador"... ou apenas mais um misterioso "Cornputad0r".

Vagner Renato Bellacosa, IBM Champion e especialista em IBM Mainframe
IBM Z17 SYSTEM ONLINE
Sobre o autor

Vagner Renato Bellacosa

IBM Champion 2026 • Especialista em IBM Mainframe

Vagner Renato Bellacosa trabalha com IBM Mainframe desde 1988 , é IBM Champion e especialista em COBOL, CICS, Db2, z/OS e IBM Z. Compartilha experiências profissionais, conhecimento técnico, história da computação e práticas do universo mainframe para aproximar novas gerações das tecnologias que sustentam empresas, bancos e governos ao redor do mundo.

IBM Champion IBM Z COBOL CICS Db2 z/OS Mainframe desde 1988