A startup chinesa DeepSeek revelou um novo marco na evolução da inteligência artificial, com o lançamento do DeepSeek-OCR, um sistema que promete transformar a forma como os modelos de linguagem processam informações.
DeepSeek apresenta IA que redefine a compreensão de texto por modelos de linguagem
A DeepSeek lança IA inovadora que converte texto em imagem e promete revolucionar os modelos de linguagem. Entenda como funciona.
A tecnologia, apresentada recentemente e destacada em reportagem do Estadão, substitui o uso tradicional de tokens de texto por representações visuais, convertendo palavras em imagens antes da análise. Essa mudança de paradigma pode aumentar a eficiência dos modelos em até dez vezes e reduzir drasticamente os custos operacionais.
Continue a leitura para entender como essa inovação funciona e o impacto que ela pode ter no futuro da IA e no uso corporativo da tecnologia.
Leia mais: DeepSeek-R1: IA que pensa e que pode mudar seu negócio
Como funciona o DeepSeek-OCR

O sistema desenvolvido pela DeepSeek propõe uma abordagem inédita: antes de interpretar o conteúdo textual, ele o transforma em imagens. Essas imagens são então processadas por um codificador visual, que extrai padrões e significados.
Nos testes iniciais, o DeepSeek demonstrou resultados impressionantes. Para cada dez tokens de texto, o modelo necessita de apenas um “token de visão” para representar as mesmas informações, mantendo 97% de precisão. Mesmo em compressões vinte vezes maiores, o desempenho permanece em torno de 60% de acerto, um índice elevado considerando o volume de dados processados.
Segundo os pesquisadores, essa técnica permite lidar com muito mais informação no mesmo espaço computacional — um salto fundamental para quem trabalha com documentos extensos, códigos ou bancos de dados corporativos.
O que torna o DeepSeek tão revolucionário
A grande inovação do DeepSeek está em desafiar o princípio que guiou os grandes modelos de linguagem (LLMs) até hoje: o processamento de texto puro.
Ao introduzir o conceito de “token de visão”, o sistema aproxima a IA da cognição humana, que associa significado a imagens e espaços, não apenas a palavras. A mudança é mais do que técnica — é conceitual.
Andrej Karpathy, cofundador da OpenAI, destacou em uma publicação na rede X que a proposta pode representar uma nova era na IA:
“A parte mais interessante para mim é se os pixels são melhores entradas para LLMs do que o texto. Talvez faça mais sentido que todas as entradas sejam imagens.”
Essa reflexão reforça o potencial do DeepSeek-OCR como um divisor de águas, capaz de alterar a estrutura dos sistemas de linguagem artificial e a própria definição do que significa “compreender” texto.
Impacto do DeepSeek no uso empresarial de IA
A introdução dessa tecnologia pode transformar a maneira como empresas e instituições processam informações.
Hoje, os modelos de linguagem enfrentam uma limitação prática: a janela de contexto, que define o quanto de texto um sistema pode analisar simultaneamente. Com a conversão para imagens, o DeepSeek amplia radicalmente essa capacidade, permitindo que milhões de tokens equivalentes sejam processados de uma só vez.
Segundo Jeffrey Emanuel, ex-investidor quantitativo e analista de tecnologia, o impacto pode ser imenso:
“O potencial de obter um LLM de ponta com uma janela de contexto de 10 ou 20 milhões de tokens é muito empolgante. Basicamente, você poderia inserir todos os documentos internos de uma empresa em um único prompt e manter a rapidez e a economia.”
Isso significa que grandes organizações poderiam alimentar seus modelos de IA com toda a base de conhecimento interna, atualizando apenas partes específicas conforme novas informações surgem — algo impensável nos modelos convencionais.
Benefícios e desafios da abordagem visual
Os principais benefícios da proposta da DeepSeek incluem:
Gostou? Siga o Seu Crédito Digital no Google e receba notícias de benefícios, INSS e crédito em primeira mão.
+311 mil seguidores
- Maior eficiência computacional, com redução de até 90% no uso de tokens.
- Ampliação das janelas de contexto, permitindo compreender volumes de texto muito maiores.
- Redução de custos de operação, tornando o uso corporativo mais acessível.
- Possibilidade de novas aplicações, como análise de grandes bases jurídicas, científicas ou corporativas.
Contudo, ainda existem desafios técnicos. Os modelos precisam aprender a raciocinar com tokens visuais com a mesma precisão dos tokens de texto. Questões como resolução, cor e estrutura espacial também influenciam a qualidade da interpretação.
Mesmo assim, o desempenho inicial sugere que o DeepSeek-OCR está inaugurando um novo paradigma cognitivo na IA.
Um novo paradigma para a inteligência artificial
O artigo técnico da DeepSeek sugere que essa tecnologia se aproxima da forma como o cérebro humano organiza memórias. Assim como as pessoas criam “palácios da memória” para associar informações a imagens e lugares, o modelo visualiza o texto em um espaço bidimensional, com pistas visuais e contextuais que melhoram a retenção e a recuperação de dados.
Esse conceito reforça uma visão cada vez mais popular entre especialistas: talvez o futuro dos modelos de linguagem não dependa apenas de entender palavras, mas de ver o mundo como um conjunto de imagens interconectadas.
DeepSeek e o futuro dos modelos de linguagem

A chegada do DeepSeek-OCR representa mais do que um avanço tecnológico; é um marco filosófico na evolução da inteligência artificial.
Ao propor que uma IA compreenda o texto como imagem, a startup chinesa redefine a própria natureza do aprendizado de máquina. Essa inovação tem potencial para tornar os sistemas mais eficientes, intuitivos e próximos da percepção humana.
Em um campo onde cada ganho de desempenho pode significar bilhões em economia, o DeepSeek surge como uma das propostas mais promissoras dos últimos anos — e talvez o primeiro passo para uma geração de IAs que “veem” o conhecimento em vez de apenas lê-lo.
Não perca nenhuma oportunidade de crédito e pagamento: acesse agora nossas últimas notícias no Seu Crédito Digital.
