ConvertiloConvertilo

Extrair Texto de PDF Online

Extraia e reconheça (OCR) texto de documentos PDF diretamente no seu navegador. Funciona com PDFs normais e escaneados, com suporte a 16 idiomas. Os arquivos nunca saem do seu dispositivo.

Arraste e solte seu arquivo aqui ou clique para selecionar

Os arquivos nunca saem do seu dispositivo — tudo é executado localmente no seu navegador.

O que é a extração de texto de PDF e o OCR?

Extrair texto de um PDF significa converter as páginas do documento em texto simples editável que você pode copiar, pesquisar e traduzir. Basta enviar o arquivo e clicar no botão: a detecção do idioma é feita automaticamente, os PDFs com camada de texto são extraídos em segundos e as digitalizações são processadas por OCR no navegador (Tesseract WASM, 16 idiomas). Os arquivos nunca saem do seu dispositivo.

Perguntas frequentes sobre a extração de texto de PDF

Funciona com PDFs digitalizados?

Sim. Se o PDF não tiver camada de texto, executamos automaticamente o OCR (reconhecimento) diretamente no seu navegador. 16 idiomas, incluindo inglês, russo, ucraniano, alemão e francês. Não é preciso Adobe Acrobat nem ABBYY FineReader.

Para onde vai meu PDF?

Para lugar nenhum. O arquivo é lido no seu navegador, o texto é extraído localmente usando PDF.js, e o OCR é executado pelo motor WebAssembly Tesseract. Nós não vemos nem o PDF nem o texto reconhecido: algo crítico para passaportes digitalizados, contratos e históricos médicos.

Preciso escolher o idioma do documento?

Não, ele é detectado automaticamente. Os PDFs com camada de texto passam pelo `franc` para identificar o idioma; as digitalizações usam o Tesseract OSD na primeira página para reconhecer o alfabeto dominante (cirílico, latino, árabe). Idiomas compatíveis: inglês, russo, ucraniano, alemão, francês, espanhol, italiano, polonês, tcheco, português, holandês, búlgaro, persa, estoniano, islandês, norueguês. O modelo de reconhecimento do idioma detectado é baixado uma única vez (~10–15 MB) e seu navegador o guarda em cache.

Quão rápido é?

PDF com camada de texto: 1–3 segundos, seja qual for seu tamanho. Digitalizações: entre 5 e 30 segundos por página, dependendo do seu dispositivo. Um computador desktop moderno processa uma digitalização de 20 páginas em 2–3 minutos; um celular é mais lento.

Quão preciso é o reconhecimento?

O Tesseract é um motor de código aberto, o mesmo usado no FineReader Express no Linux. Em digitalizações limpas e com linhas retas, a precisão é de 95–99% por palavra. Em fotos de celular com inclinação, sombras ou letras minúsculas, é preciso revisar o resultado. Escrita à mão não é reconhecida.

Qual é o tamanho máximo de PDF?

30 MB. Para arquivos maiores, divida seu PDF em partes com nossa ferramenta "Dividir PDF": todas as operações são locais, os arquivos nunca saem do seu dispositivo.