Extrator de texto de PDF

Extraia a camada de texto de qualquer PDF, página por página. Copie o texto ou baixe-o como arquivo .txt. Arquivos de até 20 MB.

Seu PDF é lido e processado por completo no seu navegador. Apenas a biblioteca pdf.js é baixada de um CDN — o arquivo em si nunca é enviado.

Solte um PDF aqui

PDF · até 20 MB · processamento local

Carregue um PDF para extrair seu texto.

Como funciona

Um PDF digital guarda texto real — posições, fontes e traços — em uma camada de texto sob a imagem da página. Esta ferramenta abre essa camada com o motor open-source pdf.js e a lê página por página. Apenas a biblioteca pdf.js é baixada, do CDN jsDelivr; seu arquivo PDF é lido direto do seu disco e processado em um Web Worker da sua máquina.

A camada de texto
PDFs gerados a partir de Word, Google Docs, código ou saída digital de impressoras incorporam texto genuíno. PDFs escaneados são apenas imagens de páginas e não têm essa camada — por isso a extração de um scan não retorna nada. Esta ferramenta não executa OCR.
Extração página por página
pdf.js percorre cada página em ordem e coleta seus itens de texto, que carregam marcadores de fim de linha. Os itens são unidos em linhas, cada página vira um bloco recolhível para você verificar o conteúdo, e o documento completo é concatenado para copiar ou baixar.
Onde o código roda?
No primeiro uso, o navegador baixa o pdf.js do jsDelivr (cdn.jsdelivr.net) e o mantém em cache para as próximas visitas. Os bytes do PDF nunca saem do seu dispositivo — eles são lidos via File API e analisados localmente em um Web Worker. Sem upload, sem servidor, nada armazenado.

Perguntas frequentes

Meu PDF é enviado para um servidor?

Não. O PDF é lido localmente do seu disco e processado por completo no seu navegador. A única coisa obtida da internet é a própria biblioteca pdf.js, carregada do CDN jsDelivr no primeiro uso — os bytes do seu documento nunca são enviados para qualquer lugar.

Por que a biblioteca pdf.js é carregada de um CDN?

pdf.js é o motor open-source de PDF por trás desta ferramenta. É baixado do jsDelivr (https://cdn.jsdelivr.net) na primeira vez que você carrega um arquivo e, em seguida, o navegador o mantém em cache para as visitas seguintes. Carregar a biblioteca de um CDN mantém a ferramenta leve; o arquivo PDF em si nunca é enviado — apenas o código da biblioteca atravessa a rede.

Por que não recebo texto do meu PDF?

PDFs escaneados ou apenas de imagem não têm camada de texto — a página é uma fotografia, não texto. Esta ferramenta extrae a camada de texto embutida, mas não executa OCR, então PDFs apenas de imagem não retornam nada. PDFs criados digitalmente (do Word, Google Docs, etc.) são extraídos sem problemas.

Qual é o tamanho máximo de arquivo?

20 MB. Tudo roda na memória do seu navegador, então documentos muito grandes podem ser lentos ou atingir os limites de memória do navegador. Para arquivos maiores, divida-os antes.

Como o texto extraído é organizado?

Cada página se torna seu próprio bloco recolhível em ordem de leitura. Use 'Copiar tudo' para pegar o documento inteiro, ou 'Baixar .txt' para salvá-lo como arquivo de texto puro com o nome do seu PDF. Os contadores de caracteres, palavras e páginas aparecem acima dos resultados.

Se uma página não tem camada de texto porque é digitalizada, extraia suas palavras com OCR de imagem, converta primeiro os documentos do Word com DOCX para PDF ou confira com quantas páginas você está lidando com o Contador de páginas PDF.