Extraia a camada de texto de qualquer PDF, página por página. Copie o texto ou baixe-o como arquivo .txt. Arquivos de até 20 MB.
Seu PDF é lido e processado por completo no seu navegador. Apenas a biblioteca pdf.js é baixada de um CDN — o arquivo em si nunca é enviado.
Solte um PDF aqui
PDF · até 20 MB · processamento local
Um PDF digital guarda texto real — posições, fontes e traços — em uma camada de texto sob a imagem da página. Esta ferramenta abre essa camada com o motor open-source pdf.js e a lê página por página. Apenas a biblioteca pdf.js é baixada, do CDN jsDelivr; seu arquivo PDF é lido direto do seu disco e processado em um Web Worker da sua máquina.
Não. O PDF é lido localmente do seu disco e processado por completo no seu navegador. A única coisa obtida da internet é a própria biblioteca pdf.js, carregada do CDN jsDelivr no primeiro uso — os bytes do seu documento nunca são enviados para qualquer lugar.
pdf.js é o motor open-source de PDF por trás desta ferramenta. É baixado do jsDelivr (https://cdn.jsdelivr.net) na primeira vez que você carrega um arquivo e, em seguida, o navegador o mantém em cache para as visitas seguintes. Carregar a biblioteca de um CDN mantém a ferramenta leve; o arquivo PDF em si nunca é enviado — apenas o código da biblioteca atravessa a rede.
PDFs escaneados ou apenas de imagem não têm camada de texto — a página é uma fotografia, não texto. Esta ferramenta extrae a camada de texto embutida, mas não executa OCR, então PDFs apenas de imagem não retornam nada. PDFs criados digitalmente (do Word, Google Docs, etc.) são extraídos sem problemas.
20 MB. Tudo roda na memória do seu navegador, então documentos muito grandes podem ser lentos ou atingir os limites de memória do navegador. Para arquivos maiores, divida-os antes.
Cada página se torna seu próprio bloco recolhível em ordem de leitura. Use 'Copiar tudo' para pegar o documento inteiro, ou 'Baixar .txt' para salvá-lo como arquivo de texto puro com o nome do seu PDF. Os contadores de caracteres, palavras e páginas aparecem acima dos resultados.
Se uma página não tem camada de texto porque é digitalizada, extraia suas palavras com OCR de imagem, converta primeiro os documentos do Word com DOCX para PDF ou confira com quantas páginas você está lidando com o Contador de páginas PDF.
Se você acabou de usar Extrator de texto de PDF, os próximos passos naturais são Contador de palavras e caracteres, Mesclar e dividir PDF, Conversor de PDF para imagem, ou explore todas as ferramentas de Ferramentas de arquivos.