Extrae la capa de texto de cualquier PDF, página por página. Copia el texto o descárgalo como archivo .txt. Archivos de hasta 20 MB.
Tu PDF se lee y procesa por completo en tu navegador. Solo la librería pdf.js se descarga de un CDN; el archivo en sí nunca se sube.
Suelta un PDF aquí
PDF · hasta 20 MB · procesamiento local
Un PDF digital guarda texto real — posiciones, fuentes y trazos — en una capa de texto bajo la imagen de la página. Esta herramienta abre esa capa con el motor open-source pdf.js y la lee página por página. Solo la librería pdf.js se descarga, desde el CDN de jsDelivr; tu archivo PDF se lee directamente de tu disco y se procesa en un Web Worker de tu máquina.
No. El PDF se lee localmente desde tu disco y se procesa por completo en tu navegador. Lo único que se obtiene de internet es la propia librería pdf.js, cargada desde el CDN de jsDelivr en el primer uso — los bytes de tu documento nunca se envían a ningún sitio.
pdf.js es el motor open-source de PDF detrás de esta herramienta. Se obtiene de jsDelivr (https://cdn.jsdelivr.net) la primera vez que cargas un archivo y luego tu navegador lo guarda en caché para las siguientes visitas. Cargar la librería desde un CDN mantiene la herramienta ligera; el archivo PDF en sí nunca se sube: solo el código de la librería cruza la red.
Los PDF escaneados o solo de imagen no tienen capa de texto: la página es una fotografía, no texto. Esta herramienta extrae la capa de texto incrustada pero no ejecuta OCR, así que los PDF solo de imagen no devuelven nada. Los PDF creados digitalmente (desde Word, Google Docs, etc.) se extraen sin problema.
20 MB. Todo se ejecuta en la memoria de tu navegador, así que documentos muy grandes pueden ser lentos o alcanzar los límites de memoria del navegador. Para archivos más grandes, divídelos antes.
Cada página se convierte en su propio bloque plegable en orden de lectura. Usa 'Copiar todo' para obtener todo el documento, o 'Descargar .txt' para guardarlo como archivo de texto plano con el nombre de tu PDF. Las cuentas de caracteres, palabras y páginas se muestran sobre los resultados.
Si una página no tiene capa de texto porque es un escaneo, extrae sus palabras con OCR de imagen, convierte primero los documentos de Word con DOCX a PDF o comprueba de cuántas páginas se trata con el Contador de páginas PDF.
Si acabas de usar Extractor de texto de PDF, los siguientes pasos naturales son Contador de palabras y caracteres, Fusionar y dividir PDF, Convertidor PDF a imagen, o explora todas las herramientas de Herramientas de archivos.