Extractor de texto de PDF

Extrae la capa de texto de cualquier PDF, página por página. Copia el texto o descárgalo como archivo .txt. Archivos de hasta 20 MB.

Tu PDF se lee y procesa por completo en tu navegador. Solo la librería pdf.js se descarga de un CDN; el archivo en sí nunca se sube.

Suelta un PDF aquí

PDF · hasta 20 MB · procesamiento local

Carga un PDF para extraer su texto.

Cómo funciona

Un PDF digital guarda texto real — posiciones, fuentes y trazos — en una capa de texto bajo la imagen de la página. Esta herramienta abre esa capa con el motor open-source pdf.js y la lee página por página. Solo la librería pdf.js se descarga, desde el CDN de jsDelivr; tu archivo PDF se lee directamente de tu disco y se procesa en un Web Worker de tu máquina.

La capa de texto
Los PDF generados desde Word, Google Docs, código o salida digital de impresoras incrustan texto genuino. Los PDF escaneados son solo imágenes de páginas y no tienen esa capa: por eso la extracción de un escáner no devuelve nada. Esta herramienta no ejecuta OCR.
Extracción página por página
pdf.js recorre cada página en orden y recopila sus elementos de texto, que llevan marcadores de fin de línea. Los elementos se unen en líneas, cada página se convierte en un bloque plegable para que puedas comprobar el contenido, y el documento completo se concatena para copiar o descargar.
¿Dónde se ejecuta el código?
En el primer uso, el navegador descarga pdf.js desde jsDelivr (cdn.jsdelivr.net) y lo almacena en caché para las siguientes visitas. Los bytes del PDF nunca salen de tu dispositivo: se leen con la API de File y se analizan localmente en un Web Worker. Sin subidas, sin servidor, sin almacenamiento.

Preguntas frecuentes

¿Se sube mi PDF a un servidor?

No. El PDF se lee localmente desde tu disco y se procesa por completo en tu navegador. Lo único que se obtiene de internet es la propia librería pdf.js, cargada desde el CDN de jsDelivr en el primer uso — los bytes de tu documento nunca se envían a ningún sitio.

¿Por qué la librería pdf.js se carga desde un CDN?

pdf.js es el motor open-source de PDF detrás de esta herramienta. Se obtiene de jsDelivr (https://cdn.jsdelivr.net) la primera vez que cargas un archivo y luego tu navegador lo guarda en caché para las siguientes visitas. Cargar la librería desde un CDN mantiene la herramienta ligera; el archivo PDF en sí nunca se sube: solo el código de la librería cruza la red.

¿Por qué no obtengo texto de mi PDF?

Los PDF escaneados o solo de imagen no tienen capa de texto: la página es una fotografía, no texto. Esta herramienta extrae la capa de texto incrustada pero no ejecuta OCR, así que los PDF solo de imagen no devuelven nada. Los PDF creados digitalmente (desde Word, Google Docs, etc.) se extraen sin problema.

¿Cuál es el tamaño máximo de archivo?

20 MB. Todo se ejecuta en la memoria de tu navegador, así que documentos muy grandes pueden ser lentos o alcanzar los límites de memoria del navegador. Para archivos más grandes, divídelos antes.

¿Cómo se organiza el texto extraído?

Cada página se convierte en su propio bloque plegable en orden de lectura. Usa 'Copiar todo' para obtener todo el documento, o 'Descargar .txt' para guardarlo como archivo de texto plano con el nombre de tu PDF. Las cuentas de caracteres, palabras y páginas se muestran sobre los resultados.

Si una página no tiene capa de texto porque es un escaneo, extrae sus palabras con OCR de imagen, convierte primero los documentos de Word con DOCX a PDF o comprueba de cuántas páginas se trata con el Contador de páginas PDF.