Ambil lapisan teks dari PDF apa pun, halaman per halaman. Salin teksnya atau unduh sebagai file .txt. Dukungan file hingga 20 MB.
PDF Anda dibaca dan diproses sepenuhnya di browser Anda. Hanya pustaka pdf.js yang diunduh dari CDN — file-nya sendiri tidak pernah diunggah.
Letakkan PDF di sini
PDF · hingga 20 MB · diproses lokal
PDF digital menyimpan teks asli — posisi, font, dan barisan glyph — dalam lapisan teks di bawah gambar halaman. Alat ini membuka lapisan itu dengan mesin open-source pdf.js dan membacanya per halaman. Hanya pustaka pdf.js yang diunduh, dari CDN jsDelivr; file PDF Anda dibaca langsung dari disk Anda dan diproses dalam Web Worker di perangkat Anda.
Tidak. PDF dibaca secara lokal dari disk Anda dan diproses sepenuhnya di browser Anda. Satu-satunya hal yang diambil dari internet adalah pustaka pdf.js itu sendiri, dimuat dari CDN jsDelivr pada penggunaan pertama — byte dokumen Anda tidak pernah dikirim ke mana pun.
pdf.js adalah mesin PDF open-source di balik alat ini. Diunduh dari jsDelivr (https://cdn.jsdelivr.net) saat pertama kali Anda memuat file, lalu browser menyimpannya di cache untuk kunjungan berikutnya. Memuat pustaka dari CDN membuat alat ini ringan; file PDF-nya sendiri tidak pernah diunggah — hanya kode pustakanya yang melewati jaringan.
PDF hasil pindai atau hanya berisi gambar tidak memiliki lapisan teks — halamannya adalah foto, bukan teks. Alat ini mengekstrak lapisan teks tertanam tetapi tidak menjalankan OCR, jadi PDF yang hanya berisi gambar tidak menghasilkan apa pun. PDF yang dibuat secara digital (dari Word, Google Docs, dll.) terekstrak dengan baik.
20 MB. Semuanya berjalan di memori browser Anda, sehingga dokumen yang sangat besar bisa lambat atau mencapai batas memori browser. Untuk file yang lebih besar, pecah dulu.
Setiap halaman menjadi blok yang bisa dilipat tersendiri dalam urutan baca. Gunakan 'Salin semua' untuk mengambil seluruh dokumen, atau 'Unduh .txt' untuk menyimpannya sebagai file teks biasa dengan nama PDF Anda. Penghitung karakter, kata, dan halaman ditampilkan di atas hasil.
Jika sebuah halaman tidak memiliki lapisan teks karena hasil pindaian, ekstrak kata-katanya dengan OCR Gambar, ubah dokumen Word ke PDF terlebih dahulu dengan DOCX ke PDF atau periksa berapa banyak halaman yang Anda hadapi dengan Penghitung Halaman PDF.
Jika Anda baru saja memakai Pengambil teks PDF, langkah berikutnya yang wajar adalah Penghitung kata & karakter, Gabung & pisahkan PDF, Konverter PDF ke gambar, atau telusuri semua alat Alat file privat.