Pengambil teks PDF

Ambil lapisan teks dari PDF apa pun, halaman per halaman. Salin teksnya atau unduh sebagai file .txt. Dukungan file hingga 20 MB.

PDF Anda dibaca dan diproses sepenuhnya di browser Anda. Hanya pustaka pdf.js yang diunduh dari CDN — file-nya sendiri tidak pernah diunggah.

Letakkan PDF di sini

PDF · hingga 20 MB · diproses lokal

Muat PDF untuk mengambil teksnya.

Cara kerjanya

PDF digital menyimpan teks asli — posisi, font, dan barisan glyph — dalam lapisan teks di bawah gambar halaman. Alat ini membuka lapisan itu dengan mesin open-source pdf.js dan membacanya per halaman. Hanya pustaka pdf.js yang diunduh, dari CDN jsDelivr; file PDF Anda dibaca langsung dari disk Anda dan diproses dalam Web Worker di perangkat Anda.

Lapisan teks
PDF yang dibuat dari Word, Google Docs, kode, atau output digital printer menyematkan teks asli. PDF hasil pindai hanyalah gambar halaman dan tidak memiliki lapisan tersebut — itulah mengapa ekstraksi dari scan tidak menghasilkan apa pun. Alat ini tidak menjalankan OCR.
Ekstraksi per halaman
pdf.js berjalan melalui setiap halaman secara berurutan dan mengumpulkan item teksnya, yang membawa penanda akhir baris. Item-item digabung menjadi baris, setiap halaman menjadi blok yang bisa dilipat sehingga Anda dapat memeriksa isinya, dan dokumen lengkap digabungkan untuk disalin atau diunduh.
Di mana kodenya berjalan?
Pada penggunaan pertama, browser mengunduh pdf.js dari jsDelivr (cdn.jsdelivr.net) dan menyimpannya di cache untuk kunjungan berikutnya. Byte PDF-nya sendiri tidak pernah meninggalkan perangkat Anda — dibaca melalui File API dan diparsing secara lokal dalam Web Worker. Tanpa unggah, tanpa server, tanpa penyimpanan.

Pertanyaan yang sering diajukan

Apakah PDF saya diunggah ke server?

Tidak. PDF dibaca secara lokal dari disk Anda dan diproses sepenuhnya di browser Anda. Satu-satunya hal yang diambil dari internet adalah pustaka pdf.js itu sendiri, dimuat dari CDN jsDelivr pada penggunaan pertama — byte dokumen Anda tidak pernah dikirim ke mana pun.

Mengapa pustaka pdf.js dimuat dari CDN?

pdf.js adalah mesin PDF open-source di balik alat ini. Diunduh dari jsDelivr (https://cdn.jsdelivr.net) saat pertama kali Anda memuat file, lalu browser menyimpannya di cache untuk kunjungan berikutnya. Memuat pustaka dari CDN membuat alat ini ringan; file PDF-nya sendiri tidak pernah diunggah — hanya kode pustakanya yang melewati jaringan.

Mengapa saya tidak mendapat teks dari PDF saya?

PDF hasil pindai atau hanya berisi gambar tidak memiliki lapisan teks — halamannya adalah foto, bukan teks. Alat ini mengekstrak lapisan teks tertanam tetapi tidak menjalankan OCR, jadi PDF yang hanya berisi gambar tidak menghasilkan apa pun. PDF yang dibuat secara digital (dari Word, Google Docs, dll.) terekstrak dengan baik.

Berapa ukuran maksimum berkas?

20 MB. Semuanya berjalan di memori browser Anda, sehingga dokumen yang sangat besar bisa lambat atau mencapai batas memori browser. Untuk file yang lebih besar, pecah dulu.

Bagaimana teks hasil ekstraksi disusun?

Setiap halaman menjadi blok yang bisa dilipat tersendiri dalam urutan baca. Gunakan 'Salin semua' untuk mengambil seluruh dokumen, atau 'Unduh .txt' untuk menyimpannya sebagai file teks biasa dengan nama PDF Anda. Penghitung karakter, kata, dan halaman ditampilkan di atas hasil.

Jika sebuah halaman tidak memiliki lapisan teks karena hasil pindaian, ekstrak kata-katanya dengan OCR Gambar, ubah dokumen Word ke PDF terlebih dahulu dengan DOCX ke PDF atau periksa berapa banyak halaman yang Anda hadapi dengan Penghitung Halaman PDF.