HivePDF
Bahasa Indonesia
← Semua alat

Buat PDF hasil pindai bisa dicari (OCR)

Jalankan OCR pada PDF hasil pindai sehingga Anda bisa mencari, memilih, dan menyalin teksnya. HivePDF menambahkan lapisan teks tak terlihat di atas halaman — semuanya di browser Anda, dengan file Anda tidak pernah diunggah.

Letakkan PDF di sini atau klik untuk memilih

File Anda tidak pernah meninggalkan perangkat.Cara kerjanya

Cara melakukan OCR pada PDF

  1. 1Jatuhkan PDF hasil pindai Anda di atas (atau klik untuk memilih).
  2. 2Klik Make searchable — setiap halaman dikenali satu per satu (mesin OCR diunduh sekali pada penggunaan pertama).
  3. 3Unduh PDF yang sudah bisa dicari.

Pertanyaan yang sering diajukan

Apakah file saya diunggah untuk OCR?
Tidak. Pengenalan berjalan sepenuhnya di browser Anda menggunakan WebAssembly — PDF Anda tidak pernah meninggalkan perangkat Anda. Mesin OCR dan data bahasa diunduh sekali dari sumber publik (itu perangkat lunak, bukan file Anda) lalu di-cache.
Apa yang dilakukan OCR pada PDF saya?
OCR membaca teks pada gambar halaman dan menambahkannya kembali sebagai lapisan tak terlihat yang diposisikan tepat di atas kata-katanya. Halamannya tetap terlihat sama, tetapi sekarang Anda bisa mencari, memilih, dan menyalin teksnya di pembaca PDF mana pun.
Bahasa apa saja yang didukung?
Bahasa Inggris bekerja paling baik saat ini. Aksara lain, terutama yang non-Latin seperti Tionghoa, Jepang, atau Arab, belum didukung.
Kenapa lambat?
OCR adalah komputasi berat dan berjalan secara lokal di perangkat Anda alih-alih di server farm. Dokumen yang panjang atau beresolusi tinggi bisa memakan waktu — itu kompromi untuk menjaga file Anda tetap privat.

Ubah gambar teks menjadi teks sungguhan

PDF hasil pindai sebenarnya hanyalah gambar — Anda bisa melihat kata-katanya tetapi tidak bisa mencari, memilih, atau menyalinnya. OCR (pengenalan karakter optik) membaca gambar tersebut dan menambahkan kembali teksnya sebagai lapisan tak terlihat yang persis berada di atas setiap kata. Halamannya terlihat identik, tetapi sekarang bisa dicari di pembaca mana pun. HivePDF melakukan ini langsung di browser Anda, sehingga bahkan pindaian yang sensitif tidak pernah meninggalkan perangkat Anda.

Privat, meski lebih lambat

Kebanyakan alat OCR mengunggah dokumen Anda ke server untuk melakukan pekerjaan berat. HivePDF menjalankan pengenalan secara lokal dengan WebAssembly. Mesin OCR dan data bahasa Inggrisnya diunduh sekali dari sumber publik — itu perangkat lunak, bukan file Anda — dan disimpan dalam cache untuk lain kali. Kompromi yang harus dibayar adalah kecepatan: pindaian yang panjang atau beresolusi tinggi membutuhkan waktu, karena perangkat Anda sendiri yang melakukan pekerjaannya.

Yang perlu diketahui

Teks bahasa Inggris bekerja paling baik saat ini; skrip lain belum didukung. Hasilnya adalah halaman raster ditambah lapisan teks, sehingga tetap menjadi salinan setia dari pindaian Anda. Untuk memperkecil PDF yang bisa dicari setelahnya, gunakan Compress; untuk mengambil gambar halamannya saja, gunakan PDF to JPG.

Di mana OCR paling penting

Pindaian lama, kontrak yang diarsipkan, atau setumpuk berkas yang difoto dengan ponsel adalah kandidat umum — semuanya tidak bisa dicari sampai OCR menambahkan lapisan teks. Ini juga penting untuk aksesibilitas, karena pembaca layar membutuhkan teks sungguhan, bukan gambar teks, untuk membacakan halaman dengan suara. Setelah diproses, file tersebut berperilaku seperti PDF yang bisa dicari lainnya: Anda bisa mencari klausul, menyalin paragraf, atau mengindeksnya dalam arsip dokumen.

Alat terkait