File Anda tidak pernah meninggalkan perangkat.Cara kerjanya
Cara mengonversi PDF ke teks
- 1Jatuhkan PDF Anda di atas (atau klik untuk memilih).
- 2Klik Extract text.
- 3Unduh file .txt yang berisi semua teksnya.
Pertanyaan yang sering diajukan
- Apakah file saya diunggah?
- Tidak. Teks dibaca sepenuhnya di browser Anda — PDF Anda tidak pernah meninggalkan perangkat Anda.
- Muncul tulisan tidak ada teks yang ditemukan — kenapa?
- PDF Anda kemungkinan adalah hasil pindai (gambar dari halaman) tanpa lapisan teks. Jalankan melalui OCR PDF terlebih dahulu untuk menambahkan lapisan teks, lalu ekstrak.
- Apakah tata letaknya akan dipertahankan?
- Alat ini mempertahankan urutan baca dan jeda baris, tetapi tidak kolom, tabel, atau spasi yang presisi — hasilnya adalah teks biasa yang bersih, bukan dokumen berformat.
Ambil kata-kata dari sebuah PDF
Ketika Anda memerlukan teks sesungguhnya dari sebuah PDF — untuk mengutipnya, mencarinya, memasukkannya ke alat lain, atau menempatkannya ke dalam sebuah dokumen — PDF to Text membaca lapisan teks file tersebut dan menyusunnya ulang baris demi baris menjadi file .txt biasa. Alat ini berjalan sepenuhnya di browser Anda, sehingga bahkan dokumen rahasia tidak pernah meninggalkan perangkat Anda.
Teks, bukan tata letak
Alat ini mempertahankan urutan baca dan pemisahan baris, yang memang Anda perlukan untuk menyalin dan menggunakan ulang, tetapi tidak berusaha membangun kembali kolom, tabel, atau posisi presisi — hasilnya adalah teks polos yang bersih. Halaman dipisahkan dengan baris kosong.
PDF hasil pindaian
PDF hasil pindaian adalah sekumpulan gambar halaman tanpa lapisan teks, sehingga tidak ada yang bisa diekstrak. Jalankan melalui OCR PDF terlebih dahulu untuk mengenali teksnya, lalu kembali ke sini untuk mengekstraknya.
Cara kerja ekstraksi sebenarnya
PDF dengan teks asli tidak menyimpan paragraf seperti dokumen Word — ia menyimpan glif individual yang diposisikan pada koordinat tepat di halaman, beserta pemetaan kembali ke kode karakter. PDF to Text menelusuri glif yang diposisikan tersebut halaman demi halaman dan menyusunnya kembali menjadi baris berdasarkan koordinatnya, itulah sebabnya urutan baca biasanya benar meskipun format PDF itu sendiri tidak benar-benar memiliki konsep "baris" atau "paragraf".
Ketika ekstraksi salah
Terkadang sebuah PDF dibuat dengan pengkodean font yang rusak atau tidak standar — hal ini umum terjadi pada dokumen lama yang diekspor dari perangkat lunak khusus — dan teksnya keluar sebagai karakter acak meski terlihat baik-baik saja secara visual. Tidak ada perbaikan untuk itu dari sisi ekstraksi; pemetaan teks di dalam file itu sendiri yang bermasalah. Tata letak multi-kolom seperti koran atau makalah akademik juga bisa tercampur dalam urutan yang tidak terduga, karena alat ini membaca berdasarkan posisi, bukan berdasarkan kolom visual.
Untuk apa orang menggunakan ini
Penggunaan umum meliputi pencarian di seluruh dokumen besar, menarik angka atau klausul ke dalam spreadsheet, memasukkan sebuah dokumen ke alat lain yang hanya menerima teks polos, atau membuat konten dapat diakses oleh pembaca layar. Untuk aksesibilitas PDF itu sendiri, bukan teks yang diekstrak, lihat OCR PDF, yang menambahkan lapisan teks sesungguhnya tanpa meninggalkan dokumen aslinya.