Dosyalarınız cihazınızdan hiç ayrılmaz.Nasıl çalışır
PDF nasıl metne dönüştürülür
- 1PDF'nizi yukarı bırakın (veya tıklayıp seçin).
- 2Metni çıkar'a tıklayın.
- 3Tüm metni içeren .txt dosyasını indirin.
Sıkça sorulan sorular
- Dosyam yükleniyor mu?
- Hayır. Metin tamamen tarayıcınızda okunur — PDF'niz cihazınızdan hiç ayrılmaz.
- Metin bulunamadı diyor — neden?
- PDF'niz muhtemelen metin katmanı olmayan bir tarama (sayfa görselleri). Önce metin katmanı eklemek için OCR PDF'ten geçirin, ardından çıkarın.
- Düzen korunacak mı?
- Araç okuma sırasını ve satır sonlarını korur, ancak sütunları, tabloları veya tam boşlukları korumaz — biçimlendirilmiş bir belge değil, temiz düz metin üretir.
PDF'in içindeki yazıları çıkarın
Bir PDF'in gerçek metnine ihtiyaç duyduğunuzda — alıntılamak, aramak, başka bir araca beslemek ya da bir belgeye eklemek için — PDF'den Metne, dosyanın metin katmanını okur ve satır satır yeniden bir düz .txt dosyası halinde oluşturur. Tamamen tarayıcınızda çalışır, dolayısıyla gizli bir belge bile cihazınızdan asla ayrılmaz.
Metin, düzen değil
Araç, okuma sırasını ve satır sonlarını korur — kopyalama ve yeniden kullanım için istediğiniz de budur — ama sütunları, tabloları veya kesin konumlandırmayı yeniden oluşturmaya çalışmaz; sonuç temiz düz metindir. Sayfalar bir boş satırla ayrılır.
Taranmış PDF'ler
Taranmış bir PDF, metin katmanı olmayan bir dizi sayfa görselidir, dolayısıyla çıkarılacak hiçbir şey yoktur. Metni tanımak için önce OCR PDF üzerinden geçirin, ardından buraya dönüp çıkarın.
Çıkarma işlemi gerçekte nasıl çalışır
Gerçek metin içeren bir PDF, paragrafları bir Word belgesi gibi saklamaz — sayfa üzerinde tam koordinatlara yerleştirilmiş tek tek harf şekillerini (glyph) ve bunların karakter kodlarına geri eşlemesini saklar. PDF'den Metne, bu konumlandırılmış glyph'leri sayfa sayfa gezer ve koordinatlarına göre satırlar halinde yeniden birleştirir; PDF formatının kendisinde "satır" veya "paragraf" diye gerçek bir kavram olmamasına rağmen okuma sırasının genellikle doğru çıkmasının nedeni budur.
Çıkarma işlemi ters gittiğinde
Bazen bir PDF, bozuk veya standart dışı bir font kodlamasıyla üretilmiştir — niş yazılımlardan dışa aktarılan eski belgelerde yaygındır — ve görsel olarak sorunsuz görünse bile metin karmakarışık karakterler halinde çıkar. Bunun çıkarma tarafından bir çözümü yoktur; dosyanın içindeki metin eşlemesi zaten hatalıdır. Gazete veya akademik makale gibi çok sütunlu düzenler de beklenmedik bir sırayla iç içe geçebilir, çünkü araç görsel sütuna göre değil konuma göre okur.
Bu insanlar tarafından ne için kullanılıyor
Yaygın kullanımlar arasında büyük bir belgede arama yapmak, sayıları veya maddeleri bir e-tabloya aktarmak, yalnızca düz metin kabul eden başka bir araca belge beslemek veya içeriği bir ekran okuyucu için erişilebilir hale getirmek yer alır. Çıkarılan metin yerine PDF'in kendisinin erişilebilirliği için, belgeden ayrılmadan gerçek bir metin katmanı ekleyen OCR PDF aracına bakın.