HivePDF
Türkçe
← Tüm araçlar

PDF'i Markdown'a dönüştürün

Bir PDF'i bir Markdown dosyasına dönüştürün — başlıklar, madde işaretli listeler ve paragraflar sayfa düzeninden tanınır. Bir LLM'e veya belgeler hattına beslemek için ideal. Ücretsiz, kayıt yok, hiçbir şey yüklenmez.

Bir PDF'yi buraya sürükleyin veya seçmek için tıklayın

Dosyalarınız cihazınızdan hiç ayrılmaz.Nasıl çalışır

PDF nasıl Markdown'a dönüştürülür

  1. 1PDF'nizi yukarı bırakın (veya tıklayıp seçin).
  2. 2Markdown'a dönüştür'e tıklayın.
  3. 3.md dosyasını indirin.

Sıkça sorulan sorular

Başlıklar ve listeler nasıl algılanır?
Bir PDF'de saklanan yapı yoktur, bu yüzden HivePDF bunu düzenden çıkarır: gövde metninden belirgin şekilde büyük metin bir başlık olur ve bir madde işareti veya numarayla başlayan satırlar liste öğesi olur. Geri kalanı paragraflar halinde gruplanır.
Taranmış PDF'lerde çalışır mı?
Hayır — bir tarama, okunacak bir metin katmanı olmayan yalnızca görsellerdir. Önce metin katmanı eklemek için OCR çalıştırın, ardından Markdown'a dönüştürün.
Dosyam yükleniyor mu?
Hayır. Metin tamamen tarayıcınızda çıkarılır ve dönüştürülür — belgeniz cihazınızdan hiç ayrılmaz.

PDF'i temiz Markdown'a dönüştürün

Markdown, belgeleri büyük dil modellerine, statik site oluşturuculara ve not uygulamalarına aktarmanın ortak dilidir — ama PDF'ler dışa aktarabileceğiniz bir yapı taşımaz. PDF'den Markdown'a, metin katmanını okur ve mantıklı bir belge yeniden kurar: sayfa düzeninden başlıkları, madde işaretli ve numaralı listeleri, paragrafları tespit eder ve bunları Markdown olarak yazar.

LLM ve dokümantasyon iş akışları için tasarlandı

Bir RAG hattı kuruyorsanız, dokümantasyon yazıyorsanız veya bir sohbet modeline içerik yapıştırıyorsanız, Markdown ham PDF metninden çalışmak çok daha kolaydır. Çıktı, başlık seviyelerini ve listeleri korur, böylece yapı hayatta kalır; bu da modellerin içeriği parçalara ayırmasına ve anlamasına yardımcı olur.

Notlar ve sınırlamalar

Yapı sezgisel olarak çıkarıldığından, karmaşık çok sütunlu düzenler veya tablolar mükemmel şekilde eşleşmeyebilir — kritik olan her şey için sonucu gözden geçirin. Taranmış PDF'lerin önce OCR'a ihtiyacı vardır. Her şey yerel olarak çalışır, bu yüzden hiçbir şey yüklenmez.

Düzen yapı olarak nasıl okunuyor

Perde arkasında, HivePDF PDF'in metin satırları arasında dolaşır ve her birinin yazı tipi boyutunu, kalınlığını ve sayfadaki konumunu kaydeder. Çevresindeki gövde metninden belirgin şekilde daha büyük olan veya kendi satırında kalın olarak ayarlanmış bir satır başlık olarak kabul edilir; belgenin geri kalanına göre boyutu, çıktıda H1, H2 veya H3 olup olmayacağına karar verir. Tire, madde işareti glifi veya nokta takip eden bir sayıyla başlayan satırlar liste öğesi haline gelir ve aynı girinti seviyesindeki ardışık satırlar ayrılmak yerine tek bir listede gruplanır.

Dönüştürmenin zorlandığı yerler

Tablolar en büyük sınırlamadır: bir PDF, tabloyu satır ve sütun olarak değil, konumlandırılmış metin olarak saklar, bu yüzden hücreler genellikle bir Markdown tablosu yerine tek bir satır veya paragrafa çöker. Çok sütunlu akademik makaleler ve broşürler, PDF'deki okuma sırası olağandışıysa iki sütunun metnini iç içe geçirebilir. Dipnotlar ve sayfa üstbilgileri veya altbilgileri bazen gövde metnine çekilir. Çıktıyı mükemmel bir dönüşüm beklemek yerine güçlü bir ilk taslak olarak ele alın ve sorunlu noktaları elle düzeltin.

Yaygın bir sonraki adım

Birçok kişi bunu taranmış bir belgede OCR sonrasında çalıştırır, ya da kaynak PDF diyagramları metinle karıştırıyorsa ve bunları ayrı tutmak istiyorlarsa Görsel Çıkar ile birlikte kullanır.

İlgili araçlar