Ihre Dateien verlassen nie Ihr Gerät.So funktioniert's
So führen Sie OCR auf einem PDF aus
- 1Ziehen Sie Ihr gescanntes PDF oben hinein (oder klicken Sie, um es auszuwählen).
- 2Klicken Sie auf Durchsuchbar machen — jede Seite wird der Reihe nach erkannt (die OCR-Engine wird beim ersten Gebrauch einmalig heruntergeladen).
- 3Laden Sie das durchsuchbare PDF herunter.
Häufig gestellte Fragen
- Wird meine Datei für die OCR hochgeladen?
- Nein. Die Erkennung läuft vollständig in Ihrem Browser über WebAssembly ab — Ihr PDF verlässt nie Ihr Gerät. Die OCR-Engine und die Sprachdaten werden einmalig aus einer öffentlichen Quelle heruntergeladen (das ist Software, nicht Ihre Datei) und anschließend zwischengespeichert.
- Was macht OCR mit meinem PDF?
- Es liest den Text in den Seitenbildern und fügt ihn als unsichtbare Ebene über den Wörtern wieder hinzu. Die Seite sieht weiterhin gleich aus, aber jetzt können Sie den Text in jedem PDF-Reader durchsuchen, auswählen und kopieren.
- Welche Sprachen werden unterstützt?
- Englisch funktioniert derzeit am besten. Andere Schriftsysteme, insbesondere nicht-lateinische wie Chinesisch, Japanisch oder Arabisch, werden noch nicht unterstützt.
- Warum ist es langsam?
- OCR ist rechenintensiv und läuft lokal auf Ihrem Gerät statt auf einer Serverfarm. Ein langes oder hochauflösendes Dokument kann eine Weile dauern — der Kompromiss, um Ihre Datei privat zu halten.
Aus einem Bild von Text wird echter Text
Ein gescanntes PDF besteht eigentlich nur aus Bildern — Sie sehen die Wörter, können sie aber nicht durchsuchen, auswählen oder kopieren. OCR (optische Zeichenerkennung) liest diese Bilder aus und fügt den Text als unsichtbare Ebene genau über jedem Wort wieder hinzu. Die Seite sieht identisch aus, ist aber nun in jedem Reader durchsuchbar. HivePDF erledigt das direkt in Ihrem Browser, sodass selbst ein sensibler Scan Ihr Gerät nie verlässt.
Privat, wenn auch langsamer
Die meisten OCR-Tools laden Ihr Dokument auf einen Server hoch, um die Schwerarbeit zu erledigen. HivePDF führt die Erkennung stattdessen lokal mit WebAssembly aus. Die OCR-Engine und ihre englischen Sprachdaten werden einmalig von einer öffentlichen Quelle heruntergeladen — das ist Software, nicht Ihre Datei — und für das nächste Mal zwischengespeichert. Der Kompromiss ist die Geschwindigkeit: Ein langer oder hochauflösender Scan dauert eine Weile, weil Ihr eigenes Gerät die Arbeit übernimmt.
Gut zu wissen
Englischer Text funktioniert derzeit am besten; andere Schriftsysteme werden noch nicht unterstützt. Das Ergebnis ist eine gerasterte Seite plus eine Textebene, sodass es eine originalgetreue Kopie Ihres Scans bleibt. Um das durchsuchbare PDF anschließend zu verkleinern, nutzen Sie Komprimieren; um stattdessen die Seitenbilder herauszuziehen, nutzen Sie PDF in JPG.
Wo OCR am wichtigsten ist
Alte Scans, archivierte Verträge oder ein mit dem Handy fotografierter Stapel Unterlagen sind gängige Kandidaten — nichts davon ist durchsuchbar, bis OCR eine Textebene hinzufügt. Das ist auch für die Barrierefreiheit wichtig, da Bildschirmleser echten Text statt eines Bildes von Text brauchen, um eine Seite vorzulesen. Nach der Verarbeitung verhält sich die Datei wie jedes andere durchsuchbare PDF: Sie können nach einer Klausel suchen, einen Absatz kopieren oder sie in einem Dokumentenarchiv indexieren.