HivePDF
Filipino
← Lahat ng tool

Gawing ma-search ang isang na-scan na PDF (OCR)

Patakbuhin ang OCR sa isang na-scan na PDF para mahanap, ma-select, at makopya ang teksto nito. Nagdaragdag ang HivePDF ng invisible na text layer sa mga pahina — lahat sa iyong browser, hindi kailanman ina-upload ang iyong file.

Ihulog ang isang PDF dito o mag-click para pumili

Hindi umaalis ang mga file sa iyong device.Paano ito gumagana

Paano mag-OCR ng isang PDF

  1. 1I-drop ang iyong na-scan na PDF sa itaas (o i-click para pumili).
  2. 2I-click ang Make searchable — nakikilala ang bawat pahina nang paisa-isa (nagda-download nang minsan ang OCR engine sa unang paggamit).
  3. 3I-download ang ma-search na PDF.

Mga madalas itanong

Ina-upload ba ang aking file para sa OCR?
Hindi. Tumatakbo nang buo sa iyong browser ang pagkilala gamit ang WebAssembly — hindi umaalis ang iyong PDF sa device mo. Ang OCR engine at language data ay nagda-download nang minsan mula sa isang pampublikong source (mga software ito, hindi ang file mo) at pagkatapos ay naka-cache.
Ano ang ginagawa ng OCR sa aking PDF?
Binabasa nito ang teksto sa mga larawan ng pahina at idinaragdag ito pabalik bilang invisible na layer na naka-posisyon sa ibabaw ng mga salita. Pareho pa rin ang itsura ng pahina, ngunit puwede mo nang hanapin, i-select, at kopyahin ang teksto sa kahit anong PDF reader.
Anong mga wika ang suportado?
Pinakamahusay na gumagana ang English sa ngayon. Hindi pa suportado ang ibang script, lalo na ang mga hindi-Latin tulad ng Chinese, Japanese, o Arabic.
Bakit mabagal ito?
Mabigat na computation ang OCR at tumatakbo ito nang lokal sa iyong device sa halip na sa isang server farm. Ang mahaba o high-resolution na dokumento ay puwedeng tumagal — ang trade-off para mapanatiling pribado ang iyong file.

Gawing text ang larawan ng text

Ang isang na-scan na PDF ay mga larawan lang talaga — nakikita mo ang mga salita pero hindi mo ito ma-search, ma-select, o ma-copy. Binabasa ng OCR (optical character recognition) ang mga larawang iyon at idinaragdag pabalik ang text bilang isang invisible layer na eksaktong nakapatong sa bawat salita. Magmumukhang pareho ang pahina, pero ngayon ay searchable na ito sa anumang reader. Ginagawa ito ng HivePDF mismo sa browser mo, kaya kahit ang isang sensitibong scan ay hindi kailanman umaalis sa device mo.

Pribado, kahit medyo mabagal

Karamihan sa mga OCR tool ay nag-a-upload ng dokumento mo sa isang server para gawin ang mabigat na trabaho. Sa halip, pinapatakbo ng HivePDF ang recognition nang lokal gamit ang WebAssembly. Ang OCR engine at ang English language data nito ay dina-download nang isang beses mula sa isang pampublikong source — iyon ay software, hindi ang file mo — at kino-cache para sa susunod na paggamit. Ang trade-off ay bilis — ang mahaba o high-resolution na scan ay tumatagal nang kaunti, dahil ang sarili mong device ang gumagawa ng trabaho.

Mahalagang malaman

Pinakamahusay pa rin ang English text ngayon; hindi pa suportado ang iba pang script. Ang resulta ay isang raster page kasama ang isang text layer, kaya nananatili itong tapat na kopya ng scan mo. Para paliitin ang searchable na PDF pagkatapos, gamitin ang Compress; para kunin ang mga larawan ng pahina sa halip, gamitin ang PDF to JPG.

Saan pinakamahalaga ang OCR

Ang mga lumang scan, naka-archive na kontrata, o tambak ng mga papeles na kinunan ng larawan gamit ang telepono ay karaniwang mga kandidato — wala sa mga ito ang searchable hangga't hindi nagdaragdag ang OCR ng text layer. Mahalaga rin ito para sa accessibility, dahil kailangan ng mga screen reader ang totoong text sa halip na larawan ng text para basahin nang malakas ang isang pahina. Kapag naproseso na, kumikilos ang file tulad ng anumang ibang searchable na PDF — puwede kang maghanap ng isang clause, kopyahin ang isang talata, o i-index ito sa isang document archive.

Kaugnay na mga tool