Hindi umaalis ang mga file sa iyong device.Paano ito gumagana
Paano i-convert ang PDF sa teksto
- 1I-drop ang iyong PDF sa itaas (o i-click para pumili).
- 2I-click ang Extract text.
- 3I-download ang .txt file na may buong teksto.
Mga madalas itanong
- Ina-upload ba ang aking file?
- Hindi. Nababasa nang buo sa iyong browser ang teksto — hindi umaalis ang iyong PDF sa device mo.
- Sinasabing walang nakitang teksto — bakit?
- Malamang na scan ang iyong PDF (mga larawan ng pahina) na walang text layer. Patakbuhin muna ito sa OCR PDF para magdagdag ng text layer, pagkatapos ay i-extract.
- Mapapanatili ba ang layout?
- Pinapanatili ng tool ang reading order at line break, ngunit hindi ang mga column, table, o eksaktong espasyo — gumagawa ito ng malinis na plain text, hindi isang naka-format na dokumento.
Kunin ang mga salita mula sa isang PDF
Kapag kailangan mo ang aktwal na text mula sa isang PDF — para kunin ito, i-search, ipakain sa ibang tool, o ilagay sa isang dokumento — binabasa ng PDF to Text ang text layer ng file at binubuo itong muli linya-linya papuntang plain .txt file. Tumatakbo ito nang buo sa browser mo, kaya kahit kumpidensyal na dokumento ay hindi kailanman umaalis sa device mo.
Text, hindi layout
Pinapanatili ng tool ang reading order at line break, na siyang gusto mo para sa pagkopya at muling paggamit, ngunit hindi nito sinusubukang muling likhain ang mga column, table, o eksaktong positioning — malinis na plain text ang resulta. Pinaghihiwalay ang mga pahina ng blangkong linya.
Mga scanned na PDF
Ang scanned na PDF ay isang set ng mga imahe ng pahina na walang text layer, kaya walang makukuha. Patakbuhin ito sa OCR PDF muna para makilala ang text, pagkatapos bumalik at kunin ito dito.
Paano talaga gumagana ang extraction
Ang PDF na may tunay na text ay hindi nag-iimbak ng mga talata sa paraang ginagawa ng dokumento sa Word — nag-iimbak ito ng indibidwal na glyph na nakaposisyon sa eksaktong coordinate sa pahina, kasama ng mapping pabalik sa character code. Dinadaanan ng PDF to Text ang mga nakaposisyong glyph na ito pahina-pahina at binubuo itong muli papuntang mga linya batay sa coordinate nito, kaya naman kadalasang tama ang reading order kahit ang PDF format mismo ay walang tunay na konsepto ng "linya" o "talata."
Kapag nagkakamali ang extraction
Paminsan-minsan, ang isang PDF ay ginawa na may sira o hindi-standard na font encoding — karaniwan sa mas lumang dokumentong na-export mula sa niche na software — at lumalabas ang text bilang gulong mga karakter kahit maayos ang itsura sa visual. Walang solusyon dito mula sa panig ng extraction; sira ang text mapping sa loob ng file mismo. Ang mga multi-column na layout tulad ng pahayagan o akademikong papel ay maaari ring maghalo sa hindi inaasahang order, dahil binabasa ng tool ayon sa posisyon, hindi ayon sa visual na column.
Para saan ginagamit ito ng mga tao
Kasama sa mga karaniwang paggamit ang pag-search sa isang malaking dokumento, pagkuha ng mga numero o clause papunta sa spreadsheet, pagpapakain ng dokumento sa ibang tool na tumatanggap lang ng plain text, o paggawa ng laman na accessible sa screen reader. Para sa accessibility ng PDF mismo, sa halip na na-extract na text, tingnan ang OCR PDF, na nagdaragdag ng tunay na text layer nang hindi umaalis sa dokumento.