File không rời khỏi máy bạn.Cách hoạt động
Cách OCR một file PDF
- 1Thả file PDF quét vào ô trên (hoặc bấm để chọn).
- 2Bấm Tạo bản tìm kiếm được — từng trang được nhận dạng lần lượt (engine OCR được tải một lần trong lần dùng đầu tiên).
- 3Tải file PDF tìm kiếm được về.
Câu hỏi thường gặp
- File của tôi có bị tải lên để OCR không?
- Không. Việc nhận dạng chạy hoàn toàn trong trình duyệt của bạn bằng WebAssembly — file PDF không bao giờ rời khỏi máy. Engine OCR và dữ liệu ngôn ngữ được tải một lần từ một nguồn công khai (chúng là phần mềm, không phải file của bạn) rồi được lưu vào bộ nhớ đệm.
- OCR làm gì với PDF của tôi?
- Nó đọc văn bản trong các ảnh trang và thêm lại dưới dạng một lớp vô hình đặt đúng trên các chữ. Trang vẫn trông y như cũ, nhưng giờ bạn có thể tìm kiếm, chọn và sao chép văn bản trong bất kỳ trình đọc PDF nào.
- Hỗ trợ những ngôn ngữ nào?
- Tiếng Anh cho kết quả tốt nhất hiện nay. Các hệ chữ khác, đặc biệt là chữ không phải Latinh như tiếng Trung, tiếng Nhật hay tiếng Ả Rập, hiện chưa được hỗ trợ.
- Vì sao nó chậm?
- OCR là phép tính nặng và nó chạy cục bộ trên máy bạn thay vì trên một trang trại máy chủ. Một tài liệu dài hoặc độ phân giải cao có thể mất một lúc — đó là cái giá để giữ file của bạn riêng tư.
Biến hình ảnh của văn bản thành văn bản thật
Một PDF đã scan thực chất chỉ là hình ảnh — bạn có thể nhìn thấy chữ nhưng không thể tìm kiếm, chọn, hoặc sao chép chúng. OCR (nhận dạng ký tự quang học) đọc những hình ảnh đó và thêm văn bản trở lại dưới dạng một lớp vô hình nằm chính xác đè lên từng chữ. Trang trông vẫn y hệt, nhưng giờ đã có thể tìm kiếm được trong bất kỳ trình đọc nào. HivePDF thực hiện điều này ngay trong trình duyệt của bạn, nên ngay cả bản scan nhạy cảm cũng không bao giờ rời khỏi thiết bị.
Riêng tư, dù chậm hơn
Hầu hết công cụ OCR khác tải tài liệu của bạn lên máy chủ để xử lý nặng. HivePDF thay vào đó chạy nhận dạng cục bộ bằng WebAssembly. Bộ máy OCR và dữ liệu ngôn ngữ tiếng Anh của nó chỉ tải về một lần từ nguồn công khai — đó là phần mềm, không phải file của bạn — và được lưu cache cho lần sau. Đánh đổi là tốc độ: một bản scan dài hoặc độ phân giải cao sẽ mất một lúc, vì chính thiết bị của bạn đang thực hiện công việc này.
Điều cần biết
Văn bản tiếng Anh cho kết quả tốt nhất hiện nay; các hệ chữ khác chưa được hỗ trợ. Kết quả là một trang dạng ảnh raster cộng thêm một lớp văn bản, nên nó vẫn là bản sao trung thực của bản scan của bạn. Để giảm dung lượng PDF có thể tìm kiếm sau đó, dùng công cụ Nén; để trích xuất ảnh trang ra thay vì OCR, dùng công cụ PDF sang JPG.
OCR quan trọng nhất ở đâu
Bản scan cũ, hợp đồng lưu trữ, hay chồng giấy tờ được chụp bằng điện thoại là những trường hợp phổ biến — tất cả đều không thể tìm kiếm được cho đến khi OCR thêm vào lớp văn bản. Điều này cũng quan trọng với khả năng tiếp cận, vì trình đọc màn hình cần văn bản thật thay vì hình ảnh của văn bản để đọc to trang cho người dùng. Sau khi xử lý xong, file hoạt động như bất kỳ PDF có thể tìm kiếm nào khác: bạn có thể tìm một điều khoản, sao chép một đoạn văn, hoặc đưa vào chỉ mục lưu trữ tài liệu.