HivePDF
Tiếng Việt
← Tất cả công cụ

PDF sang Văn bản

Lấy văn bản trong PDF ra một file .txt thuần — ngay trong trình duyệt. Miễn phí, không watermark, không đăng ký, không tải gì lên.

Thả một file PDF vào đây hoặc bấm để chọn

File không rời khỏi máy bạn.Cách hoạt động

Cách chuyển PDF sang văn bản

  1. 1Thả file PDF vào ô trên (hoặc bấm để chọn).
  2. 2Bấm Trích văn bản.
  3. 3Tải file .txt chứa toàn bộ văn bản về.

Câu hỏi thường gặp

File của tôi có bị tải lên không?
Không. Văn bản được đọc hoàn toàn trong trình duyệt — file PDF không rời khỏi máy bạn.
Báo không tìm thấy văn bản — vì sao?
PDF của bạn nhiều khả năng là bản scan (ảnh của các trang), không có lớp văn bản. Hãy chạy qua OCR PDF trước để thêm lớp văn bản, rồi trích lại.
Bố cục có được giữ nguyên không?
Công cụ giữ thứ tự đọc và ngắt dòng, nhưng không giữ cột, bảng hay khoảng cách chính xác — nó cho ra văn bản thuần gọn gàng, chứ không phải một tài liệu có định dạng.

Lấy chữ ra khỏi một PDF

Khi bạn cần nội dung văn bản thật sự từ một PDF — để trích dẫn, tìm kiếm, đưa vào một công cụ khác, hoặc chèn vào một tài liệu — PDF to Text đọc lớp văn bản của file và tái tạo lại từng dòng thành một file .txt thuần túy. Mọi thứ diễn ra hoàn toàn trong trình duyệt của bạn, nên ngay cả một tài liệu mật cũng không bao giờ rời khỏi thiết bị của bạn.

Văn bản, không phải bố cục

Công cụ giữ nguyên thứ tự đọc và các dấu xuống dòng, đó là điều bạn cần khi sao chép và tái sử dụng, nhưng nó không cố tái tạo cột, bảng, hay vị trí chính xác — kết quả là văn bản thuần sạch sẽ. Các trang được ngăn cách bằng một dòng trống.

PDF đã scan

Một PDF đã scan chỉ là một tập hợp ảnh trang mà không có lớp văn bản, nên không có gì để trích xuất. Hãy chạy nó qua OCR PDF trước để nhận dạng văn bản, rồi quay lại đây để trích xuất.

Cách thức trích xuất hoạt động thực sự

Một PDF có văn bản thật không lưu trữ đoạn văn theo cách một file Word làm — nó lưu trữ từng ký tự (glyph) riêng lẻ được định vị ở tọa độ chính xác trên trang, cùng với ánh xạ trở lại mã ký tự. PDF to Text duyệt qua các glyph được định vị đó theo từng trang và ghép lại thành các dòng dựa trên tọa độ của chúng, đó là lý do vì sao thứ tự đọc thường đúng dù bản thân định dạng PDF không thực sự có khái niệm "dòng" hay "đoạn văn".

Khi việc trích xuất gặp lỗi

Đôi khi một PDF được tạo ra với bảng mã font bị lỗi hoặc không chuẩn — thường gặp ở các tài liệu cũ xuất ra từ phần mềm ít phổ biến — và văn bản khi trích xuất ra sẽ là các ký tự lộn xộn dù nhìn bằng mắt vẫn ổn. Không có cách khắc phục từ phía trích xuất; bản đồ ánh xạ văn bản bên trong file bị lỗi. Bố cục nhiều cột như báo giấy hay bài báo khoa học cũng có thể bị xen kẽ theo thứ tự không mong muốn, vì công cụ đọc theo vị trí, không theo cột hiển thị.

Người dùng sử dụng công cụ này để làm gì

Các trường hợp sử dụng phổ biến bao gồm tìm kiếm trong một tài liệu lớn, lấy số liệu hoặc điều khoản đưa vào bảng tính, đưa một tài liệu vào một công cụ khác chỉ chấp nhận văn bản thuần, hoặc làm cho nội dung tiếp cận được với trình đọc màn hình. Để hỗ trợ tiếp cận cho chính file PDF, thay vì văn bản đã trích xuất, hãy xem OCR PDF, công cụ thêm một lớp văn bản thật mà không cần rời khỏi tài liệu.

Công cụ liên quan

Hướng dẫn