HivePDF
Tiếng Việt
← Hướng dẫn

Từ Điển Thuật Ngữ PDF: OCR, Làm Phẳng, Linearize, PDF/A, Và Hơn Thế

Cập nhật 13 tháng 7, 2026

Thuật ngữ PDF được dùng rất nhiều mà ít khi được giải thích rõ. Đây là ý nghĩa thực sự của các thuật ngữ thường gặp, bằng ngôn ngữ đơn giản, cùng liên kết đến công cụ HivePDF thực hiện từng việc.

OCR (Nhận Dạng Ký Tự Quang Học)

Biến hình ảnh văn bản trong một trang scan thành văn bản thật, có thể chọn được, nằm ẩn ngay bên dưới ảnh. Không có nó, một PDF scan chỉ là một bức ảnh — bạn không thể tìm kiếm, sao chép, hay để trình đọc màn hình đọc nó lên. → OCR PDF

Làm Phẳng (Flatten)

“Nướng” nội dung tương tác — giá trị trường biểu mẫu, chú thích, lớp — trực tiếp vào nội dung trang tĩnh, và xóa bỏ chính các phần tử tương tác đó. Một biểu mẫu đã làm phẳng không thể bị đổi câu trả lời; một chú thích đã làm phẳng trở thành một phần của trang thay vì một đối tượng có thể chỉnh sửa riêng biệt. → Làm Phẳng PDF

Linearize (còn gọi là “Fast Web View”)

Tổ chức lại cấu trúc nội bộ của một PDF để trang đầu tiên có thể bắt đầu hiển thị trước khi toàn bộ file được tải xong — hữu ích với các PDF lớn xem trong trình duyệt, nơi một file đã linearize hiện trang 1 gần như ngay lập tức thay vì phải chờ tải hết toàn bộ.

PDF/A

Một phân nhánh lưu trữ của định dạng PDF được thiết kế để hiển thị giống hệt nhau hàng chục năm sau — nó yêu cầu nhúng toàn bộ font, cấm tham chiếu bên ngoài, và tránh các tính năng (như mã hóa hay JavaScript) có thể ngừng hoạt động theo thời gian. Dùng cho hồ sơ pháp lý, hồ sơ chính phủ, và bất cứ thứ gì có yêu cầu lưu trữ dài hạn. Hầu hết PDF hằng ngày không cần đến nó.

Bôi Đen (Redact)

Xóa vĩnh viễn nội dung nhạy cảm thay vì chỉ che nó bằng một hộp đen — sự khác biệt này quan trọng vì một hình chữ nhật đen đơn giản thường để lại văn bản gốc nguyên vẹn và có thể trích xuất được bên dưới. Bôi đen thật sự xóa bỏ chính nội dung đó. → Bôi đen PDF · xem thêm cách bôi đen PDF an toàn

Metadata

Thông tin ẩn gắn liền với một PDF ngoài nội dung hiển thị của nó — tác giả, tiêu đề, ngày tạo, phần mềm tạo ra nó, đôi khi cả lịch sử chỉnh sửa. Đáng để kiểm tra (và đôi khi xóa bỏ) trước khi chia sẻ một tài liệu công khai. → Sửa Metadata

Mã Hóa / Bảo Vệ (Encrypt / Protect)

Thêm yêu cầu mật khẩu để mở một PDF (và tùy chọn hạn chế in, sao chép, hay chỉnh sửa ngay cả với người có mật khẩu). Khác với bôi đen — mã hóa kiểm soát ai được phép mở file, không phải những gì hiển thị khi file đã mở. → Bảo Vệ PDF

Nén (Rasterize so với Re-encode)

Giảm dung lượng file, thường bằng cách giảm chất lượng hoặc độ phân giải ảnh. Rasterize chuyển một trang thành một ảnh duy nhất (thường gặp với các trang scan); re-encode chỉ nén lại các ảnh có sẵn trên trang trong khi để nguyên văn bản thật. Sự khác biệt này quan trọng vì rasterize một trang văn bản sẽ phá hủy khả năng chọn văn bản của nó — một công cụ nén tốt (như của HivePDF) chỉ rasterize những trang vốn dĩ đã là ảnh từ đầu. → Nén PDF

Trường Biểu Mẫu Điền Được (Fillable form field)

Một phần tử tương tác trong PDF — ô văn bản, checkbox, hoặc dropdown — mà người đọc có thể bấm vào và gõ trực tiếp, khác với một PDF “phẳng” chỉ trông giống biểu mẫu nhưng không có gì để bấm. → Điền Biểu Mẫu PDF

Xử lý phía client / ngay trong trình duyệt

Phần mềm chạy hoàn toàn bên trong trình duyệt web của bạn bằng WebAssembly, thay vì tải file của bạn lên server. Đặc điểm quyết định: nó vẫn hoạt động không cần internet sau khi trang đã tải xong, vì không có server nào tham gia vào quy trình. → cách xử lý PDF phía client hoạt động

Công cụ trong bài này

Câu hỏi thường gặp

Khác biệt giữa làm phẳng và bôi đen là gì?
Làm phẳng 'nướng' nội dung tương tác (trường biểu mẫu, chú thích) vào trang tĩnh để không thể chỉnh sửa thêm, nhưng nội dung gốc vẫn còn đó. Bôi đen thì xóa bỏ hẳn nội dung nhạy cảm để không thể khôi phục được — một sự đảm bảo mạnh hơn nhiều, dành cho việc ẩn thông tin chứ không chỉ khóa layout.
Tôi có cần PDF/A cho một tài liệu thông thường không?
Không — PDF/A quan trọng với việc lưu trữ dài hạn (hồ sơ pháp lý, hồ sơ chính phủ) nơi file cần hiển thị giống hệt nhau sau hàng chục năm. Với việc chia sẻ và in ấn thông thường, một PDF chuẩn là đủ.
OCR có giống với việc chuyển một bản scan thành PDF không?
Không. Chuyển một ảnh scan thành PDF chỉ đơn giản là bọc bức ảnh trong một file PDF — 'văn bản' vẫn chỉ là các pixel. OCR (Nhận Dạng Ký Tự Quang Học) phân tích các pixel đó và thêm một lớp văn bản thật, có thể chọn được bên dưới, đây chính là điều biến một tài liệu scan thành có thể tìm kiếm và sao chép.