Chỉnh sửa, che thông tin, hoặc gộp PDF online có an toàn không?
Chỉnh sửa, gộp, và che thông tin trong PDF khác hẳn với việc chuyển đổi một tấm ảnh hay một đoạn video, bởi vì các tài liệu mà mọi người đưa qua những công cụ này thường nhạy cảm hơn nhiều: hợp đồng đã ký, hộ chiếu và bằng lái xe, hồ sơ bệnh án, tờ khai thuế, và sao kê tài chính. Phần lớn các "công cụ PDF online miễn phí" hoạt động bằng cách upload file của bạn lên máy chủ, nghĩa là ngay khi bạn nhấn chuyển đổi, một bản sao đầy đủ của tài liệu đó đã tồn tại ở đâu đó ngoài tầm kiểm soát của bạn. Bài viết này giải thích chính xác cách mô hình upload đó vận hành, vì sao những rủi ro đặc thù của PDF như metadata ẩn và che thông tin giả lại nghiêm trọng hơn vẻ ngoài của chúng, và cách kiểm chứng — chứ không chỉ tin tưởng suông — rằng một công cụ thực sự giữ file của bạn trên chính thiết bị của bạn.
Một công cụ PDF online điển hình xử lý file của bạn như thế nào?
Hãy chọn bất kỳ trang PDF nào chạy trên máy chủ để "chuyển đổi," "gộp," "tách," hay "che thông tin," cơ chế đều giống nhau: trình duyệt của bạn upload toàn bộ file PDF lên hạ tầng của công ty đó, một tiến trình backend mở và chỉnh sửa nó ở đó, rồi kết quả được trả về dưới dạng đường link tải xuống. Giữa hai bước đó, một bản sao đầy đủ của file bạn — từng trang, từng hình ảnh nhúng, từng dòng chữ — nằm trên phần cứng mà bạn không hề có khả năng nhìn thấy, trong suốt khoảng thời gian mà máy chủ hoặc bản sao lưu của công ty đó chọn để lưu giữ nó.
Điều gì khiến PDF rủi ro hơn so với việc upload một file thông thường?
PDF tập trung rủi ro nhiều hơn phần lớn các loại file khác, vì đây là định dạng mà mọi người dùng cho những tài liệu cần giữ kín nhất: hợp đồng đã ký, ảnh scan hộ chiếu và giấy tờ tùy thân, hồ sơ bệnh án, tờ khai thuế, hồ sơ vay vốn. Ba vấn đề cộng dồn lại: lưu trữ (một công cụ phía máy chủ có thể giữ file bạn upload trong vài giờ, vài ngày, hoặc vô thời hạn tùy theo chính sách riêng của họ), nguy cơ rò rỉ khi bị xâm nhập (một file được lưu trữ trở thành mục tiêu ngay khi nhà cung cấp đó bị hack hoặc cấu hình sai hệ thống lưu trữ), và nội dung ẩn vẫn còn tồn tại — một file PDF có thể mang theo metadata và phần văn bản "đã che" mà vẫn tồn tại lâu hơn những gì bạn thấy trên màn hình, nên phiên bản bị rò rỉ có thể lộ ra nhiều hơn phiên bản bạn định chia sẻ.
Công cụ PDF chạy ngay trên trình duyệt khác biệt như thế nào?
Các công cụ chạy ngay trên trình duyệt như LocalMedia phân tích và ghi lại file PDF của bạn bằng các thư viện như pdf-lib chạy ngay trong tab trình duyệt của chính bạn — file được đọc từ ổ đĩa của bạn vào bộ nhớ của tab, chỉnh sửa ngay tại đó, rồi lưu thẳng trở lại thư mục Downloads của bạn. Việc gộp, tách, và xoay trang (gộp PDF, tách PDF, xoay PDF) đều diễn ra theo cách này: các byte của tài liệu không bao giờ rời khỏi thiết bị của bạn, nên ngay từ đầu đã không có bản sao nào trên máy chủ để bị lưu giữ, rò rỉ, hay ghi log.
Điều gì khiến việc che thông tin trong PDF thực sự triệt để thay vì có thể khôi phục?
Một số lượng đáng ngạc nhiên các công cụ "che thông tin" — kể cả phần mềm văn phòng khi dùng thiếu cẩn trọng — chỉ đơn giản vẽ một hình chữ nhật đặc trên một lớp phủ lên trên văn bản hoặc hình ảnh gốc. Nội dung bên dưới vẫn còn nguyên trong file, và nó có thể lộ ra trở lại chỉ bằng cách bôi đen và copy văn bản, gỡ bỏ lớp chú thích đó, hoặc mở file bằng một trình xem không hiển thị hình chữ nhật kia. Đây chính xác là cách mà tên thật, mức lương, và chi tiết vụ án từng bị rò rỉ trong quá khứ. Một thao tác che thông tin thực sự phải phá hủy pixel hoặc văn bản gốc bên dưới, chứ không chỉ giấu chúng sau một thứ có thể gỡ bỏ được. Công cụ che thông tin của LocalMedia hoạt động theo cách này: một khối đặc hoặc hiệu ứng làm mờ được áp dụng như một thao tác ghi đè có tính phá hủy, không thể đảo ngược lên dữ liệu pixel trên canvas — chế độ làm mờ tính trung bình theo khối các pixel bên dưới, còn chế độ khối đặc sơn đè lên chúng vĩnh viễn — và kết quả được xuất ra dưới dạng một ảnh đã làm phẳng, không còn gì để bóc tách trở lại. Nguyên tắc này áp dụng như nhau dù nội dung nhạy cảm là một bản scan giấy tờ tùy thân trong file PDF hay chỉ là một ảnh chụp màn hình đơn giản: nếu một công cụ không thể cho bạn thấy dữ liệu gốc đã biến mất, hãy cho rằng nó chưa biến mất.
Vì sao chỉ xóa tiêu đề PDF là chưa đủ để loại bỏ metadata?
Một file PDF lưu trữ metadata mô tả — tác giả, tiêu đề, chủ đề, từ khóa, phần mềm đã tạo ra nó, và dấu thời gian giữ lại từ bản scan — ở hai nơi riêng biệt: từ điển /Info kiểu cũ, và một luồng metadata XMP mới hơn được nhúng trong file mà hầu hết các công cụ tạo tài liệu (Acrobat, InDesign, Word, LibreOffice) cũng ghi vào, và nhiều công cụ kiểm tra ưu tiên đọc thông tin này hơn cả /Info. Một công cụ chỉ xóa các trường trong /Info sẽ để nguyên tác giả, phần mềm, và các dữ liệu nhận dạng khác trong luồng XMP vẫn còn đầy đủ và đọc được — file trông có vẻ sạch khi kiểm tra thuộc tính nhanh nhưng vẫn rò rỉ mọi thứ bên dưới. Công cụ xóa metadata PDF của LocalMedia xóa cả hai: nó làm trống các trường trong từ điển /Info và đồng thời xóa riêng đối tượng metadata XMP khỏi file, để không bản sao dữ liệu nào trong hai nơi đó còn sót lại trong file PDF đã lưu.
Làm sao để kiểm chứng rằng một công cụ PDF không bao giờ upload file của tôi?
Bạn không cần phải tin lời bất kỳ công cụ nào. Mở công cụ dành cho nhà phát triển của trình duyệt (F12, hoặc nhấp chuột phải rồi chọn Inspect), chuyển sang tab Network, và xóa sạch nó. Thực hiện thao tác gộp, tách, xoay, che thông tin, hoặc xóa metadata của bạn, rồi quan sát các request: một công cụ dựa trên upload sẽ hiện một request POST hoặc PUT có kích thước gần bằng file PDF của bạn; một công cụ chạy ngay trên trình duyệt sẽ không hiện gì tương tự cả, vì không có gì để gửi đi. Để chắc chắn hơn, hãy ngắt kết nối internet sau khi trang đã tải xong rồi thử lại — một công cụ thực sự chạy cục bộ vẫn hoạt động bình thường, còn một công cụ upload sẽ lập tức báo lỗi.
Nên tìm những gì khi chọn công cụ PDF cho các file nhạy cảm?
Hãy ưu tiên một công cụ nói rõ ràng việc xử lý diễn ra ở đâu và cho phép bạn tự kiểm chứng điều đó, thay vì một công cụ chỉ hứa suông rằng "chúng tôi quan tâm đến quyền riêng tư của bạn." Với bất kỳ tài liệu nào có chữ ký, số giấy tờ tùy thân, chẩn đoán bệnh, hay số dư tài khoản, hãy tìm: một tuyên bố rõ ràng "chạy trên trình duyệt của bạn, không upload" mà bạn có thể kiểm tra trong tab Network, việc che thông tin được mô tả là phá hủy pixel hoặc văn bản chứ không phải "ẩn" hay "phủ" lên chúng, một công cụ xóa metadata có đề cập đến cả thuộc tính tài liệu lẫn XMP, và không yêu cầu tạo tài khoản chỉ để xử lý một file. Hãy thử công cụ gộp PDF, công cụ tách PDF, công cụ xóa metadata, hoặc công cụ che thông tin của LocalMedia với DevTools đang mở, và tự mình xác nhận rằng không có gì rời khỏi thiết bị của bạn.
Công cụ liên quan
Câu hỏi thường gặp
- Chỉnh sửa PDF online có an toàn không?
- Điều này hoàn toàn phụ thuộc vào việc xử lý diễn ra ở đâu. Nếu công cụ đó upload file của bạn lên máy chủ, một bản sao tài liệu của bạn sẽ tồn tại ở đâu đó ngoài tầm kiểm soát của bạn, phụ thuộc vào chính sách lưu trữ và bảo mật của nhà cung cấp đó. Nếu công cụ chạy cục bộ ngay trên trình duyệt của bạn, như các công cụ PDF của LocalMedia, file của bạn được đọc, chỉnh sửa, rồi lưu trở lại thiết bị của bạn mà không hề được gửi đi đâu cả, điều mà bạn có thể tự kiểm chứng trong tab Network của DevTools.
- Che thông tin trong PDF online có an toàn không?
- Chỉ an toàn nếu việc che thông tin đó mang tính phá hủy. Nhiều công cụ chỉ đơn giản vẽ một khối đen trên một lớp phủ lên văn bản hoặc hình ảnh gốc, khiến nội dung thật vẫn có thể khôi phục được bên dưới bằng cách copy văn bản hoặc gỡ bỏ lớp đó. Một công cụ che thông tin an toàn sẽ ghi đè lên chính dữ liệu pixel hoặc văn bản để nó không thể được khôi phục lại — công cụ che thông tin của LocalMedia làm điều này bằng cách thay đổi vĩnh viễn các pixel trên canvas trước khi xuất ra một ảnh đã làm phẳng.
- Các công cụ gộp PDF online có upload file của tôi không?
- Những công cụ dựa trên máy chủ thì có — file PDF của bạn được gửi đến hạ tầng của họ, ghép lại ở đó, rồi kết quả được trả về dưới dạng file để tải xuống. Các công cụ chạy ngay trên trình duyệt như công cụ gộp và tách của LocalMedia sử dụng một thư viện PDF chạy ngay trong tab trình duyệt của chính bạn, nên file không bao giờ được upload; bạn có thể kiểm chứng điều này bằng cách theo dõi tab Network trong lúc chạy công cụ.
- Xóa metadata PDF có thực sự xóa hết mọi thứ không?
- Chỉ khi công cụ đó xóa sạch cả hai nơi mà metadata tồn tại. Thông tin tác giả, phần mềm, và dấu thời gian của một file PDF nằm trong từ điển /Info kiểu cũ, và riêng biệt, trong một luồng metadata XMP mà nhiều công cụ tạo tài liệu cũng ghi vào và nhiều công cụ kiểm tra đọc trước tiên. Một công cụ chỉ xóa /Info vẫn để nguyên dữ liệu XMP còn nguyên vẹn. Công cụ xóa metadata của LocalMedia xóa cả hai, nên không còn dữ liệu tác giả, phần mềm, hay dấu thời gian nào sót lại trong file đã lưu.
- Vì sao upload PDF rủi ro hơn các loại file khác?
- Là vì nội dung mà chúng thường chứa, chứ không phải bản thân định dạng file. Mọi người dùng PDF cho hợp đồng, ảnh scan giấy tờ tùy thân, hồ sơ bệnh án, và tài liệu tài chính nhiều hơn hẳn so với các file thông thường, nên chính sách lưu trữ, nguy cơ rò rỉ, và cách xử lý metadata của một công cụ dựa trên upload lại quan trọng hơn nhiều đối với một file PDF so với, chẳng hạn, một tấm ảnh chế hài hước.
- Làm sao để kiểm tra xem một công cụ PDF có thực sự xử lý cục bộ hay không?
- Mở DevTools (F12), vào tab Network, xóa sạch nó, rồi chạy công cụ. Một công cụ dựa trên máy chủ sẽ hiện một request POST hoặc PUT lớn có kích thước gần bằng file của bạn; một công cụ cục bộ sẽ không hiện gì cả. Để kiểm tra thêm lần nữa, hãy ngắt kết nối internet sau khi trang đã tải xong rồi thử lại — một công cụ thực sự cục bộ vẫn hoạt động, còn một công cụ upload sẽ báo lỗi.