PDF, tài liệu scan và OCR

Chuyển PDF sang ảnh, làm rõ scan và OCR 12 ngôn ngữ online

Render PDF thành JPG/PNG/WEBP, lọc nền giấy, deskew, sửa phối cảnh, che thông tin, tách chữ ký/con dấu và tạo searchable PDF ngay trên thiết bị.

PDF → JPG/PNG/WEBPTool Office
Deskew + perspectiveTool Office
Redaction cục bộTool Office
OCR 12 ngôn ngữTool Office

Document Image Tools

Một engine chuẩn cho vòng đời tài liệu scan: trích trang, làm sạch, sửa hình học, bảo vệ thông tin, OCR và đóng gói kết quả; không tạo page riêng cho từng filter hoặc ngôn ngữ.

Đang tải công cụ

Chọn đúng workflow PDF và scan

Bắt đầu từ mục tiêu đầu ra. Không nên chạy OCR khi chỉ cần ảnh trang PDF, và phải kiểm tra redaction trên file xuất chứ không chỉ trên preview.

PDF sang ảnh

Chọn DPI và định dạng để trích tối đa 30 trang; tải một ảnh hoặc ZIP toàn bộ trang.

Làm sạch ảnh scan

Dùng thang xám, trắng đen, loại nền xám, xoay, deskew và sửa phối cảnh trước OCR hoặc lưu hồ sơ.

OCR và bảo mật

Che dữ liệu hiển thị, nhận dạng một trong 12 ngôn ngữ hỗ trợ, xuất text/TSV cơ bản và tùy chọn tạo PDF có thể tìm kiếm.

Cách chuyển toàn bộ trang PDF sang ảnh

PDF.js render từng trang theo DPI; không chụp màn hình trang PDF.

  1. Chọn một PDF không quá 25 MB và 30 trang.
  2. Chọn JPG, PNG hoặc WEBP cùng 150, 200 hoặc 300 DPI.
  3. Bấm xử lý và kiểm tra trang đầu trong preview kết quả.
  4. Tải ảnh đầu hoặc ZIP toàn bộ trang theo đúng thứ tự PDF.
  • 150 DPI phù hợp xem màn hình; 300 DPI tạo ảnh lớn hơn cho in/OCR.
  • PDF có mật khẩu hoặc cấu trúc hỏng có thể không render được.

Cách làm rõ tài liệu scan bị xám hoặc nghiêng

Filter tài liệu tăng tương phản giữa mực và nền nhưng có thể làm mất nét mảnh.

  1. Chọn Làm rõ và lọc ảnh scan.
  2. Thử Thang xám trước, sau đó tăng contrast vừa phải.
  3. Dùng Làm trắng nền giấy hoặc Trắng đen và điều chỉnh ngưỡng.
  4. Bật deskew tự động hoặc chỉnh góc thủ công rồi kiểm tra chữ nhỏ.
  • Giữ một bản màu gốc để đối chiếu.
  • Deskew tự động chỉ ước tính ±5°, không thay thế sửa phối cảnh ảnh chụp xiên mạnh.

Cách sửa phối cảnh ảnh chụp tài liệu

Bốn góc xác định tứ giác giấy và được ánh xạ thành hình chữ nhật mới.

  1. Chọn trang cần sửa trong danh sách.
  2. Bấm Ước tính viền giấy để lấy khung chữ nhật ban đầu.
  3. Chỉnh tám tọa độ X/Y sao cho bốn góc nằm đúng mép giấy.
  4. Xử lý rồi kiểm tra tỷ lệ chữ, mép trang và phần nội dung bị cắt.
  • Nền tương phản với giấy giúp phát hiện viền tốt hơn.
  • Auto-detect hiện là ước tính hình chữ nhật; chỉnh tay khi giấy bị méo hình thang.

Cách che thông tin trước khi chia sẻ

Redaction tạo file mới với vùng che đã raster hóa.

  1. Chọn chế độ Che thông tin và trang cần xử lý.
  2. Điều chỉnh vị trí, kích thước vùng che trên preview.
  3. Ưu tiên Ô đen khi cần loại bỏ nội dung; blur/pixelate có thể không phù hợp dữ liệu nhạy cảm.
  4. Xuất file mới, mở lại và phóng lớn để xác nhận nội dung không còn đọc được.
  • Công cụ hiện che một vùng cấu hình trên mỗi trang trong lượt chạy.
  • Không chia sẻ file nguồn nếu chỉ file kết quả đã được redaction.

Cách tách chữ ký hoặc con dấu

Chữ ký dùng độ tối; con dấu dùng độ trội màu đỏ để tạo alpha.

  1. Dùng ảnh scan nền trắng, ánh sáng đều.
  2. Chọn Chữ ký/mực tối hoặc Con dấu/mực đỏ.
  3. Điều chỉnh ngưỡng để giữ nét mực và bỏ nền.
  4. Xuất PNG để giữ nền trong suốt; kiểm tra mép mực trước khi chèn vào tài liệu.
  • Không dùng kết quả để giả mạo chữ ký hoặc tài liệu.
  • Nền giấy có bóng hoặc màu gần màu mực sẽ làm tách kém chính xác.

Cách OCR ảnh hoặc PDF scan

PDF được render thành ảnh trước, sau đó gửi từng Canvas vào một OCR Worker cục bộ.

  1. Chọn đúng ngôn ngữ OCR và loại tài liệu.
  2. Bật searchable PDF nếu muốn lớp chữ tìm kiếm.
  3. Bắt đầu OCR và chờ model ngôn ngữ tải lần đầu.
  4. Soát lại chữ, số, số tiền, ký tự đặc thù của ngôn ngữ và dữ liệu TSV trước khi dùng.
  • Độ chính xác OCR không được bảo đảm; hãy đối chiếu với tài liệu gốc.
  • Bảng TSV là dữ liệu OCR cơ bản, không tái tạo hoàn hảo merged cells hoặc bố cục phức tạp.

Xử lý tài liệu riêng tư ngay trong browser

PDF/ảnh chỉ được đọc bởi PDF.js, Canvas và OCR Worker trên thiết bị; thư viện nặng và model chỉ tải khi workflow cần.

Không upload nội dung

Không có API gửi tài liệu tới server Tool Office; kết quả được tạo bằng Blob cục bộ.

Pipeline có thể kiểm tra

Mỗi bước render, filter, crop, redaction và OCR có preview hoặc output để người dùng xác minh.

Giới hạn an toàn

Tối đa 30 trang/ảnh, 25 MB mỗi file và canvas theo giới hạn chung để giảm nguy cơ treo tab.

Câu hỏi về PDF, scan và OCR

PDF và ảnh scan có được upload không?

Không. File được xử lý trong trình duyệt. Tesseract có thể tải code/model ngôn ngữ từ CDN nhưng không gửi ảnh của bạn lên dịch vụ OCR.

PDF sang ảnh nên chọn DPI nào?

150 DPI cho preview và chia sẻ nhẹ, 200 DPI cân bằng, 300 DPI cho in hoặc OCR chữ nhỏ. DPI cao dùng nhiều RAM và tạo file lớn.

Deskew và perspective khác nhau thế nào?

Deskew xoay vài độ để dòng chữ nằm ngang. Perspective correction dùng bốn góc để làm phẳng tài liệu chụp xiên hoặc hình thang.

Blur có phải redaction an toàn không?

Không nên coi blur là đủ cho dữ liệu nhạy cảm. Ô đen raster hóa là lựa chọn rõ ràng hơn, nhưng vẫn phải mở file xuất và kiểm tra lại.

OCR tiếng Việt có chính xác tuyệt đối không?

Không. Độ chính xác phụ thuộc độ phân giải, font, dấu, ánh sáng, độ nghiêng và chất lượng scan. Luôn soát lại tên, số, ngày và số tiền.

OCR PDF scan hoạt động thế nào?

PDF.js render từng trang thành Canvas, sau đó Tesseract Worker nhận dạng ảnh trang. Tesseract.js không đọc PDF trực tiếp.

Searchable PDF là gì?

Đó là PDF giữ hình ảnh trang nhưng thêm lớp chữ OCR để tìm kiếm/chọn text. Lớp chữ có thể chứa lỗi giống kết quả OCR.

Tool có xử lý PDF mật khẩu không?

Không bảo đảm. PDF được mã hóa có thể yêu cầu mật khẩu hoặc không render; công cụ không phá hay bỏ mật khẩu PDF.

Công cụ liên quan