PDF sang ảnh
Chọn DPI và định dạng để trích tối đa 30 trang; tải một ảnh hoặc ZIP toàn bộ trang.
Render PDF thành JPG/PNG/WEBP, lọc nền giấy, deskew, sửa phối cảnh, che thông tin, tách chữ ký/con dấu và tạo searchable PDF ngay trên thiết bị.
Một engine chuẩn cho vòng đời tài liệu scan: trích trang, làm sạch, sửa hình học, bảo vệ thông tin, OCR và đóng gói kết quả; không tạo page riêng cho từng filter hoặc ngôn ngữ.
Bắt đầu từ mục tiêu đầu ra. Không nên chạy OCR khi chỉ cần ảnh trang PDF, và phải kiểm tra redaction trên file xuất chứ không chỉ trên preview.
Chọn DPI và định dạng để trích tối đa 30 trang; tải một ảnh hoặc ZIP toàn bộ trang.
Dùng thang xám, trắng đen, loại nền xám, xoay, deskew và sửa phối cảnh trước OCR hoặc lưu hồ sơ.
Che dữ liệu hiển thị, nhận dạng một trong 12 ngôn ngữ hỗ trợ, xuất text/TSV cơ bản và tùy chọn tạo PDF có thể tìm kiếm.
PDF.js render từng trang theo DPI; không chụp màn hình trang PDF.
Filter tài liệu tăng tương phản giữa mực và nền nhưng có thể làm mất nét mảnh.
Bốn góc xác định tứ giác giấy và được ánh xạ thành hình chữ nhật mới.
Redaction tạo file mới với vùng che đã raster hóa.
Chữ ký dùng độ tối; con dấu dùng độ trội màu đỏ để tạo alpha.
PDF được render thành ảnh trước, sau đó gửi từng Canvas vào một OCR Worker cục bộ.
PDF/ảnh chỉ được đọc bởi PDF.js, Canvas và OCR Worker trên thiết bị; thư viện nặng và model chỉ tải khi workflow cần.
Không có API gửi tài liệu tới server Tool Office; kết quả được tạo bằng Blob cục bộ.
Mỗi bước render, filter, crop, redaction và OCR có preview hoặc output để người dùng xác minh.
Tối đa 30 trang/ảnh, 25 MB mỗi file và canvas theo giới hạn chung để giảm nguy cơ treo tab.
Không. File được xử lý trong trình duyệt. Tesseract có thể tải code/model ngôn ngữ từ CDN nhưng không gửi ảnh của bạn lên dịch vụ OCR.
150 DPI cho preview và chia sẻ nhẹ, 200 DPI cân bằng, 300 DPI cho in hoặc OCR chữ nhỏ. DPI cao dùng nhiều RAM và tạo file lớn.
Deskew xoay vài độ để dòng chữ nằm ngang. Perspective correction dùng bốn góc để làm phẳng tài liệu chụp xiên hoặc hình thang.
Không nên coi blur là đủ cho dữ liệu nhạy cảm. Ô đen raster hóa là lựa chọn rõ ràng hơn, nhưng vẫn phải mở file xuất và kiểm tra lại.
Không. Độ chính xác phụ thuộc độ phân giải, font, dấu, ánh sáng, độ nghiêng và chất lượng scan. Luôn soát lại tên, số, ngày và số tiền.
PDF.js render từng trang thành Canvas, sau đó Tesseract Worker nhận dạng ảnh trang. Tesseract.js không đọc PDF trực tiếp.
Đó là PDF giữ hình ảnh trang nhưng thêm lớp chữ OCR để tìm kiếm/chọn text. Lớp chữ có thể chứa lỗi giống kết quả OCR.
Không bảo đảm. PDF được mã hóa có thể yêu cầu mật khẩu hoặc không render; công cụ không phá hay bỏ mật khẩu PDF.