PDF ke gambar
Pilih DPI dan format untuk mengekstrak hingga 30 halaman, lalu unduh satu gambar atau ZIP dalam urutan sumber.
Render halaman PDF sebagai JPG/PNG/WEBP, hapus kertas abu-abu, deskew, perbaiki perspektif, edit detail, ekstrak tanda tangan/stempel, dan buat PDF yang dapat dicari di perangkat Anda.
Satu mesin kanonik mencakup siklus hidup pemindaian: ekstraksi halaman, pembersihan, koreksi geometri, privasi, OCR, dan pengemasan hasil tanpa halaman terpisah untuk setiap filter atau bahasa.
Mulai dari output yang diperlukan. Jangan jalankan OCR ketika gambar halaman sudah cukup, dan verifikasi redaksi pada file yang diekspor daripada hanya mengandalkan pratinjau.
Pilih DPI dan format untuk mengekstrak hingga 30 halaman, lalu unduh satu gambar atau ZIP dalam urutan sumber.
Gunakan skala abu-abu, ambang batas, penghapusan latar belakang abu-abu, rotasi, kemiringan meja, dan koreksi perspektif sebelum OCR atau pengarsipan.
Tutupi data yang terlihat, kenali salah satu dari 12 bahasa, lalu ekspor teks, TSV, atau PDF yang dapat dicari.
PDF.js merender halaman pada DPI yang dipilih alih-alih mengambil tangkapan layar.
Pemfilteran dokumen memisahkan kertas dari tinta tetapi dapat menghilangkan goresan yang sangat halus.
Empat sudut sumber dipetakan ke gambar persegi panjang baru.
Redaksi membuat file raster baru dengan cakupan wilayah yang dipilih.
Mode tanda tangan menggunakan kegelapan; mode stempel mengidentifikasi tinta merah dominan dan menciptakan alfa.
Halaman PDF dirender terlebih dahulu, kemudian setiap Kanvas dikenali oleh Pekerja OCR lokal.
PDF/gambar hanya dibaca oleh PDF.js, Canvas, dan Pekerja OCR di perangkat; perpustakaan dan model berat hanya memuat untuk alur kerja yang dipilih.
Tidak ada API yang mengirimkan dokumen ke server Tool Office; hasilnya dibuat sebagai Blob lokal.
Rendering, filtering, cropping, redaction, dan OCR mengekspos pratinjau/output untuk tinjauan pengguna.
Hingga 30 halaman/gambar, 25 MB per file, dan batas kanvas bersama mengurangi risiko kerusakan tab.
Tidak. File diproses di browser. Tesseract dapat mengunduh kode/model bahasa dari CDN, tetapi Tesseract tidak mengirimkan gambar Anda ke layanan OCR.
Gunakan 150 DPI untuk pratinjau ringan, 200 DPI untuk keseimbangan, dan 300 DPI untuk OCR cetak atau teks kecil. DPI yang lebih tinggi menggunakan lebih banyak memori dan menghasilkan file yang lebih besar.
Deskew berputar beberapa derajat untuk meratakan baris teks. Koreksi perspektif memetakan empat sudut untuk meratakan halaman trapesium atau sudut yang difoto.
Jangan berasumsi bahwa blur sudah cukup untuk data sensitif. Kotak hitam pekat yang diraster lebih jelas, tetapi selalu buka kembali dan verifikasi file yang diekspor.
Tidak. Akurasi tergantung pada resolusi, font, aksen, pencahayaan, kemiringan, dan kualitas pemindaian. Selalu verifikasi nama, nomor, tanggal, dan jumlah.
PDF.js merender setiap halaman ke Canvas, lalu Pekerja Tesseract mengenali gambar halaman tersebut. Tesseract.js tidak membaca PDF secara langsung.
Ini mempertahankan gambar halaman dan menambahkan lapisan teks OCR untuk pencarian/pemilihan. Lapisan tersebut mungkin berisi kesalahan pengenalan yang sama seperti teks OCR.
Tidak dapat diandalkan. PDF terenkripsi mungkin meminta kata sandi atau gagal dirender; alat ini tidak memecahkan atau menghapus kata sandi PDF.