PDF în imagine
Selectați DPI și format pentru a extrage până la 30 de pagini, apoi descărcați o imagine sau un fișier ZIP în ordinea surselor.
Redați paginile PDF ca JPG/PNG/WEBP, eliminați hârtia gri, aliniați, corectați perspectiva, redactați detalii, extrageți semnături/ștampile și creați PDF-uri care pot fi căutate pe dispozitivul dvs.
Un motor canonic acoperă ciclul de viață al scanării: extragerea paginii, curățarea, corecția geometriei, confidențialitatea, OCR și ambalarea rezultatelor fără pagini separate pentru fiecare filtru sau limbă.
Începeți de la ieșirea necesară. Nu rulați OCR atunci când imaginile paginii sunt suficiente și verificați redactarea fișierului exportat, în loc să vă bazați doar pe previzualizare.
Selectați DPI și format pentru a extrage până la 30 de pagini, apoi descărcați o imagine sau un fișier ZIP în ordinea surselor.
Utilizați tonuri de gri, delimitare, eliminarea fundalului gri, rotație, declinare și corecție în perspectivă înainte de OCR sau arhivare.
Ascundeți datele vizibile, recunoașteți una dintre cele 12 limbi și exportați text, TSV sau PDF căutabil.
PDF.js redă pagini la un DPI selectat în loc să facă capturi de ecran.
Filtrarea documentelor separă hârtia de cerneală, dar poate elimina liniile foarte fine.
Patru colțuri sursă sunt mapate la o nouă imagine dreptunghiulară.
Redaction creează un nou fișier rasterizat cu regiunea selectată acoperită.
Modul semnătură folosește întuneric; Modul ștampilă identifică cerneala roșie dominantă și creează alfa.
Paginile PDF sunt randate mai întâi, apoi fiecare Canvas este recunoscut de un lucrător local OCR.
PDF/imaginile sunt citite numai de PDF.js, Canvas și un OCR Worker de pe dispozitiv; bibliotecile și modelele grele se încarcă numai pentru fluxul de lucru selectat.
Nu există niciun API care să trimită documente către serverele Tool Office; rezultatele sunt create ca blob-uri locale.
Redarea, filtrarea, decuparea, redactarea și OCR expun previzualizarea/ieșirea pentru examinarea utilizatorului.
Până la 30 de pagini/imagini, 25 MB per fișier și limitele de pânză partajată reduc riscul de blocare a filei.
Nu. Fișierele sunt procesate în browser. Tesseract poate descărca modele de cod/limbaj de pe un CDN, dar nu trimite imaginile dvs. către un serviciu OCR.
Utilizați 150 DPI pentru previzualizări ușoare, 200 DPI pentru echilibru și 300 DPI pentru imprimare sau OCR cu text mic. DPI mai mare utilizează mai multă memorie și creează fișiere mai mari.
Declinarea se rotește cu câteva grade pentru a nivela liniile de text. Corecția perspectivei hărțește patru colțuri pentru a aplatiza o pagină trapezoidală sau înclinată fotografiată.
Nu presupuneți că estomparea este suficientă pentru datele sensibile. O cutie neagră solidă rasterizată este mai clară, dar redeschideți întotdeauna și verificați fișierul exportat.
Nu. Precizia depinde de rezoluție, font, accente, iluminare, înclinare și calitatea scanării. Verificați întotdeauna numele, numerele, datele și sumele.
PDF.js redă fiecare pagină în Canvas, apoi un lucrător Tesseract recunoaște imaginea paginii. Tesseract.js nu citește direct PDF-urile.
Păstrează imaginea paginii și adaugă un strat de text OCR pentru căutare/selectare. Stratul poate conține aceleași erori de recunoaștere ca și textul OCR.
Nu este de încredere. PDF-urile criptate pot solicita o parolă sau nu pot reda; acest instrument nu sparge și nu elimină parolele PDF.