PDF, documente scanate și OCR

Convertiți PDF în imagini, curățați documentele scanate și rulați OCR online

Redați paginile PDF ca JPG/PNG/WEBP, eliminați hârtia gri, aliniați, corectați perspectiva, redactați detalii, extrageți semnături/ștampile și creați PDF-uri care pot fi căutate pe dispozitivul dvs.

PDF → JPG/PNG/WEBPTool Office
Declinare + perspectivăTool Office
Redactare localăTool Office
OCR în 12 limbiTool Office

Instrumente pentru imaginea documentelor

Un motor canonic acoperă ciclul de viață al scanării: extragerea paginii, curățarea, corecția geometriei, confidențialitatea, OCR și ambalarea rezultatelor fără pagini separate pentru fiecare filtru sau limbă.

Instrument de încărcare

Alegeți PDF-ul corect și scanați fluxul de lucru

Începeți de la ieșirea necesară. Nu rulați OCR atunci când imaginile paginii sunt suficiente și verificați redactarea fișierului exportat, în loc să vă bazați doar pe previzualizare.

PDF în imagine

Selectați DPI și format pentru a extrage până la 30 de pagini, apoi descărcați o imagine sau un fișier ZIP în ordinea surselor.

Curățare scanare

Utilizați tonuri de gri, delimitare, eliminarea fundalului gri, rotație, declinare și corecție în perspectivă înainte de OCR sau arhivare.

OCR și confidențialitate

Ascundeți datele vizibile, recunoașteți una dintre cele 12 limbi și exportați text, TSV sau PDF căutabil.

Convertiți fiecare pagină PDF într-o imagine

PDF.js redă pagini la un DPI selectat în loc să facă capturi de ecran.

  1. Alegeți un PDF de până la 25 MB și 30 de pagini.
  2. Selectați JPG, PNG sau WEBP și 150, 200 sau 300 DPI.
  3. Procesați fișierul și inspectați prima pagină de ieșire.
  4. Descărcați o imagine sau un fișier ZIP care conține toate paginile în ordine PDF.
  • 150 DPI se potrivește cu vizualizarea pe ecran; 300 DPI creează fișiere mai mari pentru imprimare/OCR.
  • Este posibil ca fișierele PDF protejate prin parolă sau corupte să nu fie randate.

Curăţaţi o scanare gri sau înclinată

Filtrarea documentelor separă hârtia de cerneală, dar poate elimina liniile foarte fine.

  1. Selectați Îmbunătățire și filtrați documentele scanate.
  2. Încercați mai întâi în tonuri de gri, apoi adăugați un contrast moderat.
  3. Utilizați hârtie Albire sau prag alb-negru și ajustați pragul.
  4. Activați declinarea automată sau setați un unghi manual, apoi inspectați textul mic.
  • Păstrați scanarea color originală pentru comparație.
  • Declinarea automată estimează doar ±5° și nu înlocuiește corectarea perspectivei pentru fotografiile puternic denaturate.

Corectați perspectiva unui document fotografiat

Patru colțuri sursă sunt mapate la o nouă imagine dreptunghiulară.

  1. Selectați pagina pe care doriți să o corectați.
  2. Estimați chenarul pentru o decupare dreptunghiulară inițială.
  3. Reglați toate cele opt comenzi X/Y până când colțurile se potrivesc cu marginile hârtiei.
  4. Procesați și inspectați proporțiile textului, marginile paginii și conținutul decupat.
  • Un fundal care contrastează cu hârtia ajută la estimarea graniței.
  • Detectarea automată curentă estimează un dreptunghi; reglați manual paginile în formă de trapez.

Redactați informațiile înainte de a le partaja

Redaction creează un nou fișier rasterizat cu regiunea selectată acoperită.

  1. Selectați Redact și pagina de editat.
  2. Ajustați poziția și dimensiunea regiunii în previzualizare.
  3. Preferă negru solid pentru îndepărtare; estomparea/pixelarea poate fi nepotrivită pentru datele sensibile.
  4. Exportați, redeschideți și măriți pentru a verifica că detaliile nu pot fi citite.
  • Fluxul de lucru actual aplică o regiune configurată pe pagină într-o rulare.
  • Nu partajați fișierul sursă când numai copia exportată a fost redactată.

Extrageți o semnătură sau ștampilă

Modul semnătură folosește întuneric; Modul ștampilă identifică cerneala roșie dominantă și creează alfa.

  1. Utilizați o scanare uniform iluminată cu un fundal alb.
  2. Alegeți Semnătură/cerneală închisă sau Ștampilă/cerneală roșie.
  3. Reglați pragul pentru a păstra cursele în timp ce îndepărtați hârtia.
  4. Exportați PNG pentru a păstra transparența și a inspecta marginile liniilor.
  • Nu folosiți mărci extrase pentru a falsifica semnături sau documente.
  • Umbrele de hârtie sau culorile apropiate de cerneală reduc precizia extracției.

OCR o imagine sau un PDF scanat

Paginile PDF sunt randate mai întâi, apoi fiecare Canvas este recunoscut de un lucrător local OCR.

  1. Alegeți limba OCR și tipul de document potrivite.
  2. Activați PDF care poate fi căutat dacă este necesar un strat de text.
  3. Porniți OCR și permiteți descărcarea modelului de limbă la prima utilizare.
  4. Verificați textul, numerele, sumele, caracterele specifice limbii și TSV-ul.
  • Acuratețea OCR nu este garantată; comparați cu sursa.
  • TSV de bază nu reconstruiește perfect celulele îmbinate sau machetele complexe de tabel.

Procesați documente private în browser

PDF/imaginile sunt citite numai de PDF.js, Canvas și un OCR Worker de pe dispozitiv; bibliotecile și modelele grele se încarcă numai pentru fluxul de lucru selectat.

Niciun document încărcat

Nu există niciun API care să trimită documente către serverele Tool Office; rezultatele sunt create ca blob-uri locale.

Conductă verificabilă

Redarea, filtrarea, decuparea, redactarea și OCR expun previzualizarea/ieșirea pentru examinarea utilizatorului.

Limite de siguranță

Până la 30 de pagini/imagini, 25 MB per fișier și limitele de pânză partajată reduc riscul de blocare a filei.

Întrebări frecvente PDF, scanare și OCR

PDF-urile și scanările sunt încărcate?

Nu. Fișierele sunt procesate în browser. Tesseract poate descărca modele de cod/limbaj de pe un CDN, dar nu trimite imaginile dvs. către un serviciu OCR.

Ce DPI ar trebui să folosesc pentru PDF la imagine?

Utilizați 150 DPI pentru previzualizări ușoare, 200 DPI pentru echilibru și 300 DPI pentru imprimare sau OCR cu text mic. DPI mai mare utilizează mai multă memorie și creează fișiere mai mari.

Prin ce diferă declinarea și corectarea perspectivei?

Declinarea se rotește cu câteva grade pentru a nivela liniile de text. Corecția perspectivei hărțește patru colțuri pentru a aplatiza o pagină trapezoidală sau înclinată fotografiată.

Este estomparea o metodă de redactare sigură?

Nu presupuneți că estomparea este suficientă pentru datele sensibile. O cutie neagră solidă rasterizată este mai clară, dar redeschideți întotdeauna și verificați fișierul exportat.

OCR vietnamez este perfect precis?

Nu. Precizia depinde de rezoluție, font, accente, iluminare, înclinare și calitatea scanării. Verificați întotdeauna numele, numerele, datele și sumele.

Cum funcționează OCR PDF scanat?

PDF.js redă fiecare pagină în Canvas, apoi un lucrător Tesseract recunoaște imaginea paginii. Tesseract.js nu citește direct PDF-urile.

Ce este un PDF care poate fi căutat?

Păstrează imaginea paginii și adaugă un strat de text OCR pentru căutare/selectare. Stratul poate conține aceleași erori de recunoaștere ca și textul OCR.

Instrumentul gestionează PDF-uri protejate prin parolă?

Nu este de încredere. PDF-urile criptate pot solicita o parolă sau nu pot reda; acest instrument nu sparge și nu elimină parolele PDF.

Instrumente înrudite