PDF, сканирани документи и OCR

Конвертирайте PDF в изображения, почиствайте сканирани документи и стартирайте OCR онлайн

Рендирайте PDF страници като JPG/PNG/WEBP, премахвайте сива хартия, изкривявайте, коригирайте перспективата, редактирайте детайли, извличайте подписи/печати и създавайте PDF файлове с възможност за търсене на вашето устройство.

PDF → JPG/PNG/WEBPTool Office
Изкривяване + перспективаTool Office
Местна редакцияTool Office
OCR на 12 езикаTool Office

Инструменти за изображение на документ

Една канонична машина покрива жизнения цикъл на сканиране: извличане на страници, почистване, коригиране на геометрията, поверителност, OCR и опаковане на резултати без отделни страници за всеки филтър или език.

Инструмент за зареждане

Изберете правилния работен процес на PDF и сканиране

Започнете от необходимия изход. Не стартирайте OCR, когато изображенията на страницата са достатъчни, и проверете редакцията на експортирания файл, вместо да разчитате само на визуализацията.

PDF към изображение

Изберете DPI и формат, за да извлечете до 30 страници, след което изтеглете едно изображение или ZIP в изходния ред.

Почистване на сканиране

Използвайте скала на сивото, прагове, премахване на сивия фон, завъртане, изкривяване и коригиране на перспектива преди OCR или архивиране.

OCR и поверителност

Скрийте видими данни, разпознайте един от 12 поддържани езика и експортирайте текст, TSV или PDF с търсене.

Конвертирайте всяка PDF страница в изображение

PDF.js изобразява страници с избран DPI, вместо да прави екранни снимки.

  1. Изберете един PDF файл до 25 MB и 30 страници.
  2. Изберете JPG, PNG или WEBP и 150, 200 или 300 DPI.
  3. Обработете файла и проверете първата изходна страница.
  4. Изтеглете едно изображение или ZIP, съдържащ всички страници в PDF ред.
  • 150 DPI подходящ за гледане на екрана; 300 DPI създава по-големи файлове за печат/OCR.
  • Защитени с парола или повредени PDF файлове може да не се визуализират.

Почистете сиво или изкривено сканиране

Филтрирането на документи разделя хартията от мастилото, но може да премахне много фини щрихи.

  1. Изберете Подобряване и филтриране на сканирани документи.
  2. Първо опитайте скала на сивото, след това добавете умерен контраст.
  3. Използвайте хартия Whiten или праг черно-бял и регулирайте прага.
  4. Активирайте автоматичното изкривяване или задайте ъгъл ръчно, след което проверете малък текст.
  • Запазете оригиналното цветно сканиране за сравнение.
  • Автоматичното изкривяване оценява само ±5° и не замества корекцията на перспектива за силно изкривени снимки.

Коригиране на перспективата на фотографиран документ

Четири изходни ъгъла са нанесени на ново правоъгълно изображение.

  1. Изберете страницата, която искате да коригирате.
  2. Оценете границата за първоначално правоъгълно изрязване.
  3. Регулирайте всичките осем X/Y контроли, докато ъглите съвпадат с ръбовете на хартията.
  4. Обработвайте и проверявайте пропорциите на текста, ръбовете на страницата и изрязаното съдържание.
  • Фон, който контрастира с хартията, помага за оценката на границата.
  • Текущото автоматично откриване оценява правоъгълник; ръчно коригирайте страниците с форма на трапец.

Редактирайте информацията преди споделяне

Редакцията създава нов растеризиран файл с избрания регион, покрит.

  1. Изберете Редактиране и страницата за редактиране.
  2. Коригирайте позицията и размера на региона във визуализацията.
  3. Предпочитане на плътно черно за премахване; замъгляването/пикселирането може да е неподходящо за чувствителни данни.
  4. Експортирайте, отворете отново и увеличете, за да се уверите, че подробностите не могат да бъдат прочетени.
  • Текущият работен процес прилага един конфигуриран регион на страница в изпълнение.
  • Не споделяйте изходния файл, когато само експортираното копие е редактирано.

Извличане на подпис или печат

Режимът на подпис използва тъмнина; Режимът на печат идентифицира доминиращо червено мастило и създава алфа.

  1. Използвайте равномерно осветено сканиране с бял фон.
  2. Изберете Подпис/тъмно мастило или Печат/червено мастило.
  3. Регулирайте прага, за да запазите ударите, докато премахвате хартия.
  4. Експортирайте PNG, за да запазите прозрачността и да проверите ръбовете на контура.
  • Не използвайте извлечени знаци за фалшифициране на подписи или документи.
  • Сенките на хартията или цветовете, близки до мастилото, намаляват точността на извличане.

OCR изображение или сканиран PDF

PDF страниците се изобразяват първо, след което всяко платно се разпознава от локален OCR работник.

  1. Изберете подходящия OCR език и вид документ.
  2. Разрешете PDF с възможност за търсене, ако се изисква текстов слой.
  3. Стартирайте OCR и оставете езиковия модел да се изтегли при първото използване.
  4. Проверете текста, числата, сумите, специфичните знаци и TSV спрямо оригинала.
  • Точността на OCR не е гарантирана; сравнете с източника.
  • Основният TSV не възстановява идеално обединени клетки или сложни оформления на таблици.

Обработка на лични документи в браузъра

PDF/изображенията се четат само от PDF.js, Canvas и OCR Worker на устройството; тежките библиотеки и модели се зареждат само за избрания работен процес.

Няма качване на документ

Няма API, изпращащ документи до Tool Office сървъри; резултатите се създават като локални петна.

Проверим тръбопровод

Изобразяване, филтриране, изрязване, редактиране и OCR излага визуализация/изход за потребителски преглед.

Граници на безопасност

До 30 страници/изображения, 25 MB на файл и споделените лимити на платното намаляват риска от срив на раздела.

ЧЗВ за PDF, сканиране и OCR

Качват ли се PDF файлове и сканирания?

Не. Файловете се обработват в браузъра. Tesseract може да изтегля кодови/езикови модели от CDN, но не изпраща вашите изображения до OCR услуга.

Кой DPI трябва да използвам за PDF към изображение?

Използвайте 150 DPI за леки визуализации, 200 DPI за баланс и 300 DPI за печат или OCR с малък текст. По-високият DPI използва повече памет и създава по-големи файлове.

По какво се различават корекцията на изкривяването и перспективата?

Изправянето завърта страницата с няколко градуса, за да подравни редовете. Корекцията на перспектива използва четирите ъгъла, за да изравни снимана под ъгъл страница.

Замъгляването безопасен метод за редактиране ли е?

Не приемайте, че замъгляването е достатъчно за чувствителни данни. Растеризираната плътна черна кутия е по-ясна, но винаги отваряйте отново и проверявайте експортирания файл.

Напълно точно ли е OCR на виетнамски?

Не. Точността зависи от разделителната способност, шрифта, акцентите, осветлението, изкривяването и качеството на сканиране. Винаги проверявайте имената, числата, датите и сумите.

Как работи сканираният PDF OCR?

PDF.js изобразява всяка страница на Canvas, след което Tesseract Worker разпознава изображението на страницата. Tesseract.js не чете PDF файлове директно.

Какво е PDF с възможност за търсене?

Запазва изображението на страницата и добавя OCR текстов слой за търсене/селекция. Слоят може да съдържа същите грешки при разпознаване като OCR текст.

Инструментът обработва ли PDF файлове, защитени с парола?

Не е надеждно. Шифрованите PDF файлове може да поискат парола или да не успеят да се изобразят; този инструмент не краква или премахва PDF пароли.

Свързани инструменти