PDF към изображение
Изберете DPI и формат, за да извлечете до 30 страници, след което изтеглете едно изображение или ZIP в изходния ред.
Рендирайте PDF страници като JPG/PNG/WEBP, премахвайте сива хартия, изкривявайте, коригирайте перспективата, редактирайте детайли, извличайте подписи/печати и създавайте PDF файлове с възможност за търсене на вашето устройство.
Една канонична машина покрива жизнения цикъл на сканиране: извличане на страници, почистване, коригиране на геометрията, поверителност, OCR и опаковане на резултати без отделни страници за всеки филтър или език.
Започнете от необходимия изход. Не стартирайте OCR, когато изображенията на страницата са достатъчни, и проверете редакцията на експортирания файл, вместо да разчитате само на визуализацията.
Изберете DPI и формат, за да извлечете до 30 страници, след което изтеглете едно изображение или ZIP в изходния ред.
Използвайте скала на сивото, прагове, премахване на сивия фон, завъртане, изкривяване и коригиране на перспектива преди OCR или архивиране.
Скрийте видими данни, разпознайте един от 12 поддържани езика и експортирайте текст, TSV или PDF с търсене.
PDF.js изобразява страници с избран DPI, вместо да прави екранни снимки.
Филтрирането на документи разделя хартията от мастилото, но може да премахне много фини щрихи.
Четири изходни ъгъла са нанесени на ново правоъгълно изображение.
Редакцията създава нов растеризиран файл с избрания регион, покрит.
Режимът на подпис използва тъмнина; Режимът на печат идентифицира доминиращо червено мастило и създава алфа.
PDF страниците се изобразяват първо, след което всяко платно се разпознава от локален OCR работник.
PDF/изображенията се четат само от PDF.js, Canvas и OCR Worker на устройството; тежките библиотеки и модели се зареждат само за избрания работен процес.
Няма API, изпращащ документи до Tool Office сървъри; резултатите се създават като локални петна.
Изобразяване, филтриране, изрязване, редактиране и OCR излага визуализация/изход за потребителски преглед.
До 30 страници/изображения, 25 MB на файл и споделените лимити на платното намаляват риска от срив на раздела.
Не. Файловете се обработват в браузъра. Tesseract може да изтегля кодови/езикови модели от CDN, но не изпраща вашите изображения до OCR услуга.
Използвайте 150 DPI за леки визуализации, 200 DPI за баланс и 300 DPI за печат или OCR с малък текст. По-високият DPI използва повече памет и създава по-големи файлове.
Изправянето завърта страницата с няколко градуса, за да подравни редовете. Корекцията на перспектива използва четирите ъгъла, за да изравни снимана под ъгъл страница.
Не приемайте, че замъгляването е достатъчно за чувствителни данни. Растеризираната плътна черна кутия е по-ясна, но винаги отваряйте отново и проверявайте експортирания файл.
Не. Точността зависи от разделителната способност, шрифта, акцентите, осветлението, изкривяването и качеството на сканиране. Винаги проверявайте имената, числата, датите и сумите.
PDF.js изобразява всяка страница на Canvas, след което Tesseract Worker разпознава изображението на страницата. Tesseract.js не чете PDF файлове директно.
Запазва изображението на страницата и добавя OCR текстов слой за търсене/селекция. Слоят може да съдържа същите грешки при разпознаване като OCR текст.
Не е надеждно. Шифрованите PDF файлове може да поискат парола или да не успеят да се изобразят; този инструмент не краква или премахва PDF пароли.