PDF เอกสารที่สแกน และ OCR

แปลง PDF เป็นรูปภาพ ทำความสะอาดเอกสารที่สแกน และเรียกใช้ OCR ออนไลน์

แปลงหน้า PDF เป็น JPG/PNG/WebP ทำพื้นกระดาษให้ขาว ปรับภาพเอียงและมุมมอง ปกปิดข้อมูล แยกลายเซ็นหรือตราประทับ และสร้าง PDF ที่ค้นหาได้บนอุปกรณ์ของคุณ

PDF → JPG/PNG/WEBPTool Office
ปรับเอียง + มุมมองTool Office
ปกปิดข้อมูลในเครื่องTool Office
OCR 12 ภาษาTool Office

เครื่องมือรูปภาพเอกสาร

เครื่องมือชุดเดียวครอบคลุมตั้งแต่แยกหน้า ทำความสะอาด แก้รูปทรง ปกป้องข้อมูล ทำ OCR ไปจนถึงจัดชุดไฟล์ผลลัพธ์

กำลังโหลดเครื่องมือ

เลือก PDF และขั้นตอนการสแกนที่ถูกต้อง

เริ่มจากเอาต์พุตที่ต้องการ อย่าเรียกใช้ OCR เมื่อรูปภาพหน้าเพียงพอ และตรวจสอบการแก้ไขไฟล์ที่ส่งออก แทนที่จะอาศัยเพียงการแสดงตัวอย่างเท่านั้น

PDF เป็นรูปภาพ

เลือก DPI และรูปแบบเพื่อแยกได้สูงสุด 30 หน้า จากนั้นดาวน์โหลดหนึ่งภาพหรือ ZIP ตามลำดับแหล่งที่มา

สแกนการล้างข้อมูล

ใช้ระดับสีเทา การกำหนดเกณฑ์ การลบพื้นหลังสีเทา การหมุน การแก้ไขเดสก์ และเปอร์สเปคทีฟ ก่อน OCR หรือการเก็บถาวร

OCR และความเป็นส่วนตัว

ปิดข้อมูลที่มองเห็น รู้จำหนึ่งใน 12 ภาษาที่รองรับ และส่งออกข้อความ TSV หรือ PDF ที่ค้นหาได้

แปลงทุกหน้า PDF เป็นรูปภาพ

PDF.js เรนเดอร์เพจด้วย DPI ที่เลือก แทนที่จะจับภาพหน้าจอ

  1. เลือกหนึ่ง PDF สูงสุด 25 MB และ 30 หน้า
  2. เลือก JPG, PNG หรือ WEBP และ 150, 200 หรือ 300 DPI
  3. ประมวลผลไฟล์และตรวจสอบเอาต์พุตเพจแรก
  4. ดาวน์โหลดภาพหนึ่งภาพหรือ ZIP ที่มีทุกหน้าตามลำดับ PDF
  • 150 DPI เหมาะสำหรับการดูหน้าจอ; 300 DPI สร้างไฟล์ขนาดใหญ่สำหรับการพิมพ์/OCR
  • PDF ที่ป้องกันด้วยรหัสผ่านหรือเสียหายอาจไม่แสดงผล

ทำความสะอาดการสแกนสีเทาหรือเอียง

การกรองเอกสารแยกกระดาษออกจากหมึก แต่สามารถลบลายเส้นที่ละเอียดมากได้

  1. เลือก ปรับปรุง และกรองเอกสารที่สแกน
  2. ลองใช้โทนสีเทาก่อน จากนั้นจึงเพิ่มคอนทราสต์ปานกลาง
  3. ใช้กระดาษขาวหรือเกณฑ์ขาวดำแล้วปรับเกณฑ์
  4. เปิดใช้งานเดสก์อัตโนมัติหรือตั้งค่ามุมด้วยตนเอง จากนั้นตรวจสอบข้อความขนาดเล็ก
  • เก็บการสแกนสีต้นฉบับไว้เพื่อเปรียบเทียบ
  • การปรับเอียงอัตโนมัติทำงานในช่วงประมาณ ±5° และไม่แทนการแก้มุมมองสำหรับภาพที่เอียงมาก

แก้ไขมุมมองของเอกสารที่ถ่ายภาพ

มุมแหล่งที่มาสี่มุมถูกแมปกับรูปภาพสี่เหลี่ยมใหม่

  1. เลือกเพจที่คุณต้องการแก้ไข
  2. ประมาณการเส้นขอบสำหรับการครอบตัดสี่เหลี่ยมเริ่มต้น
  3. ปรับตัวควบคุม X/Y ทั้งแปดตัวจนกระทั่งมุมตรงกับขอบกระดาษ
  4. ประมวลผลและตรวจสอบสัดส่วนข้อความ ขอบหน้า และเนื้อหาที่ครอบตัด
  • พื้นหลังที่ตัดกันกับกระดาษช่วยในการประมาณเส้นขอบ
  • การตรวจจับอัตโนมัติในปัจจุบันจะประมาณสี่เหลี่ยม ปรับหน้ารูปสี่เหลี่ยมคางหมูด้วยตนเอง

ปกปิดข้อมูลก่อนแชร์

การปกปิดจะสร้างไฟล์ภาพใหม่โดยปิดทับบริเวณที่เลือกไว้

  1. เลือก Redact และเพจที่จะแก้ไข
  2. ปรับตำแหน่งและขนาดของขอบเขตในหน้าตัวอย่าง
  3. ชอบสีดำทึบในการถอดออก ความเบลอ/พิกเซลอาจไม่เหมาะสมกับข้อมูลที่ละเอียดอ่อน
  4. ส่งออก เปิดใหม่ และซูมเข้าเพื่อยืนยันว่าไม่สามารถอ่านรายละเอียดได้
  • เวิร์กโฟลว์ปัจจุบันใช้หนึ่งขอบเขตที่กำหนดค่าต่อหน้าในการรัน
  • อย่าแชร์ไฟล์ต้นฉบับเมื่อมีการแก้ไขเฉพาะสำเนาที่ส่งออกเท่านั้น

แยกลายเซ็นหรือตราประทับ

โหมดลายเซ็นใช้ความมืด โหมดแสตมป์ระบุหมึกสีแดงที่โดดเด่นและสร้างอัลฟ่า

  1. ใช้การสแกนที่มีแสงสว่างสม่ำเสมอโดยมีพื้นหลังสีขาว
  2. เลือกลายเซ็น/หมึกเข้ม หรือ แสตมป์/หมึกสีแดง
  3. ปรับเกณฑ์เพื่อรักษาลายเส้นขณะนำกระดาษออก
  4. ส่งออก PNG เพื่อรักษาความโปร่งใสและตรวจสอบขอบเส้นขีด
  • ห้ามใช้เครื่องหมายที่แยกออกมาเพื่อปลอมลายเซ็นหรือเอกสาร
  • เงาของกระดาษหรือสีที่ใกล้กับหมึกลดความแม่นยำในการสกัด

OCR รูปภาพหรือ PDF ที่สแกน

หน้า PDF จะถูกเรนเดอร์ก่อน จากนั้น OCR Worker ในเบราว์เซอร์จะอ่านข้อความจากแต่ละ Canvas

  1. เลือกภาษา OCR และประเภทเอกสารที่ตรงกับต้นฉบับ
  2. เปิดใช้งาน PDF ที่ค้นหาได้หากจำเป็นต้องใช้เลเยอร์ข้อความ
  3. เริ่ม OCR และอนุญาตให้ดาวน์โหลดโมเดลภาษาเมื่อใช้งานครั้งแรก
  4. ตรวจข้อความ ตัวเลข จำนวนเงิน อักขระเฉพาะภาษา และ TSV เทียบกับต้นฉบับ
  • ไม่รับประกันความแม่นยำ OCR โปรดเทียบผลกับต้นฉบับ
  • TSV พื้นฐานไม่ได้สร้างเซลล์ที่ผสานหรือเค้าโครงตารางที่ซับซ้อนขึ้นมาใหม่อย่างสมบูรณ์แบบ

ประมวลผลเอกสารส่วนตัวในเบราว์เซอร์

PDF/รูปภาพอ่านได้เฉพาะโดย PDF.js, Canvas และ OCR Worker บนอุปกรณ์ ไลบรารีและโมเดลจำนวนมากโหลดเฉพาะสำหรับเวิร์กโฟลว์ที่เลือกเท่านั้น

ไม่มีการอัปโหลดเอกสาร

ไม่มี API ที่ส่งเอกสารไปยังเซิร์ฟเวอร์ Tool Office ผลลัพธ์จะถูกสร้างขึ้นเป็น Blobs ท้องถิ่น

ไปป์ไลน์ที่ตรวจสอบได้

การเรนเดอร์ การกรอง การครอบตัด การแก้ไข และ OCR เปิดเผยการแสดงตัวอย่าง/เอาท์พุตเพื่อให้ผู้ใช้ตรวจสอบ

ข้อจำกัดด้านความปลอดภัย

สูงสุด 30 หน้า/รูปภาพ, 25 MB ต่อไฟล์ และขีดจำกัด Canvas ที่ใช้ร่วมกันช่วยลดความเสี่ยงที่แท็บจะขัดข้อง

คำถามที่พบบ่อยเกี่ยวกับ PDF, สแกน และ OCR

มีการอัปโหลด PDF และการสแกนหรือไม่

ไม่ ไฟล์ได้รับการประมวลผลในเบราว์เซอร์ Tesseract อาจดาวน์โหลดโมเดลโค้ด/ภาษาจาก CDN แต่จะไม่ส่งรูปภาพของคุณไปยังบริการ OCR

ฉันควรใช้ DPI ใดสำหรับ PDF เป็นรูปภาพ

ใช้ 150 DPI สำหรับการแสดงตัวอย่างแบบ light, 200 DPI สำหรับความสมดุล และ 300 DPI สำหรับการพิมพ์หรือ OCR ข้อความขนาดเล็ก DPI ที่สูงกว่าจะใช้หน่วยความจำมากขึ้นและสร้างไฟล์ที่ใหญ่ขึ้น

Deskew และ Perspective Correction แตกต่างกันอย่างไร?

Deskew หมุนสองสามองศาเพื่อปรับระดับบรรทัดข้อความ การแก้ไขเปอร์สเปคทีฟจะจับคู่มุมทั้งสี่เพื่อทำให้รูปสี่เหลี่ยมคางหมูหรือหน้ามุมที่ถ่ายเรียบขึ้น

การเบลอปลอดภัยพอสำหรับปกปิดข้อมูลหรือไม่

อย่าถือว่าการเบลอนั้นเพียงพอสำหรับข้อมูลที่ละเอียดอ่อน กล่องดำทึบแบบแรสเตอร์จะชัดเจนกว่า แต่ต้องเปิดใหม่และตรวจสอบไฟล์ที่ส่งออกเสมอ

OCR ของเวียดนามมีความแม่นยำอย่างสมบูรณ์หรือไม่

ไม่ ความแม่นยำขึ้นอยู่กับความละเอียด แบบอักษร ส่วนเน้น แสง ความเอียง และคุณภาพการสแกน ตรวจสอบชื่อ ตัวเลข วันที่ และจำนวนเงินเสมอ

PDF OCR ที่สแกนทำงานอย่างไร

PDF.js แสดงผลแต่ละหน้าเป็น Canvas จากนั้น Tesseract Worker จะจดจำรูปภาพของหน้านั้น Tesseract.js ไม่ได้อ่าน PDF โดยตรง

PDF ที่ค้นหาได้คืออะไร

จะรักษารูปภาพของหน้าและเพิ่มเลเยอร์ข้อความ OCR สำหรับการค้นหา/การเลือก เลเยอร์อาจมีข้อผิดพลาดในการจดจำเช่นเดียวกับข้อความ OCR

เครื่องมือนี้จัดการ PDF ที่มีการป้องกันด้วยรหัสผ่านหรือไม่

ไม่น่าเชื่อถือ PDF ที่เข้ารหัสอาจขอรหัสผ่านหรือไม่แสดงผล เครื่องมือนี้ไม่ถอดรหัสหรือลบรหัสผ่าน PDF

เครื่องมือที่เกี่ยวข้อง