PDF, documentos escaneados y OCR

Convierte PDF a imágenes, mejora escaneos y ejecuta OCR online

Renderiza páginas PDF como JPG/PNG/WEBP, elimina el gris del papel, endereza, corrige perspectiva, oculta datos, extrae firmas/sellos y crea PDF buscables en tu dispositivo.

PDF → JPG/PNG/WEBPTool Office
Enderezado + perspectivaTool Office
Ocultación localTool Office
OCR en 12 idiomasTool Office

Herramientas de imágenes de documentos

Un único motor cubre el ciclo del escaneo: extracción, limpieza, corrección geométrica, privacidad, OCR y empaquetado de resultados, sin páginas distintas para cada filtro o idioma.

Cargando herramienta

Elige el flujo correcto para PDF y escaneos

Empieza por el resultado que necesitas. No ejecutes OCR si bastan imágenes de las páginas y comprueba la ocultación en el archivo exportado, no solo en la vista previa.

PDF a imagen

Elige DPI y formato para extraer hasta 30 páginas; descarga una imagen o un ZIP en el orden original.

Limpieza de escaneos

Usa escala de grises, umbral, eliminación del fondo gris, rotación, enderezado y perspectiva antes del OCR o archivo.

OCR y privacidad

Oculta datos visibles, reconoce uno de 12 idiomas compatibles y exporta texto, TSV básico o PDF buscable.

Convertir cada página del PDF en una imagen

PDF.js renderiza las páginas con los DPI elegidos en lugar de hacer capturas de pantalla.

  1. Elige un PDF de hasta 25 MB y 30 páginas.
  2. Selecciona JPG, PNG o WEBP y 150, 200 o 300 DPI.
  3. Procesa el archivo y revisa la primera página resultante.
  4. Descarga una imagen o un ZIP con todas las páginas en el orden del PDF.
  • 150 DPI sirven para pantalla; 300 DPI producen archivos más grandes para impresión u OCR.
  • Los PDF dañados o protegidos con contraseña pueden no renderizarse.

Limpiar un escaneo gris o inclinado

El filtro de documentos separa el papel de la tinta, pero puede eliminar trazos muy finos.

  1. Selecciona Mejorar y filtrar documentos escaneados.
  2. Prueba primero la escala de grises y añade después un contraste moderado.
  3. Usa Blanquear fondo o el umbral de blanco y negro y ajusta el nivel.
  4. Activa el enderezado automático o indica un ángulo manual y revisa el texto pequeño.
  • Conserva el escaneo original en color para compararlo.
  • El enderezado automático solo estima ±5° y no sustituye la corrección de perspectiva en fotos muy inclinadas.

Corregir la perspectiva de un documento fotografiado

Las cuatro esquinas de origen se transforman en una nueva imagen rectangular.

  1. Selecciona la página que quieres corregir.
  2. Estima el borde para obtener un recorte rectangular inicial.
  3. Ajusta los ocho controles X/Y hasta que las esquinas coincidan con los bordes del papel.
  4. Procesa y revisa las proporciones del texto, los bordes y el contenido recortado.
  • Un fondo que contraste con el papel facilita la estimación del borde.
  • La detección automática actual estima un rectángulo; ajusta manualmente las páginas con forma trapezoidal.

Ocultar información antes de compartir

La ocultación crea un archivo rasterizado nuevo con la zona seleccionada cubierta.

  1. Selecciona Ocultar y la página que quieres editar.
  2. Ajusta la posición y el tamaño de la zona en la vista previa.
  3. Para eliminar información, prefiere negro sólido; el desenfoque o pixelado puede no proteger datos sensibles.
  4. Exporta, vuelve a abrir y amplía el archivo para comprobar que el dato no se puede leer.
  • En cada ejecución, el flujo actual aplica una zona configurada por página.
  • No compartas el archivo de origen si solo has ocultado datos en la copia exportada.

Extraer una firma o un sello

El modo firma detecta oscuridad; el modo sello identifica tinta roja dominante y crea transparencia.

  1. Usa un escaneo con iluminación uniforme y fondo blanco.
  2. Elige Firma/tinta oscura o Sello/tinta roja.
  3. Ajusta el umbral para conservar los trazos y eliminar el papel.
  4. Exporta a PNG para mantener la transparencia y revisa los bordes de los trazos.
  • No utilices las marcas extraídas para falsificar firmas o documentos.
  • Las sombras del papel o colores próximos a la tinta reducen la precisión.

Aplicar OCR a una imagen o PDF escaneado

Primero se renderizan las páginas del PDF y después un Worker local reconoce cada Canvas.

  1. Elige el idioma OCR y el tipo de documento adecuados.
  2. Activa PDF con texto buscable si necesitas una capa de texto.
  3. Inicia el OCR y permite descargar el modelo de idioma la primera vez.
  4. Revisa texto, cifras, importes, caracteres propios del idioma y la salida TSV.
  • La precisión del OCR no está garantizada; compárala con el original.
  • El TSV básico no reconstruye perfectamente celdas combinadas ni tablas complejas.

Procesa documentos privados en el navegador

PDF.js, Canvas y un Worker de OCR leen los PDF/imágenes en el dispositivo; las bibliotecas y modelos pesados solo se cargan para el flujo elegido.

Sin subir documentos

Ninguna API envía documentos a los servidores de Tool Office; los resultados se crean como Blobs locales.

Proceso verificable

Renderizado, filtros, recorte, ocultación y OCR ofrecen vistas previas y salidas que puedes revisar.

Límites de seguridad

Un máximo de 30 páginas/imágenes, 25 MB por archivo y límites de Canvas compartidos reducen el riesgo de bloquear la pestaña.

Preguntas frecuentes sobre PDF, escaneo y OCR

¿Se suben los PDF y escaneos?

No. Los archivos se procesan en el navegador. Tesseract puede descargar código y modelos de idioma desde un CDN, pero no envía tus imágenes a ningún servicio de OCR.

¿Qué DPI debo usar para convertir PDF a imagen?

Usa 150 DPI para vistas previas ligeras, 200 DPI como equilibrio y 300 DPI para impresión u OCR de texto pequeño. Más DPI consumen más memoria y crean archivos mayores.

¿En qué se diferencian enderezado y corrección de perspectiva?

El enderezado gira unos grados para nivelar las líneas. La perspectiva transforma cuatro esquinas para aplanar una página fotografiada en ángulo o con forma trapezoidal.

¿El desenfoque es un método seguro para ocultar datos?

No des por hecho que basta para información sensible. Un rectángulo negro rasterizado es más claro, pero siempre debes volver a abrir y comprobar el archivo exportado.

¿El OCR de vietnamita es totalmente preciso?

No. La precisión depende de resolución, fuente, tildes, iluminación, inclinación y calidad del escaneo. Revisa nombres, números, fechas e importes.

¿Cómo funciona el OCR de un PDF escaneado?

PDF.js renderiza cada página en Canvas y un Worker de Tesseract reconoce después la imagen. Tesseract.js no lee PDF directamente.

¿Qué es un PDF con texto buscable?

Conserva la imagen de la página y añade una capa OCR que permite buscar o seleccionar texto. Esa capa puede contener los mismos errores del reconocimiento.

¿Admite PDF protegidos con contraseña?

No de forma fiable. Un PDF cifrado puede pedir contraseña o no renderizarse; la herramienta no descifra ni elimina contraseñas.

Herramientas relacionadas