PDF, documents scannés et OCR

Convertir un PDF en images, nettoyer des scans et lancer l’OCR

Rendez les pages en JPG/PNG/WebP, blanchissez le papier, redressez, corrigez la perspective, masquez des données, extrayez signatures/tampons et créez un PDF interrogeable sur votre appareil.

PDF → JPG/PNG/WebPTool Office
Redressement + perspectiveTool Office
Masquage localTool Office
OCR en 12 languesTool Office

Outils pour documents et images

Un moteur unique couvre extraction, nettoyage, correction géométrique, confidentialité, OCR et regroupement des résultats.

Chargement de l’outil

Choisir le bon traitement PDF ou scan

Partez du résultat nécessaire. Ne lancez pas l’OCR si des images suffisent et vérifiez le masquage sur le fichier exporté.

PDF en image

Choisissez DPI et format pour extraire jusqu’à 30 pages, puis téléchargez une image ou un ZIP.

Nettoyage du scan

Utilisez gris, seuil, blanchiment, rotation, redressement et perspective avant OCR ou archivage.

OCR et confidentialité

Masquez les données visibles, reconnaissez l’une des 12 langues prises en charge et exportez texte, TSV ou PDF interrogeable.

Convertir chaque page du PDF en image

PDF.js rend les pages au DPI choisi, sans capture d’écran.

  1. Choisissez un PDF de 25 Mo et 30 pages maximum.
  2. Sélectionnez JPG, PNG ou WebP et 150, 200 ou 300 DPI.
  3. Traitez le fichier puis examinez la première page obtenue.
  4. Téléchargez une image ou le ZIP dans l’ordre du PDF.
  • 150 DPI convient à l’écran ; 300 DPI produit de gros fichiers pour impression/OCR.
  • Un PDF chiffré ou corrompu peut ne pas être rendu.

Nettoyer un scan gris ou incliné

Les filtres séparent papier et encre mais peuvent effacer les traits très fins.

  1. Choisissez l’amélioration des scans.
  2. Essayez d’abord les niveaux de gris et un contraste modéré.
  3. Activez le blanchiment ou le noir et blanc puis réglez le seuil.
  4. Redressez automatiquement ou manuellement et vérifiez les petits caractères.
  • Conservez le scan couleur original pour comparaison.
  • Le redressement automatique est limité à ±5° et ne remplace pas la correction de perspective.

Corriger la perspective d’un document photographié

Les quatre coins sources sont projetés sur une nouvelle image rectangulaire.

  1. Sélectionnez la page à corriger.
  2. Estimez le bord pour un premier recadrage.
  3. Ajustez les huit coordonnées jusqu’aux bords du papier.
  4. Traitez puis contrôlez proportions, bords et contenu coupé.
  • Un fond contrasté facilite l’estimation.
  • La détection automatique estime un rectangle ; corrigez manuellement un trapèze.

Masquer des informations avant partage

Le masquage crée un nouveau fichier matriciel avec la zone couverte.

  1. Choisissez Masquer et la page.
  2. Réglez position et taille de la zone.
  3. Préférez le noir opaque pour une information sensible.
  4. Exportez, rouvrez et zoomez pour vérifier l’illisibilité.
  • Une seule zone configurée est appliquée par page et par exécution.
  • Ne partagez pas la source si seule la copie exportée a été masquée.

Extraire une signature ou un tampon

Le mode signature détecte les zones sombres ; le mode tampon, l’encre rouge dominante.

  1. Utilisez un scan éclairé uniformément sur fond blanc.
  2. Choisissez signature ou tampon.
  3. Réglez le seuil pour garder les traits et retirer le papier.
  4. Exportez en PNG transparent et vérifiez les bords.
  • N’utilisez pas les marques extraites pour falsifier un document.
  • Les ombres et couleurs proches de l’encre réduisent la précision.

Lancer l’OCR sur une image ou un PDF scanné

Les pages sont rendues puis reconnues par un Worker OCR local.

  1. Choisissez la langue OCR et le type de document adaptés.
  2. Activez le PDF interrogeable si une couche texte est nécessaire.
  3. Lancez l’OCR et autorisez le téléchargement initial du modèle.
  4. Relisez texte, nombres, montants, caractères propres à la langue et sortie TSV.
  • La précision de l’OCR n’est pas garantie ; comparez avec la source.
  • Le TSV simple ne reconstruit pas parfaitement les cellules fusionnées ou tableaux complexes.

Traiter les documents privés dans le navigateur

PDF.js, Canvas et le Worker OCR lisent les fichiers sur l’appareil ; les bibliothèques lourdes ne chargent que pour le flux choisi.

Aucun document envoyé

Aucune API n’envoie les documents aux serveurs de Tool Office ; les résultats sont des Blobs locaux.

Étapes vérifiables

Rendu, filtre, recadrage, masquage et OCR fournissent un aperçu et un résultat à contrôler.

Limites de sécurité

30 pages/images, 25 Mo par fichier et des limites Canvas communes réduisent le risque de blocage de l’onglet.

Questions sur PDF, scans et OCR

Les PDF et scans sont-ils envoyés ?

Non. Tesseract peut télécharger son code et ses modèles depuis un CDN, mais n’envoie pas vos images à un service OCR.

Quels DPI choisir pour PDF en image ?

150 pour un aperçu léger, 200 pour l’équilibre, 300 pour l’impression ou les petits caractères. Plus de DPI consomme davantage de mémoire.

Différence entre redressement et perspective ?

Le redressement tourne légèrement les lignes ; la perspective projette quatre coins pour aplatir une page en trapèze.

Le flou suffit-il pour masquer des données ?

Ne le supposez pas. Un rectangle noir matricialisé est plus clair, mais rouvrez toujours le fichier exporté.

L’OCR français est-il parfaitement précis ?

Non. La précision dépend de la résolution, de la police, des accents, de l’éclairage, de l’inclinaison et de la qualité du scan. Vérifiez noms, chiffres, dates et montants.

Comment fonctionne l’OCR d’un PDF scanné ?

PDF.js rend chaque page dans Canvas, puis un Worker Tesseract reconnaît l’image ; Tesseract.js ne lit pas directement les PDF.

Qu’est-ce qu’un PDF interrogeable ?

Il conserve l’image de page et ajoute une couche texte issue de l’OCR, avec les mêmes erreurs possibles.

Les PDF protégés par mot de passe sont-ils acceptés ?

Pas de manière fiable. L’outil ne casse ni ne retire les mots de passe.

Outils associés