PDF en image
Choisissez DPI et format pour extraire jusqu’à 30 pages, puis téléchargez une image ou un ZIP.
Rendez les pages en JPG/PNG/WebP, blanchissez le papier, redressez, corrigez la perspective, masquez des données, extrayez signatures/tampons et créez un PDF interrogeable sur votre appareil.
Un moteur unique couvre extraction, nettoyage, correction géométrique, confidentialité, OCR et regroupement des résultats.
Partez du résultat nécessaire. Ne lancez pas l’OCR si des images suffisent et vérifiez le masquage sur le fichier exporté.
Choisissez DPI et format pour extraire jusqu’à 30 pages, puis téléchargez une image ou un ZIP.
Utilisez gris, seuil, blanchiment, rotation, redressement et perspective avant OCR ou archivage.
Masquez les données visibles, reconnaissez l’une des 12 langues prises en charge et exportez texte, TSV ou PDF interrogeable.
PDF.js rend les pages au DPI choisi, sans capture d’écran.
Les filtres séparent papier et encre mais peuvent effacer les traits très fins.
Les quatre coins sources sont projetés sur une nouvelle image rectangulaire.
Le masquage crée un nouveau fichier matriciel avec la zone couverte.
Le mode signature détecte les zones sombres ; le mode tampon, l’encre rouge dominante.
Les pages sont rendues puis reconnues par un Worker OCR local.
PDF.js, Canvas et le Worker OCR lisent les fichiers sur l’appareil ; les bibliothèques lourdes ne chargent que pour le flux choisi.
Aucune API n’envoie les documents aux serveurs de Tool Office ; les résultats sont des Blobs locaux.
Rendu, filtre, recadrage, masquage et OCR fournissent un aperçu et un résultat à contrôler.
30 pages/images, 25 Mo par fichier et des limites Canvas communes réduisent le risque de blocage de l’onglet.
Non. Tesseract peut télécharger son code et ses modèles depuis un CDN, mais n’envoie pas vos images à un service OCR.
150 pour un aperçu léger, 200 pour l’équilibre, 300 pour l’impression ou les petits caractères. Plus de DPI consomme davantage de mémoire.
Le redressement tourne légèrement les lignes ; la perspective projette quatre coins pour aplatir une page en trapèze.
Ne le supposez pas. Un rectangle noir matricialisé est plus clair, mais rouvrez toujours le fichier exporté.
Non. La précision dépend de la résolution, de la police, des accents, de l’éclairage, de l’inclinaison et de la qualité du scan. Vérifiez noms, chiffres, dates et montants.
PDF.js rend chaque page dans Canvas, puis un Worker Tesseract reconnaît l’image ; Tesseract.js ne lit pas directement les PDF.
Il conserve l’image de page et ajoute une couche texte issue de l’OCR, avec les mêmes erreurs possibles.
Pas de manière fiable. L’outil ne casse ni ne retire les mots de passe.