OCR de PDF — Convertir un PDF scanné en texte

L'OCR de PDF extrait du texte modifiable des PDF scannés ou en images seules directement dans votre navigateur. Si votre PDF n'est composé que d'images de pages — un scan, une photo ou un export sans couche de texte — le copier-coller classique ne renvoie rien, et c'est exactement ce que corrige cet outil de PDF scanné en texte. Chaque page est rendue puis lue avec Tesseract OCR, et le texte reconnu est ensuite regroupé pour que vous puissiez le copier ou télécharger un fichier .txt. Tout fonctionne à 100% dans votre navigateur : votre document n'est jamais envoyé et reste totalement privé. Idéal pour les reçus, contrats, livres, formulaires et autres PDF en images sans texte sélectionnable.

🔒 100 % privé — les fichiers ne quittent jamais votre appareil

Chargement…

Comment faire

  1. Déposez votre PDF scanné ou en images seules sur la page, ou cliquez pour sélectionner un fichier .pdf depuis votre appareil.
  2. L'outil rend chaque page sur un canevas haute résolution et lance Tesseract OCR, en affichant la progression en direct de la page en cours.
  3. Lisez le texte reconnu à mesure qu'il remplit la zone de sortie, page par page, séparé par des lignes vides.
  4. Copiez le texte dans le presse-papiers ou téléchargez-le en fichier .txt — aucun envoi, rien ne quitte votre appareil.

Questions fréquentes

Sur quel type de PDF cet outil OCR fonctionne-t-il ?

Il est conçu pour les PDF scannés ou en images seules — des pages qui sont des images sans texte sélectionnable intégré. Chaque page est rendue en image puis lue par OCR. Si votre PDF possède déjà une vraie couche de texte, un extracteur PDF vers texte classique sera plus rapide et plus précis.

Mon PDF est-il envoyé sur un serveur ?

Non. Tout le processus s'exécute à 100% dans votre navigateur avec pdf.js et Tesseract.js. Votre PDF est lu en local, l'OCR se fait sur votre propre appareil et rien n'est jamais envoyé, votre document reste donc totalement privé.

Quelles langues peut-il reconnaître ?

L'OCR utilise le modèle de langue anglais (eng), il fonctionne donc mieux sur les documents en anglais. Le texte dans d'autres alphabets ou avec de nombreux accents peut ne pas être reconnu avec précision.

Y a-t-il une limite de taille de fichier ou de pages ?

Il n'y a pas de limite fixe, mais l'OCR est gourmand en ressources et s'exécute sur votre appareil. Les gros PDF comportant de nombreuses pages prennent plus de temps et consomment plus de mémoire ; les documents très volumineux ou en haute résolution peuvent donc être lents sur des machines moins puissantes.

Quelle est la précision du texte extrait ?

La précision dépend du scan. Des pages nettes, contrastées, bien droites et dans une police claire donnent les meilleurs résultats. Les scans flous, les pages de travers, l'écriture manuscrite, les polices minuscules ou les mises en page complexes à plusieurs colonnes peuvent générer des erreurs : mieux vaut relire le résultat.

Puis-je récupérer le texte ?

Oui. Le texte reconnu apparaît dans une zone de sortie modifiable où vous pouvez le sélectionner, le copier dans le presse-papiers en un clic ou le télécharger en fichier .txt simple qui conserve chaque page séparée par une ligne vide.

À propos de cet outil

OCR de PDF gratuit qui transforme les PDF scannés ou en images seules en texte modifiable avec Tesseract, en local. Copiez-le ou téléchargez un .txt — 100% dans votre navigateur, sans envoi.

Outils associés