Extrayez du texte à partir d'images dans un PDF avec notre OCR en ligne. Transformez scans et captures d'écran en texte consultable et modifiable en moins d'une minute.
Lorsque vous recevez un PDF numérisé ou une capture d’écran enregistrée au format PDF, vous pouvez avoir l’impression que le texte est enfermé dans l’image. Vous ne pouvez ni le sélectionner, ni le copier, ni rechercher quoi que ce soit. C’est précisément là que l’OCR peut vous aider.
Grâce à la fonctionnalité OCR de Smallpdf, vous pouvez extraire du texte à partir d’images dans un PDF directement dans votre navigateur, puis le copier, le modifier ou le convertir en Word ou en TXT.
En bref : extraire du texte à partir d’images dans un PDF

Vous pouvez ensuite copier le texte, mettre à jour le contenu ou l’associer à d’autres fonctionnalités de Smallpdf, comme Convertir un PDF en Word ou Compresser PDF.
L'OCR (reconnaissance optique de caractères) est une technologie qui analyse des images et reconnaît le texte, puis le convertit en un format lisible par machine.
Lorsque vous avez un PDF qui n’est en réalité qu’une photo de page, l’OCR :
Analyse l’image
Détecte les formes et les motifs qui ressemblent à des lettres et à des chiffres
Reconstitue les mots et les lignes à partir de ces formes
Ajoute un calque de texte masqué derrière l’image
Une fois l’OCR terminé, vous pouvez rechercher, copier et indexer le document comme n’importe quel PDF classique basé sur du texte.
L'OCR fonctionne mieux lorsque :
Le texte est imprimé, et non manuscrit.
Le contraste est élevé, par exemple du texte noir sur fond blanc.
Le document est droit, ni incliné ni pivoté.
La résolution est suffisamment élevée pour que les lettres soient nettes.
En d'autres termes, plus la numérisation est nette, meilleur est le résultat.
Utiliser un outil OCR en ligne est généralement la façon la plus rapide d'extraire du texte à partir d'images dans un PDF, surtout si vous ne souhaitez pas installer de logiciel supplémentaire.
Ouvrez Smallpdf et rendez-vous sur la fonctionnalité OCR de PDF feature. Drag and drop your PDF into the upload area, or click “Choose File” to browse from your device.
Vous pouvez également importer des fichiers directement depuis Google Drive, Dropbox ou OneDrive si votre PDF numérisé est stocké dans le cloud.
Une fois votre fichier importé, vous verrez les options de format de sortie. Vous pouvez :
Conservez-le au format PDF pour obtenir un document consultable avec un calque de texte.
Choisissez Word (DOCX) pour obtenir un document entièrement modifiable.
Choisissez TXT pour obtenir uniquement du texte brut.
Choisissez le format le mieux adapté à la suite. Par exemple, utilisez Word si vous devez réécrire un contrat, ou TXT si vous avez seulement besoin du texte brut pour l’analyse.
Notre OCR dans le cloud analyse chaque page, examine les images et détecte les lettres, les chiffres et les mots.
Le temps de traitement dépend de la taille du fichier et du nombre de pages, mais la plupart des documents sont traités en moins d'une minute.
Une fois l’OCR terminé, vous pouvez prévisualiser le résultat. Faites défiler quelques pages et :
Essayez de sélectionner le texte avec votre souris.
Vérifiez les titres, les chiffres et les caractères spéciaux.
Vérifiez les textes petits ou clairs pour vous assurer qu’ils ont bien été capturés.
Si quelque chose ne semble pas correct, vous pouvez relancer l'OCR sur un scan de meilleure qualité ou ajuster votre fichier source.
Une fois satisfait du résultat, cliquez sur « Télécharger ». Enregistrez le nouveau fichier sur votre appareil ou renvoyez-le directement vers Google Drive, Dropbox ou OneDrive.

À partir de là, vous pouvez rechercher dans le document, copier des parties précises ou l'ouvrir dans votre éditeur préféré pour mettre à jour le contenu.
Une fois l'OCR appliqué à votre PDF, il devient bien plus facile de travailler avec le texte.
Pour copier du texte à partir d'une image PDF après l'OCR :
Ouvrez votre PDF traité dans la visionneuse de votre choix.
Cliquez et faites glisser le curseur sur le texte. S'il se surligne, l'OCR a fonctionné.
Appuyez sur « Ctrl+C » (ou « Cmd+C » sur Mac) pour copier.
Collez-le avec « Ctrl+V » (ou « Cmd+V ») dans Word, un e-mail ou n'importe quel éditeur.
Si vous ne pouvez rien surligner, cela signifie que le PDF ne comporte toujours pas de calque de texte. Vous devrez peut-être relancer l’OCR ou vérifier la qualité de l’image.
Si vous prévoyez de modifier fortement le contenu, il est souvent préférable de convertir toute l'image PDF en Word ou en TXT plutôt que de faire un copier-coller.
Word (DOCX) conserve la mise en page, les polices et les images, ce qui vous permet de modifier le document tout en gardant sa structure d’origine.
TXT vous donne du texte brut sans mise en forme, ce qui est utile pour l'analyse de données, les scripts ou l'import dans d'autres systèmes.
Grâce à la fonctionnalité OCR de Smallpdf, vous obtenez exactement le fichier dont vous avez besoin une fois le traitement terminé.
L'OCR ne sert pas seulement aux documents uniques en anglais. Vous pouvez aussi l'utiliser de façons plus avancées.
PDF multilingues
Si votre PDF contient plusieurs langues, l’OCR peut tout de même fonctionner à condition qu’elles soient prises en charge. Par exemple, un article de recherche avec un corps de texte en anglais et des références en allemand peut être reconnu dans les deux langues. La précision peut être légèrement moindre, donc mieux vaut vérifier les noms et les termes techniques.
Numérisation multipage et par lots
Vous pouvez importer des PDF de plusieurs pages et les traiter en une seule fois, plutôt que page par page. C’est utile pour :
Contrats ou rapports volumineux
Archives numérisées complètes
Factures ou reçus regroupés
De nombreuses équipes traitent aussi les fichiers par lots. Par exemple, une équipe comptable peut exporter un mois de reçus numérisés sous la forme d’un seul PDF, lancer l’OCR une seule fois, puis rechercher les noms des fournisseurs et les montants totaux.
Documents à contenu mixte
Si votre PDF contient à la fois des images et du texte, l'OCR ajoutera des calques de texte aux sections composées uniquement d'images. Le texte d'origine reste inchangé, ce qui vous permet d'obtenir un fichier entièrement consultable sur les deux types de contenu.
Une bonne qualité d’entrée est le meilleur moyen d'améliorer la précision de l'OCR. Quelques habitudes simples font une vraie différence.
Conseils pour de meilleurs résultats avec l’OCR :
Numérisez à 300 DPI ou plus pour obtenir un texte net.
Gardez les pages aussi plates et droites que possible.
Utilisez un bon éclairage et un contraste marqué lorsque vous prenez des photos.
Évitez les arrière-plans chargés ou le papier à motifs.
Utilisez des polices claires et standard pour les documents imprimés.
Limites courantes de l'OCR :
Le texte manuscrit est souvent mal reconnu et peut nécessiter une saisie manuelle.
Les polices très petites peuvent être ignorées ou mal lues.
Le texte imprimé sur des images ou des dégradés est plus difficile à détecter.
Les numérisations endommagées, décolorées ou floues réduiront la précision.
Si vous travaillez avec des documents très anciens ou des mises en page complexes, prévoyez quelques retouches ensuite.
Il arrive parfois que, même après l'OCR, vous rencontriez encore des difficultés pour sélectionner ou copier du texte. Voici ce qu'il faut vérifier.
1. Vérifiez si le PDF contient toujours uniquement des images
Essayez de sélectionner un seul mot. Si rien ne se surligne, la page n’est encore qu’une image, ce qui signifie que l’OCR n’a pas été lancé ou n’est pas allé jusqu’au bout. Importez de nouveau le fichier et relancez le processus OCR.
2. Vérifiez les restrictions de sécurité
Certains PDF bloquent la copie. Si vous voyez des messages d’erreur concernant les autorisations, vous devrez peut-être d’abord déverrouiller le fichier à l’aide d’une fonctionnalité comme Déverrouiller un PDF, à condition que vous en ayez le droit.
3. Relancez l'OCR sur les pages problématiques
Dans les mises en page complexes avec des colonnes ou des tableaux, certains passages peuvent être ignorés. Essayez de relancer l'OCR sur de plus petites sections ou sur des pages individuelles.
4. Utilisez des captures d'écran comme solution de contournement
Si vous obtenez une erreur « Autorisation PDF insuffisante pour l'extraction de texte », il se peut que vous ne soyez pas autorisé à copier du texte à partir de ce fichier. Une solution consiste à faire une capture d'écran de la page visible, puis à lancer l'OCR sur cette image à la place.
Extraire du texte à partir d’images dans un PDF n’a rien de compliqué. Grâce à l’OCR, vous pouvez récupérer le texte contenu dans des scans, des captures d’écran et des PDF composés uniquement d’images, puis le réutiliser là où vous en avez besoin.
Nous voyons chaque jour des équipes utiliser l'OCR de Smallpdf pour numériser des contrats, extraire des données de factures et rendre des articles de recherche consultables. Vous pouvez faire de même en quelques clics.
FAQ : Extraire du texte d'une image dans un PDF
Puis-je extraire du texte de plusieurs pages PDF à la fois ?
Oui. La fonctionnalité OCR de Smallpdf traite des PDF multipages en une seule fois, vous n’avez donc pas besoin de traiter chaque page séparément. Pour les très gros fichiers, vous pouvez d’abord les fractionner, puis les traiter par lots plus petits.Puis-je extraire du texte de plusieurs PDF en même temps ?
Vous pouvez importer et traiter plusieurs PDF les uns après les autres au cours d’une même session. Si vous êtes utilisateur Pro, les limites de taille de fichier plus élevées vous permettent de gérer plus facilement de grands lots de documents numérisés.Quelles langues l’OCR de Smallpdf prend-il en charge ?
L'OCR de Smallpdf prend en charge de nombreuses langues courantes, notamment l'anglais, l'espagnol, le français, l'allemand, l'italien, le portugais et bien d'autres. Pour obtenir les meilleurs résultats, assurez-vous que la langue principale de votre document est prise en charge et clairement imprimée.Le texte extrait est-il exact à 100 % ?
Aucun OCR n'est parfait, mais pour un texte clair et imprimé, la précision se situe souvent entre 95 et 99 %. Vérifiez toujours les documents importants, en particulier les chiffres, les noms et les caractères spéciaux, avant de partager ou de signer quoi que ce soit.Puis-je extraire du texte à partir de PDF protégés par mot de passe ?
Vous devez déverrouiller les PDF protégés par mot de passe avant que l'OCR puisse accéder au contenu. Si vous connaissez le mot de passe, vous pouvez d'abord ouvrir et déverrouiller le fichier, puis lancer l'OCR. Si vous ne l’avez pas, faire une capture d'écran et lancer l'OCR sur l'image peut être votre seule option.Peut-on convertir Kindle en PDF sur Mac ?
Oui, le même processus fonctionne sur Mac avec Calibre et le plugin DeDRM. Les étapes sont identiques à celles de Windows.Pourquoi la mise en page est-elle différente après l'OCR ?
L'OCR se concentre sur la capture du texte, puis essaie de reconstruire la mise en page au mieux. Les mises en page complexes, les colonnes ou les tableaux serrés peuvent ne pas apparaître exactement de la même façon. La conversion en Word préserve généralement davantage de structure que le TXT, mais vous devrez peut-être quand même faire quelques retouches manuelles.Puis-je utiliser l'OCR sur de l'écriture manuscrite ?
Vous pouvez essayer, mais les résultats varieront beaucoup. Une écriture soignée en lettres détachées peut être lisible par endroits, mais une écriture cursive ou brouillonne nécessite généralement une saisie manuelle. Pour des notes manuscrites importantes, le plus sûr reste de vérifier et corriger soigneusement le résultat.Quelle est la taille maximale des fichiers pour le traitement OCR ?
Les utilisateurs de la version gratuite peuvent travailler avec des fichiers plus petits, tandis que les abonnés Pro bénéficient de limites plus élevées pour traiter des scans volumineux et des PDF fusionnés. Si votre fichier est trop volumineux, vous pouvez utiliser des fonctionnalités comme Compresser PDF ou Fractionner PDF avant de lancer l’OCR.Mes données sont-elles en sécurité lorsque j'utilise l'OCR en ligne ?
Oui. Fichiers protégés par un chiffrement TLS pendant le téléchargement et le traitement, puis Fichiers supprimés automatiquement après une heure. Smallpdf est Conforme au RGPD et Certifié ISO/IEC 27001 pour protéger vos données.Extrayez du texte à partir de PDF basés sur des images grâce à l’OCR avec Smallpdf Pro
