• Tarifs
  1. Accueil
  2. Comment extraire du texte à partir d'images dans un PDF

Comment extraire du texte à partir d'images dans un PDF

Extrayez du texte à partir d'images dans un PDF avec notre OCR en ligne. Transformez scans et captures d'écran en texte consultable et modifiable en moins d'une minute.

Stéphane TurquayModifié le : 25 février 2026
Cet article est également disponible en Anglais, Allemand, Espagnol, Italien et Portugais.

Lorsque vous recevez un PDF numérisé ou une capture d’écran enregistrée au format PDF, vous pouvez avoir l’impression que le texte est enfermé dans l’image. Vous ne pouvez ni le sélectionner, ni le copier, ni rechercher quoi que ce soit. C’est précisément là que l’OCR peut vous aider.

Grâce à la fonctionnalité OCR de Smallpdf, vous pouvez extraire du texte à partir d’images dans un PDF directement dans votre navigateur, puis le copier, le modifier ou le convertir en Word ou en TXT.

En bref : extraire du texte à partir d’images dans un PDF

1
Accédez à la fonctionnalité OCR de Smallpdf et importez votre PDF numérisé ou votre capture d'écran.
2
Choisissez votre format de sortie : conservez le PDF pour obtenir un texte consultable, ou choisissez Word/TXT pour une modification complète.
3
Patientez pendant que nous reconnaissons le texte dans les images.
4
Prévisualisez le résultat pour vérifier que le texte semble correct.
5
Cliquez sur « Télécharger » pour enregistrer votre nouveau fichier avec un texte sélectionnable et consultable.
Extraire du texte d'une image dans un PDF en utilisant d'abord l'OCR
Extraire du texte d’une image dans un PDF en utilisant d’abord l’OCR

Vous pouvez ensuite copier le texte, mettre à jour le contenu ou l’associer à d’autres fonctionnalités de Smallpdf, comme Convertir un PDF en Word ou Compresser PDF.

Qu'est-ce que l'OCR pour les images dans un PDF ?

L'OCR (reconnaissance optique de caractères) est une technologie qui analyse des images et reconnaît le texte, puis le convertit en un format lisible par machine.

Lorsque vous avez un PDF qui n’est en réalité qu’une photo de page, l’OCR :

  • Analyse l’image

  • Détecte les formes et les motifs qui ressemblent à des lettres et à des chiffres

  • Reconstitue les mots et les lignes à partir de ces formes

  • Ajoute un calque de texte masqué derrière l’image

Une fois l’OCR terminé, vous pouvez rechercher, copier et indexer le document comme n’importe quel PDF classique basé sur du texte.

L'OCR fonctionne mieux lorsque :

  • Le texte est imprimé, et non manuscrit.

  • Le contraste est élevé, par exemple du texte noir sur fond blanc.

  • Le document est droit, ni incliné ni pivoté.

  • La résolution est suffisamment élevée pour que les lettres soient nettes.

En d'autres termes, plus la numérisation est nette, meilleur est le résultat.

Comment extraire du texte d'une image dans un PDF en ligne

Utiliser un outil OCR en ligne est généralement la façon la plus rapide d'extraire du texte à partir d'images dans un PDF, surtout si vous ne souhaitez pas installer de logiciel supplémentaire.

Étape 1 : Importez votre image PDF

Ouvrez Smallpdf et rendez-vous sur la fonctionnalité OCR de PDF feature. Drag and drop your PDF into the upload area, or click “Choose File” to browse from your device.

Vous pouvez également importer des fichiers directement depuis Google Drive, Dropbox ou OneDrive si votre PDF numérisé est stocké dans le cloud.

Étape 2 : Choisissez votre format de sortie

Une fois votre fichier importé, vous verrez les options de format de sortie. Vous pouvez :

  • Conservez-le au format PDF pour obtenir un document consultable avec un calque de texte.

  • Choisissez Word (DOCX) pour obtenir un document entièrement modifiable.

  • Choisissez TXT pour obtenir uniquement du texte brut.

Choisissez le format le mieux adapté à la suite. Par exemple, utilisez Word si vous devez réécrire un contrat, ou TXT si vous avez seulement besoin du texte brut pour l’analyse.

Étape 3 : Attendez que le traitement soit terminé

Notre OCR dans le cloud analyse chaque page, examine les images et détecte les lettres, les chiffres et les mots.

Le temps de traitement dépend de la taille du fichier et du nombre de pages, mais la plupart des documents sont traités en moins d'une minute.

Étape 4 : Vérifiez le texte reconnu

Une fois l’OCR terminé, vous pouvez prévisualiser le résultat. Faites défiler quelques pages et :

  • Essayez de sélectionner le texte avec votre souris.

  • Vérifiez les titres, les chiffres et les caractères spéciaux.

  • Vérifiez les textes petits ou clairs pour vous assurer qu’ils ont bien été capturés.

Si quelque chose ne semble pas correct, vous pouvez relancer l'OCR sur un scan de meilleure qualité ou ajuster votre fichier source.

Étape 5 : Téléchargez et utilisez votre nouveau fichier

Une fois satisfait du résultat, cliquez sur « Télécharger ». Enregistrez le nouveau fichier sur votre appareil ou renvoyez-le directement vers Google Drive, Dropbox ou OneDrive.

Extraire du texte d’une image dans un PDF en utilisant d’abord l’OCR
Extraire du texte d’une image dans un PDF en utilisant d’abord l’OCR

À partir de là, vous pouvez rechercher dans le document, copier des parties précises ou l'ouvrir dans votre éditeur préféré pour mettre à jour le contenu.

Copier et convertir le texte après l'OCR

Une fois l'OCR appliqué à votre PDF, il devient bien plus facile de travailler avec le texte.

Comment copier du texte à partir d’une image PDF numérisée

Pour copier du texte à partir d'une image PDF après l'OCR :

  1. Ouvrez votre PDF traité dans la visionneuse de votre choix.

  2. Cliquez et faites glisser le curseur sur le texte. S'il se surligne, l'OCR a fonctionné.

  3. Appuyez sur « Ctrl+C » (ou « Cmd+C » sur Mac) pour copier.

  4. Collez-le avec « Ctrl+V » (ou « Cmd+V ») dans Word, un e-mail ou n'importe quel éditeur.

Si vous ne pouvez rien surligner, cela signifie que le PDF ne comporte toujours pas de calque de texte. Vous devrez peut-être relancer l’OCR ou vérifier la qualité de l’image.

Convertir une image PDF en Word ou TXT avec l'OCR

Si vous prévoyez de modifier fortement le contenu, il est souvent préférable de convertir toute l'image PDF en Word ou en TXT plutôt que de faire un copier-coller.

  • Word (DOCX) conserve la mise en page, les polices et les images, ce qui vous permet de modifier le document tout en gardant sa structure d’origine.

  • TXT vous donne du texte brut sans mise en forme, ce qui est utile pour l'analyse de données, les scripts ou l'import dans d'autres systèmes.

Grâce à la fonctionnalité OCR de Smallpdf, vous obtenez exactement le fichier dont vous avez besoin une fois le traitement terminé.

Utilisations avancées de l’OCR : plusieurs langues et fichiers par lots

L'OCR ne sert pas seulement aux documents uniques en anglais. Vous pouvez aussi l'utiliser de façons plus avancées.

PDF multilingues

Si votre PDF contient plusieurs langues, l’OCR peut tout de même fonctionner à condition qu’elles soient prises en charge. Par exemple, un article de recherche avec un corps de texte en anglais et des références en allemand peut être reconnu dans les deux langues. La précision peut être légèrement moindre, donc mieux vaut vérifier les noms et les termes techniques.

Numérisation multipage et par lots

Vous pouvez importer des PDF de plusieurs pages et les traiter en une seule fois, plutôt que page par page. C’est utile pour :

  • Contrats ou rapports volumineux

  • Archives numérisées complètes

  • Factures ou reçus regroupés

De nombreuses équipes traitent aussi les fichiers par lots. Par exemple, une équipe comptable peut exporter un mois de reçus numérisés sous la forme d’un seul PDF, lancer l’OCR une seule fois, puis rechercher les noms des fournisseurs et les montants totaux.

Documents à contenu mixte

Si votre PDF contient à la fois des images et du texte, l'OCR ajoutera des calques de texte aux sections composées uniquement d'images. Le texte d'origine reste inchangé, ce qui vous permet d'obtenir un fichier entièrement consultable sur les deux types de contenu.

Conseils pour améliorer la précision de l’OCR et cas où il peut ne pas fonctionner

Une bonne qualité d’entrée est le meilleur moyen d'améliorer la précision de l'OCR. Quelques habitudes simples font une vraie différence.

Conseils pour de meilleurs résultats avec l’OCR :

  • Numérisez à 300 DPI ou plus pour obtenir un texte net.

  • Gardez les pages aussi plates et droites que possible.

  • Utilisez un bon éclairage et un contraste marqué lorsque vous prenez des photos.

  • Évitez les arrière-plans chargés ou le papier à motifs.

  • Utilisez des polices claires et standard pour les documents imprimés.

Limites courantes de l'OCR :

  • Le texte manuscrit est souvent mal reconnu et peut nécessiter une saisie manuelle.

  • Les polices très petites peuvent être ignorées ou mal lues.

  • Le texte imprimé sur des images ou des dégradés est plus difficile à détecter.

  • Les numérisations endommagées, décolorées ou floues réduiront la précision.

Si vous travaillez avec des documents très anciens ou des mises en page complexes, prévoyez quelques retouches ensuite.

Résoudre les problèmes lorsque vous ne pouvez pas sélectionner ou copier du texte

Il arrive parfois que, même après l'OCR, vous rencontriez encore des difficultés pour sélectionner ou copier du texte. Voici ce qu'il faut vérifier.

1. Vérifiez si le PDF contient toujours uniquement des images

Essayez de sélectionner un seul mot. Si rien ne se surligne, la page n’est encore qu’une image, ce qui signifie que l’OCR n’a pas été lancé ou n’est pas allé jusqu’au bout. Importez de nouveau le fichier et relancez le processus OCR.

2. Vérifiez les restrictions de sécurité

Certains PDF bloquent la copie. Si vous voyez des messages d’erreur concernant les autorisations, vous devrez peut-être d’abord déverrouiller le fichier à l’aide d’une fonctionnalité comme Déverrouiller un PDF, à condition que vous en ayez le droit.

3. Relancez l'OCR sur les pages problématiques

Dans les mises en page complexes avec des colonnes ou des tableaux, certains passages peuvent être ignorés. Essayez de relancer l'OCR sur de plus petites sections ou sur des pages individuelles.

4. Utilisez des captures d'écran comme solution de contournement

Si vous obtenez une erreur « Autorisation PDF insuffisante pour l'extraction de texte », il se peut que vous ne soyez pas autorisé à copier du texte à partir de ce fichier. Une solution consiste à faire une capture d'écran de la page visible, puis à lancer l'OCR sur cette image à la place.

Commencez dès aujourd’hui à extraire du texte à partir d’images dans des PDF

Extraire du texte à partir d’images dans un PDF n’a rien de compliqué. Grâce à l’OCR, vous pouvez récupérer le texte contenu dans des scans, des captures d’écran et des PDF composés uniquement d’images, puis le réutiliser là où vous en avez besoin.

Nous voyons chaque jour des équipes utiliser l'OCR de Smallpdf pour numériser des contrats, extraire des données de factures et rendre des articles de recherche consultables. Vous pouvez faire de même en quelques clics.

FAQ : Extraire du texte d'une image dans un PDF

Puis-je extraire du texte de plusieurs pages PDF à la fois ?

Oui. La fonctionnalité OCR de Smallpdf traite des PDF multipages en une seule fois, vous n’avez donc pas besoin de traiter chaque page séparément. Pour les très gros fichiers, vous pouvez d’abord les fractionner, puis les traiter par lots plus petits.

Puis-je extraire du texte de plusieurs PDF en même temps ?

Vous pouvez importer et traiter plusieurs PDF les uns après les autres au cours d’une même session. Si vous êtes utilisateur Pro, les limites de taille de fichier plus élevées vous permettent de gérer plus facilement de grands lots de documents numérisés.

Quelles langues l’OCR de Smallpdf prend-il en charge ?

L'OCR de Smallpdf prend en charge de nombreuses langues courantes, notamment l'anglais, l'espagnol, le français, l'allemand, l'italien, le portugais et bien d'autres. Pour obtenir les meilleurs résultats, assurez-vous que la langue principale de votre document est prise en charge et clairement imprimée.

Le texte extrait est-il exact à 100 % ?

Aucun OCR n'est parfait, mais pour un texte clair et imprimé, la précision se situe souvent entre 95 et 99 %. Vérifiez toujours les documents importants, en particulier les chiffres, les noms et les caractères spéciaux, avant de partager ou de signer quoi que ce soit.

Puis-je extraire du texte à partir de PDF protégés par mot de passe ?

Vous devez déverrouiller les PDF protégés par mot de passe avant que l'OCR puisse accéder au contenu. Si vous connaissez le mot de passe, vous pouvez d'abord ouvrir et déverrouiller le fichier, puis lancer l'OCR. Si vous ne l’avez pas, faire une capture d'écran et lancer l'OCR sur l'image peut être votre seule option.

Peut-on convertir Kindle en PDF sur Mac ?

Oui, le même processus fonctionne sur Mac avec Calibre et le plugin DeDRM. Les étapes sont identiques à celles de Windows.

Pourquoi la mise en page est-elle différente après l'OCR ?

L'OCR se concentre sur la capture du texte, puis essaie de reconstruire la mise en page au mieux. Les mises en page complexes, les colonnes ou les tableaux serrés peuvent ne pas apparaître exactement de la même façon. La conversion en Word préserve généralement davantage de structure que le TXT, mais vous devrez peut-être quand même faire quelques retouches manuelles.

Puis-je utiliser l'OCR sur de l'écriture manuscrite ?

Vous pouvez essayer, mais les résultats varieront beaucoup. Une écriture soignée en lettres détachées peut être lisible par endroits, mais une écriture cursive ou brouillonne nécessite généralement une saisie manuelle. Pour des notes manuscrites importantes, le plus sûr reste de vérifier et corriger soigneusement le résultat.

Quelle est la taille maximale des fichiers pour le traitement OCR ?

Les utilisateurs de la version gratuite peuvent travailler avec des fichiers plus petits, tandis que les abonnés Pro bénéficient de limites plus élevées pour traiter des scans volumineux et des PDF fusionnés. Si votre fichier est trop volumineux, vous pouvez utiliser des fonctionnalités comme Compresser PDF ou Fractionner PDF avant de lancer l’OCR.

Mes données sont-elles en sécurité lorsque j'utilise l'OCR en ligne ?

Oui. Fichiers protégés par un chiffrement TLS pendant le téléchargement et le traitement, puis Fichiers supprimés automatiquement après une heure. Smallpdf est Conforme au RGPD et Certifié ISO/IEC 27001 pour protéger vos données.

Extrayez du texte à partir de PDF basés sur des images grâce à l’OCR avec Smallpdf Pro

Stéphane Turquay

Stéphane Turquay

Principal Product Manager at Smallpdf

Autres articles de cet auteur