Ce que veut dire convertir une image en texte
Convertir une image en texte s’appelle l’OCR, pour reconnaissance optique de caractères. L’ordinateur examine les formes d’une image, détermine lesquelles sont des lettres et les transforme en texte que vous pouvez sélectionner, modifier, rechercher et copier.
C’est utile chaque fois qu’un texte est prisonnier d’une image : la capture d’un message d’erreur, la photo d’un panneau, une lettre scannée, une diapositive de présentation, une citation dans une image reçue. Au lieu de tout retaper, vous laissez l’ordinateur lire.
Comment utiliser le convertisseur
- Choisissez la Langue de l’image. Sur cette page, le français est sélectionné par défaut. Douze langues sont proposées : français, anglais, espagnol, allemand, italien, portugais, néerlandais, hindi, japonais, coréen, chinois simplifié et chinois traditionnel. Pour une capture en anglais, choisissez Anglais.
- Donnez une image à l’outil de l’une de ces trois façons :
- Déposez un fichier image sur la zone qui indique Déposez une image ici, ou choisissez un fichier.
- Appuyez sur Choisir une image et sélectionnez un ou plusieurs fichiers.
- Copiez une capture d’écran, puis appuyez sur Ctrl+V (Cmd+V sur Mac) n’importe où sur la page, ou appuyez sur Coller une image.
- Suivez la barre de progression. La première analyse est plus longue, car le moteur de lecture et les données de langue doivent se télécharger. Ensuite, chaque image prend quelques secondes.
- Lisez le résultat dans Texte extrait. Vous pouvez le modifier directement.
- Appuyez sur Copier, ou sur Télécharger pour l’enregistrer sous texte-image.txt.
Si vous choisissez plusieurs images à la fois, elles sont lues dans l’ordre et le texte de chacune est ajouté sous le précédent, séparé par une ligne vide. Les compteurs sous le texte indiquent le nombre de Mots et de Caractères, ainsi que la Confiance moyenne du lot.
Ce qui marche bien, et moins bien
| Image | À quoi s’attendre |
|---|---|
| Capture d’écran d’une page web, d’une application ou d’un document | Très bien. Un texte net, propre et bien contrasté est le plus facile à lire. |
| Photo d’une page imprimée, prise bien en face avec un bon éclairage | Bien. Vérifiez les chiffres et la ponctuation. |
| Lettre ou formulaire scanné | Bien pour le texte tapé. Les cases et les lignes des formulaires peuvent ajouter des caractères parasites. |
| Photo prise de biais, dans l’ombre ou floue | Variable. Recadrez et reprenez la photo si possible. |
| Texte sur une photo chargée ou un motif | Mauvais. Le fond perturbe le moteur. |
| Écriture manuscrite | Mauvais, sauf pour des capitales d’imprimerie très soignées. |
| Très petit texte, comme une page entière dans une petite capture | Mauvais. Zoomez et faites une capture plus rapprochée. |
Comment ça marche
La page utilise Tesseract, un moteur d’OCR open source bien connu, d’abord développé chez Hewlett-Packard puis rendu public. Il fonctionne ici grâce à Tesseract.js, une version du moteur conçue pour les navigateurs web.
Au lancement de la première analyse, votre navigateur télécharge trois éléments depuis cdn.jsdelivr.net : un petit script d’assistance, le moteur lui-même et un fichier de données pour la langue choisie. Ce sont uniquement des fichiers de programme et de langue. Votre navigateur les garde en cache, donc les analyses suivantes démarrent beaucoup plus vite. Choisir une autre langue télécharge le fichier de données de cette langue.
Le moteur repère ensuite les lignes de texte de votre image, les découpe en mots et en lettres, et compare les formes avec ce qu’il a appris de ses données d’entraînement. Tout cela se passe sur votre ordinateur ou votre téléphone. L’image est lue depuis la mémoire de votre appareil et n’est jamais envoyée, ce qui rend l’outil sûr pour des captures contenant des informations privées.
Conseils pour de meilleurs résultats
- Recadrez sur le texte. Retirez les bordures, photos et icônes autour du texte avant de déposer l’image.
- Plus c’est grand, mieux c’est. Des lettres grandes et nettes se lisent bien mieux que des lettres minuscules. Zoomez sur la page avant de faire la capture.
- Choisissez la bonne langue. Les lettres accentuées comme é, è, à, ç ou ô sont lues bien plus justement quand la langue correspondante est sélectionnée. Le français est choisi par défaut ici, mais pensez à changer de langue pour une image en anglais ou en allemand : avec la mauvaise langue, les accents se perdent souvent ou se transforment en d’autres signes.
- Redressez les photos. Tenez l’appareil bien au-dessus de la page, remplissez le cadre avec le texte et évitez les ombres.
- Nettoyez ensuite. Le texte issu d’une photo a souvent des sauts de ligne au milieu des phrases. Collez-le dans l’outil pour supprimer les sauts de ligne afin de recoller les lignes, et utilisez le convertisseur en texte brut pour corriger les guillemets et espaces bizarres.
- Relisez. Les erreurs d’OCR ressemblent à de vrais mots, par exemple « rn » lu comme « m » ou « 0 » lu comme « O ». Relisez deux fois les chiffres, les noms et les adresses e-mail.
Les photos de téléphone enregistrées au format HEIC ne peuvent pas être lues par la plupart des navigateurs. Enregistrez ou partagez d’abord la photo en JPG.
Autres façons d’extraire le texte d’une image
Google Docs. Importez l’image dans Google Drive, faites un clic droit dessus et choisissez Ouvrir avec, puis Google Docs. Le texte apparaît sous l’image dans un nouveau document. Cette méthode envoie l’image chez Google.
Microsoft OneNote et Word. Dans OneNote pour Windows, collez l’image, faites un clic droit dessus et choisissez l’option qui copie le texte de l’image. Word peut ouvrir un PDF et le convertir en document modifiable, ce qui fonctionne le mieux avec des scans propres.
Votre téléphone. Les versions récentes d’iOS et d’Android permettent de sélectionner directement le texte dans les photos et les captures d’écran. Appuyez longuement sur le texte dans l’application Photos ou Galerie.
Code. Tesseract peut s’installer sur Windows, macOS et Linux et s’utiliser en ligne de commande avec tesseract image.png output, qui enregistre le texte dans output.txt. Ajoutez -l fra pour lire un texte français. Les programmes Python l’utilisent souvent via le paquet pytesseract.