Was Bild in Text umwandeln bedeutet
Wenn du ein Bild in Text umwandelst, nennt man das Texterkennung oder OCR, kurz für Optical Character Recognition. Ein Computer schaut sich die Formen in einem Bild an, erkennt, welche davon Buchstaben sind, und macht daraus Text, den du markieren, bearbeiten, durchsuchen und kopieren kannst.
Das ist immer dann nützlich, wenn Text in einem Bild gefangen ist: ein Screenshot einer Fehlermeldung, ein Foto eines Schildes, ein eingescannter Brief, eine Folie aus einer Präsentation, ein Zitat in einem Bild, das du geschickt bekommen hast. Statt abzutippen, lässt du den Computer lesen.
So nutzt du den Konverter
- Wähl die Sprache im Bild. Auf dieser Seite ist Deutsch voreingestellt. Insgesamt stehen 12 Sprachen zur Wahl: Englisch, Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Japanisch, Koreanisch, Chinesisch (vereinfacht), Chinesisch (traditionell), Niederländisch und Hindi.
- Gib dem Tool ein Bild, auf eine von drei Arten:
- Leg eine Bilddatei auf dem Feld Bild hier ablegen oder Datei auswählen ab.
- Klicke auf Bild auswählen und wähl eine oder mehrere Dateien.
- Kopier einen Screenshot und drück irgendwo auf der Seite Strg+V (Cmd+V auf dem Mac) oder klicke auf Bild einfügen.
- Beobachte den Fortschrittsbalken. Der erste Durchgang dauert länger, weil die Lese-Engine und die Sprachdaten heruntergeladen werden müssen. Danach braucht jedes Bild ein paar Sekunden.
- Lies das Ergebnis unter Erkannter Text. Du kannst es direkt dort bearbeiten.
- Klicke auf Kopieren oder auf Herunterladen, um es als bild-text.txt zu speichern.
Wählst du mehrere Bilder auf einmal, werden sie der Reihe nach gelesen, und der Text jedes Bildes wird mit einer Leerzeile unter den vorherigen gesetzt. Die Zahlen unter dem Text zeigen Wörter und Zeichen sowie die durchschnittliche Zuverlässigkeit für den Durchgang.
Was gut funktioniert und was nicht
| Bild | Was du erwarten kannst |
|---|---|
| Screenshot einer Webseite, App oder eines Dokuments | Sehr gut. Sauberer, scharfer Text mit starkem Kontrast ist am leichtesten zu lesen. |
| Foto einer gedruckten Seite, gerade aufgenommen bei gutem Licht | Gut. Prüf Zahlen und Satzzeichen. |
| Eingescannter Brief oder Formular | Gut bei getipptem Text. Kästchen und Linien auf Formularen können verirrte Zeichen erzeugen. |
| Schräg, im Schatten oder unscharf aufgenommenes Foto | Gemischt. Schneide das Foto zu und mach es neu, wenn möglich. |
| Text über einem unruhigen Foto oder Muster | Schlecht. Der Hintergrund verwirrt die Engine. |
| Handschrift | Schlecht, außer bei sehr ordentlichen Druckbuchstaben. |
| Sehr kleiner Text, etwa eine ganze Seite in einem kleinen Screenshot | Schlecht. Zoom heran und mach einen näheren Screenshot. |
| Alte Drucke in Frakturschrift | Schlecht. Die deutschen Sprachdaten sind auf moderne Schriften trainiert. |
So funktioniert es
Die Seite nutzt Tesseract, eine bekannte Open-Source-Engine für Texterkennung, die ursprünglich bei Hewlett-Packard entwickelt und später veröffentlicht wurde. Hier läuft sie über Tesseract.js, eine Version der Engine für Webbrowser.
Beim ersten Durchgang lädt dein Browser drei Dinge von cdn.jsdelivr.net herunter: ein kleines Hilfsskript, die Engine selbst und eine Datei mit den Daten für die gewählte Sprache. Das sind nur Programm- und Sprachdateien. Dein Browser speichert sie im Cache, spätere Durchgänge starten also deutlich schneller. Wählst du eine andere Sprache, wird deren Datei heruntergeladen.
Die Engine findet dann Textzeilen in deinem Bild, teilt sie in Wörter und Buchstaben und vergleicht die Formen mit dem, was sie aus ihren Trainingsdaten gelernt hat. All das passiert auf deinem Computer oder Handy. Das Bild wird aus dem Speicher deines Geräts gelesen und nie hochgeladen. Das macht das Tool sicher für Screenshots mit privaten Informationen.
Tipps für bessere Ergebnisse
- Schneide auf den Text zu. Entferne Ränder, Fotos und Icons um den Text, bevor du das Bild ablegst.
- Größer ist besser. Große, scharfe Buchstaben lassen sich viel besser lesen als winzige. Zoom vor dem Screenshot in die Seite hinein.
- Wähl die richtige Sprache. Umlaute, ß und Buchstaben mit Akzent wie é und ñ werden viel genauer erkannt, wenn die passende Sprache ausgewählt ist. Für einen englischen Screenshot stellst du auf Englisch um, für japanische, koreanische oder chinesische Schrift auf die jeweilige Sprache, sonst kommen nur verirrte Zeichen heraus. Wechselst du die Sprache, wähl oder füge das Bild danach erneut ein.
- Fotografiere gerade. Halte die Kamera direkt über die Seite, füll das Bild mit dem Text und vermeide Schatten.
- Räum danach auf. Text aus einem Foto hat oft Zeilenumbrüche mitten im Satz. Füge ihn in Zeilenumbrüche entfernen ein, um die Zeilen zu verbinden, und korrigiere seltsame Anführungszeichen und Leerzeichen mit In normalen Text umwandeln.
- Lies Korrektur. OCR-Fehler sehen aus wie echte Wörter, etwa „rn“ als „m“ gelesen oder „0“ als „O“. Lies Zahlen, Namen, IBANs und E-Mail-Adressen zweimal.
Handyfotos im HEIC-Format können die meisten Browser nicht lesen. Speichere oder teile das Foto vorher als JPG.
Andere Wege, Text aus einem Bild zu holen
Google Docs. Lade das Bild in Google Drive hoch, klicke mit der rechten Maustaste darauf und öffne es mit Google Docs. Der Text erscheint unter dem Bild in einem neuen Dokument. Dabei wird das Bild zu Google hochgeladen.
Microsoft OneNote und Word. In OneNote für Windows fügst du das Bild ein, klickst mit der rechten Maustaste darauf und wählst die Option zum Kopieren des Textes aus dem Bild. Word kann eine PDF öffnen und in ein bearbeitbares Dokument umwandeln, was bei sauberen Scans am besten funktioniert.
Dein Handy. Aktuelle Versionen von iOS und Android lassen dich Text direkt in Fotos und Screenshots markieren. Halte in der Fotos- oder Galerie-App den Finger auf den Text.
Code. Tesseract lässt sich unter Windows, macOS und Linux installieren und mit tesseract image.png output auf der Kommandozeile ausführen, was den Text in output.txt speichert. Für deutschen Text hängst du -l deu an. Python-Programme nutzen Tesseract oft über das Paket pytesseract.