- Startseite
- Bild
- Bild zu Text (Ausgewogen)
Bild zu Text (OCR)
Text aus einem Bild mit mittelgroßem OCR-Modell auslesen – Balance aus Tempo und Genauigkeit.
Bilder mit Text hierher ziehen oder zum Auswählen klicken
Fotos, Scans und Screenshots: JPG, PNG, WebP, GIF, BMP, TIFF oder AVIF. Liest Englisch und andere Sprachen mit lateinischem Alphabet, Chinesisch und Japanisch. Koreanisch kann es nicht lesen. Dateien werden im Browser verarbeitet und nie hochgeladen. Die Bilder bleiben in diesem Browser, bis Sie sie entfernen.
Ctrl+OauswählenCtrl+Veinfügen
Texterkennungsmodell
Modell Ausgewogen · …
Liest Englisch und andere Sprachen mit lateinischem Alphabet (Französisch, Deutsch, Spanisch, Polnisch …), Chinesisch (vereinfacht und traditionell) und Japanisch. Koreanisch, Russisch und andere kyrillische Schriften, Arabisch, Thai, Hindi und Vietnamesisch kann es nicht lesen.
Lizenzen: Modelle (Apache-2.0) · Engine (MIT)
Kopieren Sie den Text aus dem Foto eines Dokuments, einer gescannten Seite oder einem Screenshot heraus, bearbeiten und speichern Sie ihn. Dies ist die Wahl für den Alltag unter den drei Bild-zu-Text-Tools: Sein 30 MB großes Erkennungsmodell liest kleine Schrift, schräg fotografierte Seiten und unruhige Hintergründe spürbar besser als das schnellste und liest einen Screenshot trotzdem in Sekunden. Alles läuft in Ihrem Browser: Ihre Bilder verlassen nie Ihr Gerät, und es ist kostenlos und ohne Anmeldung.
Die drei Modelle für Bild zu Text im Vergleich
| Bild zu Text (Schnell) | Bild zu Text (Ausgewogen)Diese Seite | Bild zu Text (Präzise) | |
|---|---|---|---|
| Modell-Download | 6 MB | 29,7 MB | 132,3 MB |
| Erste Nutzung: Download mit der Engine bei 50 Mbit/s | 19,6 MB · ≈ 3 Sek. | 43,4 MB · ≈ 7 Sek. | 145,9 MB · ≈ 24 Sek. |
| Danach | Im Browser gespeichert – kein zweiter Download | ||
| Geschwindigkeit | Am schnellsten | Schnell | Am langsamsten |
| Genauigkeit | Gut bei klarem Text | Besser bei Fotos und kleiner Schrift | Am besten bei schwierigen Bildern |
| Liest | lateinisches Alphabet (Englisch, Deutsch, Französisch …) und Chinesisch | lateinisches Alphabet (Englisch, Deutsch, Französisch …), Chinesisch und Japanisch | lateinisches Alphabet (Englisch, Deutsch, Französisch …), Chinesisch und Japanisch |
Die Erkennungs-Engine (13,7 MB, in Browsern mit WebGPU 27,4 MB) wird nur einmal heruntergeladen und von allen drei Modellen genutzt. Heruntergeladen wird erst, wenn Sie das Tool ein Bild lesen lassen.
So extrahieren Sie Text aus einem Bild
- Legen Sie Bilder irgendwo auf der Seite ab, fügen Sie eines mit Strg+V ein oder klicken Sie, um Dateien auszuwählen – auch mehrere auf einmal. Bilder, die Sie schon in einem Bild-Tool hinzugefügt haben, auch auf den Seiten Schnell und Präzise, warten in der Liste.
- Klicken Sie beim ersten Mal auf Modell laden & Text lesen. Das Modell (30 MB) und die Engine, die es ausführt – zusammen etwa 43 MB –, werden einmal heruntergeladen und in Ihrem Browser behalten; später wird ein Bild, das Sie hinzufügen, sofort gelesen, das ausgewählte, sobald Sie die Seite öffnen, und die übrigen in der Liste mit Lesen oder Alle lesen.
- Vergleichen Sie den Text mit dem Bild: Klicken Sie auf einen Bereich, um seine Zeile zu finden, oder auf eine Zeile, um ihren Bereich zu finden. Unterstrichene Zeilen sind die, bei denen sich das Modell unsicher ist. Bearbeiten Sie den Text und wählen Sie dann Text kopieren (Strg+Umschalt+C) oder .txt herunterladen.
- Um das Bild ohne seinen Text zu teilen, öffnen Sie Text im Bild verdecken, wählen eine Farbe, lassen jeden Bereich sichtbar, den Sie behalten möchten, und laden die abgedeckte Kopie herunter.
Funktionen
- Liest gedrucktes Englisch und andere Sprachen mit lateinischem Alphabet, Chinesisch (vereinfacht und traditionell) und Japanisch
- Text in Lesereihenfolge: Spalten nacheinander, die Posten eines Kassenbons neben ihren Preisen
- Textbereiche im Bild umrandet und nummeriert; ein Klick auf einen Bereich zeigt seine Zeile
- Text bearbeiten, dann kopieren oder als .txt herunterladen; Zeilen, bei denen sich das Modell unsicher ist, sind unterstrichen
- Text verdecken: eine Kopie des Bildes herunterladen, in der der Text mit Kästen abgedeckt ist
- Mehrere Bilder auf einmal; auf dem Kopf stehende Seiten werden erkannt und richtig herum gelesen
- Ein Download von etwa 43 MB (das 30-MB-Modell und seine Engine), danach in Ihrem Browser gespeichert
Ist das privat?
Ja. Das Bild wird von einem Modell gelesen, das in Ihrem Browser läuft; weder das Bild noch der Text werden irgendwohin gesendet, und Ihre Bilder bleiben in diesem Browser, bis Sie sie aus der Liste entfernen. Nur das Modell und seine Engine werden heruntergeladen, einmalig, von dieser Website, und bleiben in Ihrem Browser gespeichert.
Häufige Fragen
Welche Sprachen liest es?
Gedrucktes Englisch und andere Sprachen mit lateinischem Alphabet (Französisch, Deutsch, Spanisch, Portugiesisch, Italienisch, Polnisch, Tschechisch, Türkisch …), Ziffern und Symbole, Chinesisch (vereinfacht und traditionell) und Japanisch (Kanji, Hiragana und Katakana). Koreanisch, Russisch und andere kyrillische Schriften, Arabisch, Thai, Hindi und Vietnamesisch kann es nicht lesen.
Warum dauert der erste Durchlauf länger?
Weil der Browser nur beim ersten Mal das Modell und die Engine, die es ausführt (14 MB, oder 27 MB in Browsern, die die Grafikkarte über WebGPU nutzen), herunterlädt und vorbereitet. Danach sind beide gespeichert, sodass das Lesen ohne Download beginnt, und eine bereits geöffnete Seite funktioniert auch ohne Verbindung weiter. Haben Sie schon ein anderes Bild-zu-Text-Tool genutzt, ist die Engine bereits da, und nur das Modell wird heruntergeladen.
Schnell, Ausgewogen oder Präzise – welches passt für mich?
Ausgewogen passt für die meisten Bilder. Schnell (ein 6-MB-Modell, beim ersten Mal etwa 20 MB Download) reicht für klare Screenshots und Dokumente auf Englisch oder Chinesisch. Ausgewogen (30 MB, etwa 43 MB) ist bei Fotos und kleiner Schrift genauer und liest auch Japanisch. Präzise (132 MB, etwa 146 MB) liest die schwierigsten Bilder am besten, braucht ohne Grafikbeschleunigung (WebGPU) aber etwa eine halbe Minute für eine kurze Seite. Jedes wird einmal heruntergeladen und dann in Ihrem Browser gespeichert.
Bleibt das Layout der Seite erhalten?
Die Lesereihenfolge bleibt erhalten, nicht das genaue Layout: Textstücke in derselben Reihe werden verbunden, jede Reihe wird eine Zeile, und eine Leerzeile trennt Absätze. Nebeneinanderliegende Spalten werden nacheinander gelesen, und Tabellen kommen als Text in Lesereihenfolge heraus, nicht als Tabellenkalkulation.
Kann ich mehrere Bilder auf einmal lesen?
Ja. Fügen Sie so viele hinzu, wie Sie möchten; jedes wird der Reihe nach gelesen. Alle Bilder kopieren kopiert jeden Text unter seinem Dateinamen, und Alle herunterladen (ZIP) speichert die abgedeckten Kopien.