Bild rein, Text raus.
Foto machen oder Datei ablegen. Nach ein paar Sekunden steht der Text da — zum Kopieren, als PDF oder Word.
Auch bei Handschrift, schief fotografierten Seiten und schlechtem Licht. Deutsche Umlaute inklusive.
Was hineingeht
Fotos vom Handy, Screenshots, Scans. JPEG, PNG, WebP, HEIC. Am Rechner auch per Ziehen oder Einfügen aus der Zwischenablage.
Was herauskommt
Text zum Kopieren — oder als PDF, Word, Textdatei oder Markdown. Überschriften, Listen und Tabellen bleiben erhalten.
Was gespeichert wird
Vom Bild nichts, vom Text nichts. Beides liegt nur im Arbeitsspeicher, solange die Verarbeitung läuft. Gezählt wird, wie viele Bilder verarbeitet wurden — nicht was darauf stand.
Warum das Ergebnis besser ist als bei reiner Texterkennung
ocrer liest jedes Bild zweimal. Der erste Durchgang läuft lokal und findet die Textzeilen. Der zweite schaut sich das Bild noch einmal an und korrigiert, was der erste falsch gelesen hat — mit dessen Rohtext als Anker.
Dieser Anker ist der Grund für die Genauigkeit: ein Sprachmodell, das frei aus einem Bild abtippt, erfindet bei schlechter Vorlage plausibel klingenden Text. Mit dem Rohtext daneben wird aus dem Erfinden ein Abgleichen.
Bei Tabellen und mehrspaltigen Vorlagen weisen wir im Ergebnis darauf hin, dass die Zuordnung nicht immer stimmt. Lieber ein Hinweis als eine Zahl, der man blind vertraut.