OCR It: Einmal Region festlegen, dann per Hotkey ganze Dokumente als Text für dein LLM

OCR It – pull text out of un-copyable documents for your LLM

OCR It: Einmal Region festlegen, dann per Hotkey ganze Dokumente als Text für dein LLM

Die Chrome-Erweiterung OCR It macht Texte aus nicht kopierbaren Dokumenten wie gescannten Büchern, PDFs oder Slide-Decks zugänglich. Man markiert einmal eine Bildschirmregion, und per Hotkey (⌥⇧S) wird der Bereich erfasst, per Tesseract lokal per OCR in Text umgewandelt und an ein laufendes Transkript angehängt. Ein Auto-Run-Modus (⌥⇧A) blättert automatisch weiter, bis das Dokument endet. Die OCR läuft komplett offline – keine API, keine Netzwerkverbindung, keine Bilder verlassen den Rechner. Der Export erfolgt als Textdatei oder in die Zwischenablage, bereit für LLMs wie Claude oder ChatGPT.

Kein API-Key, kein Netzwerk, keine Bilder, die Ihren Rechner verlassen – die Erweiterung macht keinerlei ausgehende Anfragen.
  1. thiagolima

    Ich habe Firefox-Unterstützung hinzugefügt. 0.3.0 wird für beide Browser aus derselben Quelle gebaut und ist sowohl für Google/Chrome als auch für Mozilla/Firefox eingereicht. Ich warte jetzt auf die Reviews, was normalerweise ein paar Tage dauert.

    Bis es genehmigt ist, könnt ihr die gebrauchsfertigen Releases herunterladen:

    Lade ocr-it-firefox-0.3.0.zip von https://github.com/thiagotigaz/ocr-it/releases/tag/v0.3.0 herunter.

    Wenn du lieber aus dem Quellcode bauen möchtest, findest du die Schritte in der README: https://github.com/thiagotigaz/ocr-it#install

  2. andreashaerter

    Wenn du einen Linux-Desktop verwendest (ich bin auf Fedora), ist Gradia[1][2] auf jeden Fall auch einen Blick wert.

    Es hat einen ähnlichen Workflow zum Aufnehmen von Screenshots und diese dann sofort zu annotieren oder zu bearbeiten, ohne einen separaten Bildeditor öffnen zu müssen. Und: Es bietet auch eine lokale OCR-Funktion (weshalb ich das hier kommentiere), du kannst Text aus einem Screenshot mit On-Screen-OCR mit Tesseract extrahieren, über den kleinen Button neben dem "Bild zuschneiden"-Button.

    In Kombination mit der Syntax-Hervorhebungsfunktion für Screenshots von Code-Snippets ist die OCR überraschend nützlich, wenn du z.B. schnell Code in einem Chat besprichst, wenn das Kopieren aus irgendeinem Grund blockiert ist (z.B. wenn dir jemand zuerst einen Screenshot geschickt hat).

    [1] https://gradia.alexandervanhee.be/

    [2] https://flathub.org/en/apps/be.alexandervanhee.gradia

    Bearbeitet: Falsche Link-Indexnummern korrigiert

  3. rickcarlino

    Ist Tesseract im Jahr 2026 immer noch die beste Wahl für lokale OCR? Ich war von seiner Leistung in der Praxis schon immer unterwältigt.

  4. tobinfekkes

    Es ist auch nativ im Betriebssystem (Windows) mit PowerToys verfügbar, wenn du eine Alternative zu einer Browsererweiterung möchtest. Einer der unbesungenen Helden dieser Bibliothek.

    Es ist noch nicht entschieden, welcher im Umgang mit persönlichen Daten vertrauenswürdiger ist, Microsoft oder Google. Keiner von beiden.

  5. Barbing

    "Einmal eine Region festlegen. Auf jeder Seite einen Hotkey drücken. Das ganze Buch als Text erhalten."

    Viel besser als die alte Definition von "Region Lock", schön.

    HN ist allerdings kein Fan der generierten Readmes, aber vibed Software (gründlich genutzt) kann durchaus gut sein.

Mehr von diesem Tag

2026-08-24