OCR It: Chrome拡張機能で、コピー不可の文書をLLMに渡せるテキストに変換
OCR It – pull text out of un-copyable documents for your LLM

OCR Itは、スキャンされた本やPDF、テキスト選択不可のビューアなど、ページ単位で表示される文書からテキストを抽出するChrome拡張機能です。領域を一度指定すれば、ホットキーでその領域をキャプチャしてOCRし、テキストを蓄積。自動実行モードではページ送りまで行い、文書全体をテキスト化します。OCRはTesseractをバンドルしており、完全オフラインで動作。APIキーやネットワーク不要で、画像が外部に送信されることはありません。抽出したテキストはコピーやダウンロードが可能で、LLMに渡して要約や検索に活用できます。
OCRはローカルのバンドルされたTesseractで実行されます。APIキーもネットワークも不要で、画像がマシンの外に出ることはありません。
HNでの議論
36- thiagolima
Firefox対応を追加しました。0.3.0は同じソースから両ブラウザ向けにビルドされ、Google ChromeとMozilla Firefoxの両方に提出済みです。現在レビュー待ちで、通常は数日かかります。承認されるまでの間、すぐに使えるリリースをダウンロードできます:
https://github.com/thiagotigaz/ocr-it/releases/tag/v0.3.0 から ocr-it-firefox-0.3.0.zip をダウンロードしてください。
ソースからビルドしたい場合は、READMEに手順があります:https://github.com/thiagotigaz/ocr-it#install
- andreashaerter
Linuxデスクトップ(私はFedoraを使っています)をお使いなら、Gradia[1][2]もぜひ試してみてください。
スクリーンショットを撮って、すぐに注釈や編集ができる同様のワークフローを提供しており、別の画像エディタを開く必要がありません。さらに、ローカルOCR機能も備えています(だからここでコメントしています)。「画像を切り抜き」ボタンの横にある小さなボタンで、Tesseractを使った画面上のOCRでスクリーンショットからテキストを抽出できます。
コードスニペットのスクリーンショットにシンタックスハイライトを適用する機能と組み合わせると、例えばチャットでコードについて簡単に議論する際、コピーが何らかの理由でブロックされている場合(例えば、そもそも誰かがスクリーンショットを送ってきた場合など)に、OCRが驚くほど役立ちます。
[1] https://gradia.alexandervanhee.be/
[2] https://flathub.org/en/apps/be.alexandervanhee.gradia
編集:リンクの番号の誤りを修正しました。
- rickcarlino
2026年現在、ローカルOCRの最良の選択肢はまだTesseractなのでしょうか?私は実世界での性能にいつも不満を感じていました。
- tobinfekkes
ブラウザ拡張機能の代替として、OS(Windows)にネイティブに組み込まれているPowerToysでも利用できます。あのライブラリの中でも影の功労者です。
個人データの取り扱いに関して、MicrosoftとGoogleのどちらがより信頼できるかはまだ結論が出ていません。どちらも信頼できません。
- Barbing
「一度領域を固定。すべてのページでホットキーを押す。本全体をテキストとして取得。」
これは「リージョンロック」の古い定義よりはるかに優れていますね。
ただし、HNは生成されたREADMEにはあまり好意的ではありませんが、よく使われるバイブスソフトウェアはすべて良い場合もあります。