Mistral AI、OCR 4.1で段落レベルのバウンディングボックス抽出を実現
Mistral OCR 4.1
Mistral AIが文書AIスタックを強化する最新OCRサービス「OCR 4.1」を公開プレビューとしてリリース。段落レベルのバウンディングボックス抽出、構造ブロックラベル、ブロックレベルの信頼度スコアをネイティブにサポートする。価格は1000ページあたり3.5ユーロ(約4.38ドル)。
当社のDocument AIスタックを支える最新のOCRサービスで、段落レベルのバウンディングボックス抽出、構造ブロックラベル、ブロックレベルの信頼度スコアをネイティブに備えています。
HNでの議論
166- ComputerPerson
私は本のスキャンを持っていて、新しいリリースでOCRをかけています。合字、校訂記号、フラクトゥール書体、下付き文字、上付き文字などがあります。私のような過度に詳細な作業には、このモデルは特に特別なものではありません。最後にテストしてからしばらく経ちます(そしてサブスクリプションを解約しました)が、OpenAIの「プロ」モデルが圧倒的です。価格差を考えれば驚くことではありませんが、OCR専用モデルがもっとうまく機能してくれるといいのにと思います。言及する価値があるのは、最高級のモデルでさえ、私のような複雑なテキストではかなり不十分な仕事しかできないということです。
- king_crimson
この時点で、ヨーロッパがAI競争で重要な役割を果たすという希望はすべて失いました。それが良いことなのか悪いことなのかはわかりませんが、それが現実だと思います。
- piterrro
興味がある方のために、私はレンタルGPUでOCRパイプラインを実行しており、約1000ページを0.05〜0.1米ドルで処理し、1ページあたり約0.8秒、グラウンディング用の完全なバウンディングボックス対応です。興味があれば、このプロフィールから私に連絡先を見つけることができます。1000ページあたり3.5米ドルは高すぎます…
- waldrews
VLMは複雑な文書理解に非常に優れています。しかし、最も寛容な設定でも、臨床文書や法律文書を目に見えない形で検閲しないとは信頼できません。また、深層学習ベースのOCR専用モデルは検閲しませんが、幻覚を起こす可能性があり、実際に起こします。異なるアプローチでスキャンし、それらが一致しない場合は確信がないと言うシステムが、一般的な複雑な文書に対してうまく機能するのを見たことがありません。
- merb
1000ページ/3.5ユーロは非常に高価です。これがtesseractのようなものよりはるかに優れていないなら、価値はありません。
- ks2048
入力/出力ペアの例、特にレイアウト分析(図や表などのバウンディングボックス)を閲覧できるサイトをご存知の方はいますか?
- fumeux_fume
MistralのOCRの有用性を人々は誤解していると思います。エッジケースの文書の抽出では最先端のモデルには勝てませんが、はるかに安くて速く、単純な文書では優れた仕事をします。私はPDFをEPUBに変換する作業をしてきましたが、Mistralは着実に改善しています。『荒涼館』の一章では、ヘッダー、タイトル、下部の参考文献を毎回抽出してタグ付けできました。苦労したのは右余白の行番号だけで、3/5の確率で「脇テキスト」と正しくタグ付けしましたが、毎回本文からは分離されていました。重要なのは、プロンプトが不要で、PDFをアップロードするだけで完了することです。50%割引のバッチモードもあります。
- ianhawes
精度についてはコメントしませんが、内部ベンチマークでは、Mistral OCRは同等のAPIよりも大幅に高速です。