爆速・高精度で話題の「Mistral OCR 4.1」がついに登場!
Mistral OCR 4.1
Mistral OCR 4.1
待望の「Mistral OCR 4.1」がリリースされました。文書解析タスクの新たなスタンダードになる予感です。
正直、欧州がAI競争で重要な役割を果たすなんてことはもう諦めてる。それが良いことなのか悪いことなのかは分からないけど、これが現実ってことなんじゃないかな。
1000ページで3.5ユーロか、めちゃくちゃ高いな。Tesseractみたいなツールより圧倒的に優れてないと、金を払う価値はないよ。
新しいリリースが出るたびに、書籍のOCRスキャンを試してるんだ。合字、異体字、フラクトゥール書体、下付き文字、上付き文字とかね。私のやってるような込み入った作業に対して、このモデルには特筆すべき点はないかな。最後にテストしてからしばらく経つけど(サブスクも解約したし)、結局OpenAIの「Pro」モデルが最強だね。価格差を考えれば当然だけど、OCR特化モデルにはもっと頑張ってほしいところ。ちなみに、今の最高性能のモデルでも、私の扱ってるような複雑なテキストはかなり苦手だよ。
精度のことは言わないけど、内部のベンチマークだとMistral OCRは同等のAPIと比べて圧倒的に速いよ。
Baidu Unlimited OCRと比べてどうなんだろう?Baiduにはかなり感心してるんだ。電気代以外はまともなPCがあれば実質タダで動かせるしね。
興味がある人へ。私はレンタルGPUでOCRパイプラインを動かしていて、1000ページあたり0.05〜0.1ドルで処理できてる。1ページ約0.8秒で、グラウンディング用のバウンディングボックスも完璧。もし興味があればこのプロフィールの連絡先からコンタクトして。1000ページで3.5ドルは高すぎるよ…
最新のvibeリリースにある新しい「follow default」モデルオプションを考えると、新しいコーディング用あるいは汎用のMistralモデルである「mistral 4」がすぐに出そうだね。
入力と出力のペア例を見られるサイトってどこか知らない?特にレイアウト解析(図や表のバウンディングボックスとか)ができるやつ。
このモデル、フランス語や他の欧州言語の文書で他のモデルより良い結果が出るのか気になってる。
VLM(視覚言語モデル)は複雑な文書理解においてかなり優秀になったよね。でも、最高に許可設定を緩めても、医療や法律関係の機密文書を勝手に検閲しないなんて信用できない。かといって、ディープラーニング系のOCR専用モデルなら検閲はしないけど、ハルシネーション(嘘の出力)は起きるしね。「複数のアプローチでスキャンして、結果が一致しなかったら分からないと正直に言う」っていう仕組みが、一般的な複雑文書ですんなり動くようなシステムにはまだ出会えてないな。