Jina AIが、14モデル中で最も高いページ処理能力を持つjina-ocr-v1をリリース
- Jina AIは、DeepSeek-OCRを基盤とした文書解析モデルであるjina-ocr-v1をリリースしました。このモデルは優れた性能を発揮します。2.57ページ/秒NVIDIA A100 GPU上で。
- このモデルは、FastMTPスペキュレイティブデコーディングやMixture of Expertsアーキテクチャを利用して動作します。無損失、バイト単位で同一の出力計算負荷を減らしながら。
- ジナの内部ベンチマークでは、jina-ocr-v1は14種類のシステムの中でページ処理速度において第1位になりました。精度のベンチマークで3位を記録.
- このリリースは、Elasticの戦略に合致しています。1ページあたりのコストが低くなるリテラクティッド・アップロード・ジェネレーション(RAG)パイプラインにおける文書の受け入れのため。
- このモデルはCC BY-NC 4.0ライセンスの下で利用可能です。接触が必要な商業利用ジナAIと共に。
Jina AIは、PDFやスキャンされた文書、表、チャートを直接Markdownに変換するためのドキュメント解析モデルであるjina-ocr-v1を正式にリリースしました。このモデルはDeepSeek-OCR上で後処理されており、Mixture of Experts(MoE)アーキテクチャを維持しています。この構造では、総パラメータ数は約34億であり、各トークンに対しては5億7千万個のパラメータが使用されています。この設計により、小さなモデルの運用コストで高い機能を持つモデルとして動作できるのです。
重要な特徴は、FastMTPのSpeculative Decoding機能が統合されている点です。この方法では、3トークン先に予測を行い、それを検証します。このメカニズムにより、出力は損失なく、標準的な自動再帰的デコーディングと同じバイトレベルで得られます。K=3の場合、1ステップあたり2.73トークンが使用されるため、推論速度が大幅に向上します。
内部ベンチマークでは、jina-ocr-v1はOmniDocBench v1.6で91.14点を獲得しました。また、olmOCR-Benchでも83.4点を記録し、基準となるDeepSeek-OCRモデルよりも7.4点向上しました。このモデルは、スループットテストにおいて他の14種類のシステムを上回りました。32件の同時リクエストがあった場合、1秒あたり2.57ページを処理できます。これはDeepSeek-OCRの1秒あたり2.10ページよりも約22%速いです。
アーキテクチャは、推論コストをどのように低減するのか?
このモデルの速度の優位性は、出力情報の簡潔さや、デコーディングのステップが少ないことにあります。Surya OCR 2といった他のモデルと比べて、1ページあたり約1,085トークンしか生成されません。一方、Surya OCR 2では約3,568トークンが生成されます。このアーキテクチャでは、畳み込みコンパクターやCLIP-Lステージを含むDeepEncoderが使用されており、視覚的なトークンの数を減らすことができます。これにより、動的な解像度処理が可能になります。

DeepEncoderは、約3억8千万個のパラメータを持っています。このモデルは、16倍畳み込み処理を行うSAMやCLIP-Lを組み合わせて構成されています。視覚的な入力データを、1ページあたり256個のトークンに圧縮します。複雑なページの場合は、1ページあたり1,156個のトークンになります。訓練後の処理では、GRPOを利用して劣化したページに対して指示の整合性や堅牢性を高めるための微調整が行われます。報酬は決定論的であり、参照テキストとの比較によってコードスコアが計算されます。
NVIDIA L4のような安価なハードウェアでは、スペキュレイティブデコーディングを使用すると、エージャーモードで1.95倍の速度向上が得られます。このモデルは、ページあたりのコストが重要な場合に最適です。100種類以上の言語をサポートし、式や表などの複雑な構造も高精度で処理できます。
精度と制限については、どのようなものがあるのでしょうか?
スループットは優れていますが、精度はそれほど高くなく、むしろ同等です。OmniDocBench v1.6でのスコアは91.14であり、PaddleOCR-VL-1.6の96.34を下回ります。olmOCR-Benchでは、85.8というスコアを持つchandra-ocr-2に敗れました。このモデルは劣化した歴史的スキャン画像に対してうまく対応できず、OldScansサブセットでのスコアは42.6にとどまります。
これらのベンチマークは、制御されていないハードウェア設定のもとで自動的に実行されました。つまり、「首位」のスピードランキングはJinaのインフラに特有のものです。このモデルはヘッダーやフッターを除去するため、重度に劣化したスキャン結果については人間のレビューが必要かもしれません。このモデルはOpenAIと互換性のあるAPIであるJina Readerを通じて利用でき、コミュニティライセンスCC BY-NC 4.0の下で自己ホスト可能な重みも提供されています。
投資家にとって重要なのは、技術的な変化ではなく、コストの削減です。ElasticはJinaを買収し、RAGパイプラインにおける文書処理のコストを低減しました。この改善は、Elasticの単位経済性を向上させるものであり、競争上の優位性とは言えません。基盤となるアーキテクチャはオープンソースであり、簡単に再現可能です。WeightはHugging Faceで利用可能で、自己ホスティングを行うにはvLLM 0.21以上が必要です。
伝統的な取引の知恵と、最先端の暗号通貨に関する知識を融合させる。



コメント
まだコメントはありません