Jina AI는 14개 모델 중 가장 높은 페이지 처리량을 자랑하는 jina-ocr-v1을 출시했습니다.

2026년 9월 19일 토요일 오전 4:04 ET2분 읽기
NVDA--

Jina AI는 PDF, 스캔된 문서, 표, 차트 등을 마크down 형태로 직접 변환할 수 있는 문서 파싱 모델인 jina-ocr-v1를 공식적으로 출시했습니다. 이 모델은 DeepSeek-OCR에서 다시 학습된 후, Mixture of Experts(MoE) 아키텍처를 유지합니다. 이 구조는 약 3.4억 개의 매개변수를 가지고 있으며, 각 토큰당 570백만 개의 매개변수만이 활성화됩니다. 이러한 설계 방식 덕분에 모델은 작은 크기로도 작동할 수 있으면서도 큰 처리 능력을 유지할 수 있습니다.

주요 차이점은 FastMTP 스펄리티브 디코딩 기능의 통합입니다. 이 방법에서는 3개의 토큰을 미리 생성한 뒤 그 토큰들을 철저하게 검증합니다. 이러한 메커니즘 덕분에 출력 결과는 손실이 없으며, 표준 자가회귀 디코딩 방식과 동일한 수준입니다. K=3일 때는 한 단계당 평균 2.73개의 토큰이 사용되며, 이로 인해 추론 속도가 상당히 빨라집니다.

내부 벤치마크 테스트에서, jina-ocr-v1은 OmniDocBench v1.6에서 91.14점을 기록했습니다. 또한 olmOCR-Bench에서도 83.4점을 얻었으며, 이는 기본적인 DeepSeek-OCR 모델보다 7.4점 향상된 성과입니다. 이 모델은 처리 속도 측면에서 다른 14개의 시스템들을 능가했습니다. NVIDIA A100 GPU를 사용하여 32개의 요청이 동시에 발생하는 상황에서도 초당 2.57페이지를 처리할 수 있습니다. 이는 DeepSeek-OCR의 초당 2.10페이지보다 약 22% 빠른 속도입니다.

아키텍처는 추론 비용을 어떻게 줄일 수 있을까?

이 모델의 속도 우위는 출력 데이터의 간결성과 디코딩 과정의 단순화로 인해 발생합니다. 예를 들어, Surya OCR 2와 같은 경쟁 제품에 비해 페이지당 약 1,085개의 토큰만을 생성합니다. Surya OCR 2는 약 3,568개의 토큰을 생성합니다. 이 모델은 컨볼루션 컴프레서와 CLIP-L 스테이지를 포함한 딥인코더를 사용하여 시각적 토큰 수를 줄입니다. 이로 인해 동적 해상도 조절이 가능합니다.

DeepEncoder는 약 3억 8천만 개의 파라미터를 포함하는 모델입니다. 이 모델은 SAM이라는 16배 컨볼루션 컴프레서와 CLIP-L을 결합하여 시각적 입력을 256개의 토큰으로 압축합니다. 복잡한 페이지의 경우는 1,156개의 토큰으로 압축됩니다. 훈련 후에는 GRPO를 사용하여 저질화된 페이지에 대한 지시문 정렬 및 견고성 최적화 작업이 수행됩니다. 보상은 결정적이며, 코드 점수는 참조 음성 전사본과 비교되어 산출됩니다.

NVIDIA L4와 같은 저가형 하드웨어에서는 예측적 디코딩 기술을 사용하면 ‘eager mode’에서 1.95배의 속도 향상이 가능합니다. 이 모델은 대량의 문서 처리 및 파이프라인 작업에 최적화되어 있으며, 페이지당 비용이 중요한 경우에 적합합니다. 100개 이상의 언어를 지원하며, 공식이나 표와 같은 복잡한 구조도 높은 정확도로 처리할 수 있습니다.

정확성과 관련된 제약과 한계는 무엇인가요?

처리 속도는 뛰어나지만, 정확도는 그다지 높지 않습니다. OmniDocBench v1.6에서의 점수는 91.14로, PaddleOCR-VL-1.6의 96.34에 비해 낮습니다. olmOCR-Bench에서는 Chandra-ocr-2보다 낮은 점수를 기록했으며, Chandra-ocr-2의 점수는 85.8입니다. 이 모델은 손상된 역사적 스캔 데이터를 처리하는 데 어려움을 겪고 있으며, OldScans 부분 집합에서의 점수는 42.6에 불과합니다.

이 벤치마크 테스트는 제어되지 않는 하드웨어 설정 하에서 자가 수행된 것입니다. 이는 ‘1위’ 순위가 Jina의 인프라에만 적용된다는 것을 의미합니다. 이 모델은 헤더와 퍼러티 부분을 생략하며, 심하게 손상된 스캔 결과의 경우 인간의 검토가 필요할 수도 있습니다. 이 모델은 OpenAI와 호환되는 API인 Jina Reader를 통해 사용할 수 있으며, CC BY-NC 4.0 라이선스 하에 자가 호스팅된 가중치도 제공됩니다.

투자자들에게 중요한 것은 기술적 혁신이 아니라 비용 절감입니다. Elastic은 Jina를 인수하여 RAG 파이프라인에서 문서 처리에 드는 비용을 줄였습니다. 이러한 개선은 Elastic의 단위 경제성에는 긍정적인 영향을 미치지만, 경쟁 우위로서는 그렇지 않습니다. 기반 구조는 오픈소스이므로 쉽게 복제할 수 있습니다. Hugging Face에서는 관련 무게 정보를 확인할 수 있으며, 자체 호스팅을 위해서는 vLLM 0.21 이상이 필요합니다.

전통적인 거래 전략과 최신 암호화폐 지식을 결합한 방법입니다.

댓글



댓글이 없습니다

아직 댓글이 없습니다