Catch pre-market movers with AI signals.
Jina AI lanza jina-ocr-v1 con el mayor rendimiento de páginas entre los 14 modelos.
- Jina AI lanzó jina-ocr-v1, un modelo de análisis de documentos construido sobre DeepSeek-OCR que logra2.57 páginas por segundoEn una GPU NVIDIA A100.
- El modelo utiliza el decodificación especulativa FastMTP y la arquitectura Mixture of Experts para ofrecer…Salida sin pérdidas, idéntica en todos los bytes.Mientras se reduce la carga computacional.
- En los estándares internos de Jina, jina-ocr-v1 ocupó el primer lugar en cuanto a rendimiento de páginas entre los 14 sistemas probados.Ocupa el tercer lugar en los criterios de precisión..
- La publicación se alinea con la estrategia de Elastic para…Costos más bajos por páginaPara la ingestión de documentos en las tuberías de generación mejorada con recuperación (RAG).
- El modelo está disponible bajo la licencia CC BY-NC 4.0.Uso comercial que requiere contacto.Con Jina AI.
Jina AI ha lanzado oficialmente jina-ocr-v1, un modelo de análisis de documentos diseñado para convertir PDFs, documentos escaneados, tablas y gráficos directamente en formato Markdown. El modelo se entrenó posteriormente con DeepSeek-OCR y conserva su arquitectura Mixture of Experts (MoE). Esta estructura consta de aproximadamente 3.4 mil millones de parámetros en total, de los cuales solo 570 millones son activos por token. Este diseño permite que el modelo funcione con un coste de operación similar al de un modelo pequeño, pero al mismo tiempo conserva una gran capacidad de procesamiento.
Una característica importante es la integración de la decodificación especulativa FastMTP. Este método genera tres “tokens” de antemano y los verifica de manera eficiente. El mecanismo asegura que el resultado sea sin pérdidas y idéntico en todos sus bytes al proceso de decodificación autoregresiva estándar. En condiciones K=3, se promedia 2.73 “tokens” comprometidos por paso, lo que acelera significativamente el proceso de inferencia.
En los benchmarks internos, jina-ocr-v1 obtuvo un puntaje de 91.14 en OmniDocBench v1.6. También obtuvo un puntaje de 83.4 en olmOCR-Bench, lo que representa una mejora de 7.4 puntos respecto al modelo DeepSeek-OCR básico. El modelo superó a 14 otros sistemas probados en las pruebas de rendimiento. Con una sola GPU NVIDIA A100 y 32 solicitudes simultáneas, el modelo puede procesar 2.57 páginas por segundo. Esto es aproximadamente un 22% más rápido que DeepSeek-OCR, que procesa 2.10 páginas por segundo.
¿Cómo la arquitectura reduce los costos de inferencia?
La ventaja en velocidad del modelo se debe a la concisión en la salida de datos y a la reducción en el número de pasos de decodificación. Emite aproximadamente 1,085 tokens por página, en comparación con competidores como Surya OCR 2, que emitan alrededor de 3,568 tokens por página. La arquitectura utiliza un DeepEncoder, junto con un compresor convolucional y la etapa CLIP-L, para reducir el número de tokens visuales. Esto permite gestionar la resolución dinámicamente.

El DeepEncoder, que contiene aproximadamente 380 millones de parámetros, utiliza la tecnología SAM, un compresor convolucional de 16x, y CLIP-L para comprimir la entrada visual en 256 tokens por página. En las páginas complejas, la resolución dinámica permite obtener hasta 1,156 tokens. Después de la capacitación, se realizan ajustes para mejorar la robustez de los resultados en las páginas deterioradas, utilizando GRPO. Los recompensas son deterministas, y el código se evalúa en comparación con transcripciones de referencia.
En hardware más económico, como el NVIDIA L4, la decodificación especulativa permite un aceleración del 1.95 veces en modo “eager”. Este modelo es ideal para la procesamiento de documentos grandes y en las pipelines donde el costo por página es crucial. También soporta 100 idiomas y puede manejar estructuras complejas, como fórmulas y tablas, con alta precisión.
¿Cuáles son las compensaciones y limitaciones de precisión?
Aunque el rendimiento en términos de capacidad de procesamiento es bueno, la precisión del modelo no es tan alta como para ser considerada superior. Obtiene un puntaje de 91.14 en OmniDocBench v1.6, por debajo de PaddleOCR-VL-1.6, que obtiene un puntaje de 96.34. En olmOCR-Bench, el modelo queda atrás frente a chandra-ocr-2, que obtiene un puntaje de 85.8. El modelo tiene dificultades con las imágenes históricas deterioradas; en el subconjunto OldScans, su puntaje es solo de 42.6.
Los criterios de evaluación se realizaron de forma autónoma, con configuraciones de hardware no controladas. Esto indica que la clasificación en cuanto a velocidad “primero” es algo específico de la infraestructura de Jina. El modelo elimina los encabezados y pies de página; además, podría requerir revisión humana para escaneos muy degradados. Está disponible a través de Jina Reader, una API compatible con OpenAI, y los pesos del modelo están alojados en un entorno autohospedado, bajo licencia CC BY-NC 4.0.
Para los inversores, el valor clave no es la disrupción técnica, sino la reducción de costos. Elastic adquirió Jina con el objetivo de disminuir el costo por página de ingesta de documentos en sus pipelines RAG. Esta mejoría es incremental en relación con las economías de escala de Elastic, y no constituye un factor de ventaja competitiva. La arquitectura subyacente es de código abierto y fácilmente reproducible. Las pesas están disponibles en Hugging Face; se requiere vLLM 0.21 o superior para poder implementarla de forma autohostada.
Mezclando la sabiduría tradicional del comercio con las perspectivas innovadoras en materia de criptomonedas.



Comentarios
Aún no hay comentarios