동찰 Beating AI 속보, Jina AI가 문서 파싱 모델 jina-ocr-v1을 발표했으며, PDF, 스캔본, 표, 차트를 바로 Markdown으로 변환할 수 있다. 이 모델은 DeepSeek-OCR을 기반으로 후속 학습되었고, 약 34억 총 파라미터, 디코딩 시 토큰당 약 5.7억 파라미터가 활성화되는 MoE 아키텍처를 그대로 따르며, FastMTP 추측 디코딩을 추가했다.
Jina 자체 테스트에서 jina-ocr-v1은 OmniDocBench v1.6에서 91.14점을 기록해 DeepSeek-OCR-2보다 0.89점 높았고, olmOCR-Bench에서는 83.4점을 기록해 실제 기반이 된 DeepSeek-OCR 베이스 모델보다 7.4점 높았다.
처리량은 Jina의 주요 판매 포인트 중 하나다. 단일 A100, 동시성 32에서 초당 2.57페이지를 달성해 Jina가 테스트한 14개 시스템 중 가장 높았으며, DeepSeek-OCR의 초당 2.10페이지보다 약 22% 높았다.
모델 가중치는 이미 Hugging Face에 공개되었으며, CC BY-NC 4.0 라이선스를 적용해 상업적 사용은 Jina에 문의해야 한다.
