Cohere, PDF·슬라이드 구조화 모델 Parse 5 공개…벤치마크는 뒤졌지만 페이지당 $1.50로 enterprise AI 공략

편집자 요약
Cohere가 PDF, PowerPoint, JPEG 페이지를 구조화된 Markdown으로 변환하는 2.3B parameter vision language model Parse 5를 공개했습니다. 자체 ParseBench에서 GPT-5.5, Opus 4.8, Gemini 3.5 Flash보다 정확도는 낮지만, API 기준 1,000페이지당 $1.50라는 페이지당 비용을 앞세워 대규모 enterprise deployment를 겨냥합니다. 단일 VLM 패스로 OCR과 후처리 모델 단계를 줄이고, Model Vault를 통한 single-tenant managed inference도 제공합니다.
인사이트
Parse 5의 메시지는 frontier model의 절대 정확도 경쟁보다 특정 업무에 맞춘 소형 모델이 TCO로 enterprise 채택을 이끌 수 있다는 점입니다. 문서의 table, chart, layout 보존은 RAG와 agent workflow의 품질을 좌우하는 병목이어서, 충분한 정확도와 낮은 단가를 결합한 parsing layer가 AI stack의 핵심 구성요소로 부상하고 있습니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?


