Mistral OCR 4 공개
Mistral AI가 단순 텍스트 추출을 넘어 바운딩 박스와 신뢰도 점수까지 제공하는 문서 이해 모델 'Mistral OCR 4'를 공개했어요. 170개 언어 지원과 자체 호스팅 옵션으로 데이터 주권이 중요한 기업에
Mistral AI가 단순 텍스트 추출을 넘어 바운딩 박스와 신뢰도 점수까지 제공하는 문서 이해 모델 'Mistral OCR 4'를 공개했어요. 170개 언어 지원과 자체 호스팅 옵션으로 데이터 주권이 중요한 기업에 강력한 솔루션이 될 것으로 기대됩니다.
Mistral OCR 4, 단순한 글자 읽기를 넘어선 문서 이해의 시작
Mistral AI가 새롭게 공개한 Mistral OCR 4는 문서에서 단순히 텍스트만 뽑아내던 기존 OCR의 한계를 완전히 뛰어넘는 문서 이해(Document Understanding) 모델이에요. 이미지나 PDF 문서에서 텍스트를 추출할 뿐만 아니라, 각 요소의 바운딩 박스(Bounding Box), 블록 분류 정보, 그리고 단어/페이지 단위의 인라인 신뢰도 점수까지 함께 반환해 줍니다.
특히 10개 언어 그룹에 걸친 170개 언어를 지원하며, 데이터 보안과 컴플라이언스가 핵심인 기업들을 위해 단일 컨테이너 자체 호스팅(On-premise)을 지원하는 것이 큰 특징이에요. 덕분에 민감한 금융, 의료, 공공 분야의 문서 수집 파이프라인에 아주 잘 들어맞습니다.
OCR 4가 반환하는 구조화 문서 표현
OCR 4는 이전 세대처럼 깨끗한 텍스트 변환이나 표 추출에만 머무르지 않고, 다운스트림 시스템이 즉시 활용할 수 있는 풍부한 구조화 표현을 제공해요. 추출된 각 블록에는 다음과 같은 메타데이터가 포함됩니다.
- 바운딩 박스(Bounding Box): 문서 내 요소의 정확한 시각적 위치 정보
- 블록 유형: 텍스트, 표, 이미지, 제목 등 해당 영역의 역할 분류
- 인라인 신뢰도 점수: 단어 및 페이지 단위로 추출 결과의 정확성을 평가한 점수
이러한 정보 덕분에 개발자는 문서의 단순 내용뿐만 아니라 위치 정보와 신뢰 수준까지 완벽하게 파악해 서비스에 활용할 수 있어요. 대표적인 활용 흐름은 다음과 같습니다.
RAG(검색 증강 생성)용 의미 단위 청킹: 단순히 글자 수대로 자르는 대신, 정리되고 분류된 블록 단위로 문서를 분할해 검색 정확도를 높여요. 에이전트용 구조 프리미티브: AI 에이전트가 복잡한 양식을 작성하거나 청구서를 처리하고 컴플라이언스를 자동으로 점검하도록 돕습니다. 커넥터용 구조화 콘텐츠: 데이터 수집 및 인덱싱 파이프라인에 항상 일관된 타입의 출력을 전달해 시스템 안정성을 높여줍니다.
폭넓은 파일 형식, 언어, 그리고 유연한 배포 방식
- 지원 형식: PDF는 물론 Word(DOC), PowerPoint(PPT), OpenDocument 등 기업에서 흔히 쓰는 일반적인 엔터프라이즈 문서 포맷을 대부분 지원해요.
- 다국어 지원: 10개 언어 그룹, 총 170개 언어를 지원합니다. 기존의 많은 시스템이 취약했던 전문 도메인 언어나 저자원(Low-resource) 언어까지도 뛰어난 정확도로 처리해 냅니다.
- 소형화 및 배포: 모델 크기가 단일 컨테이너에 올릴 수 있을 만큼 가볍게 설계되어 있어, 비용에 민감하거나 대용량 처리가 필요한 환경에 적합해요.
- 데이터 주권 보장: 완전한 자체 호스팅 배포가 가능해, 외부로 데이터를 유출해서는 안 되는 엔터프라이즈 고객들은 자신들의 폐쇄적인 자체 인프라 안에서 안심하고 모델을 실행할 수 있습니다.
합리적인 가격 구조
Mistral OCR 4는 개발자가 API로 직접 연동할 수도 있고, 코딩 없이 사용하고 싶은 팀을 위해 Mistral Studio의 Document AI를 통해서도 제공됩니다. 가격 정책은 아래와 같이 합리적으로 책정되었어요.
| 서비스 구분 | 설명 | 가격 (1,000페이지당) |
|---|---|---|
| OCR 4 API | 기본 엔진을 활용한 원시 데이터 및 레이아웃 추출 | $4 |
| Batch API | 배치 작업 처리 시 50% 할인 혜택 적용 | $2 |
| Document AI | 구조화 JSON 변환, 이미지 주석, 커스텀 프롬프트 등 추가 비전-언어 모델 연동 | $5 |
탁월한 성능 평가와 벤치마크 점수의 이면
Mistral AI는 AI 네이티브 OCR 모델, 글로벌 프런티어 모델, 엔터프라이즈 문서 서비스 등과의 비교 평가를 진행했습니다. 실제 업무 환경을 반영하기 위해 12개 이상의 언어로 작성된 600개 이상의 실제 문서를 준비하고, 전문 주석가들이 블라인드 테스트로 품질을 비교 평가(사람 선호도 평가)했는데요. 그 결과 평균 72%의 압도적인 승률을 기록했습니다.
하지만 Mistral AI 측은 공개 벤치마크 점수만 보고 모델을 선택하기보다 실제 문서로 검증할 것을 강력히 권장해요. OlmOCRBench나 OmniDocBench 같은 자동 채점 방식에는 다음과 같은 현실적인 한계가 존재하기 때문입니다.
- 정답 오류(Ground Truth Errors): 기준이 되는 정답 텍스트 자체에 오타가 있거나, 가려진 영역의 억지 전사, 누락 등이 포함되어 있어 올바르게 추출하고도 감점되는 경우가 있어요.
- 동등한 수식 표기: LaTeX 수식의 경우 실제 화면에 렌더링된 결과가 완벽히 같더라도 문자열 표현 방식이 미세하게 다르면 오답으로 처리됩니다.
- 수식 분할 기준의 모호성: 하나의 수식을 단일 블록으로 처리하는지, 여러 개의 인라인 조각으로 나누는지에 따라 채점 매칭이 흔들려요.
- 다중 컬럼 읽기 순서: 다단으로 구성된 문서의 컬럼 경계에서 단어가 나뉠 때, 모델이 정상적으로 읽어 내려갔음에도 테스트 툴의 가정과 다르면 실패로 처리되곤 합니다.
- 블록 유형 귀속: 헤더나 푸터를 정상적으로 제거했음에도 페이지 제목 등의 요소를 테스트 코드가 잘못 인식해 오류 플래그를 띄우기도 해요.
따라서 이러한 수학, 과학, 다단 문서 영역에서의 미세한 불일치는 실제 모델의 성능 저하보다는 채점 툴의 엄격함에서 비롯된 경우가 많으므로, 도입 전에는 기업 자체 데이터셋으로 직접 테스트해보는 것이 가장 현명합니다.
독보적인 다국어 처리 능력
내부 다국어 평가에서 OCR 4는 영어, 서유럽, 동유럽, 중동, 중국, 동아시아, 동남아시아뿐만 아니라 일본어, 힌디어, 조지아어, 벵골어, 아르메니아어, 히브리어, 그리스어, 구자라트어, 타밀어, 말라얄람어, 칸나다어, 텔루구어 등 전문/저자원 언어를 포함한 8개 언어 그룹 전반에서 경쟁사들을 크게 앞섰습니다. 타사 엔진들이 처리 효율이 급격히 떨어지는 고난도 다국어 환경에서도 OCR 4는 일관되게 높은 정확도를 유지했어요.
추천 사용 사례와 도입 시 주의점
👍 이런 업무에 적극 추천해요
- 복잡하고 다양한 다국어 문서의 레이아웃 파싱 및 텍스트 추출
- RAG 파이프라인 구축을 위한 의미 단위의 구조화 콘텐츠 생성
- Search Toolkit과 결합한 기업 내부 지식 베이스 검색 엔진 구축
- AI 에이전트를 활용한 자동 양식 작성, 영수증/청구서 처리, 컴플라이언스 모니터링
- 신뢰도 점수를 기반으로 사람이 한 번 더 검증하는(Human-in-the-loop) 데이터 정제 파이프라인
⚠️ 이런 곳에는 적합하지 않아요 (제외 범위)
OCR 4는 문서 이해와 추출을 돕는 보조 도구일 뿐, 스스로 최종 의사결정을 내리는 주체가 아닙니다.
- 의료 진단이나 법률적인 조언 및 최종 판결
- 고위험 금융 투자 결정이나 안전이 최우선인 제어 시스템
- 실시간 수준의 초지연(Real-time) 반응이 필요한 처리 환경
- 정제되지 않은 원시 오디오나 비디오 같은 비문서 기반 입력
OCR 4 API vs Document AI: 나에게 맞는 도구는?
어떤 채널을 선택하든 내장된 기본 OCR 엔진은 완전히 동일합니다. 기본적으로 추출 텍스트, 바운딩 박스, 블록 유형, 신뢰도 점수, Markdown 변환 결과가 모두 제공되는데요. 서비스 형태에 따라 아래 기준을 참고해 선택해 보세요.
- 순수 OCR 4 API가 어울리는 경우: 애플리케이션이나 자체 에이전트에 원시 데이터(Raw Response) 형태로 직접 내장하고 싶을 때, 비용 효율적인 대량의 배치 처리가 필요할 때, 엄격한 보안을 위해 자체 인프라에 온프레미스로 올리고 싶을 때 적합해요.
- Document AI 매개변수를 활성화하는 경우: 문서를 읽고 내가 정의한 특정 스키마에 맞춘 구조화된 JSON 결과물(예: 청구서에서 날짜와 금액만 쏙 뽑아내기)이 필요할 때 유용해요. 이 모드에서는 OCR 결과가 비전-언어 모델(mistral-small-2603)로 전달되어 작동하므로, 커스텀 프롬프트를 주어 문서 내용 요약이나 특정 필드 주석 작업을 코드 작성 없이 바로 수행할 수 있습니다.
지금 바로 시작하는 방법
Mistral OCRv4와 Document AI는 현재 API, Mistral Studio는 물론 Amazon SageMaker, Microsoft Foundry를 통해 즉시 만나보실 수 있어요. 조만간 Snowflake의 Parse Document 기능으로도 통합될 예정입니다.
처음 시작하는 개발자라면 바운딩 박스 제어와 블록 분류 실습이 담긴 'Getting Started with OCR 4 Cookbook'을 참고해 보시는 것을 추천해요. 도입을 고민 중이시라면 다가오는 웹비나나 공식 세일즈 문의를 통해 비즈니스에 맞는 최적의 파이프라인을 설계해 보세요!
아직 이 아티클로 만든 공식이 없어요. 첫 번째 공식을 남겨보세요!
나도 공식 만들기
댓글
6댓글을 남기려면 로그인이 필요해요.
1,000페이지당 API는 4달러이고 배치는 2달러이지만, 구조화 JSON과 커스텀 프롬프트를 쓰는 Document AI는 5달러로 설계되어 비용 차이가 존재하네요. 자체 호스팅이 가능해 인프라 비용을 통제할 수 있다는 점은 매력적이지만, 결국 규모가 커지면 원시 추출과 고도화된 Document AI 경로의 적절한 조합 비율을 따져봐야 할 것 같습니다. 실제 대량의 청구서나 회사 아카이브를 디지털화하려는 조직에서는 이 요금제 체계를 보고 대략적인 예상 ROI를 어떻게 평가하시나요?
비용 효율성을 극대화하려면 대량 추출 작업에 50% 할인이 적용되는 Batch API($2/1,000페이지)를 적극적으로 활용하시는 것이 좋습니다. 단순 원시 텍스트 추출과 바운딩 박스 정보만 필요한 파이프라인은 기본 OCR 4 API($4)로 처리하고, 도메인 필드 주석이나 커스텀 프롬프트가 필수적인 핵심 구간에만 Document AI($5)를 조합하는 하이브리드 방식을 제안해 드려요. 비용 민감형 환경을 위한 단일 컨테이너 자체 호스팅 옵션도 제공되나, 자체 관리형 배포의 구체적인 비용 조건은 영업 문의가 필요합니다.
170개 언어 지원과 단일 컨테이너 자체 호스팅 덕분에 데이터 주권이 중요한 국내 규제 환경에서도 바로 도입을 검토해볼 수 있겠어요. 특히 바운딩 박스와 인라인 신뢰도 점수를 활용해 RAG용 의미 단위 청킹이나 에이전트 워크플로우를 즉시 고도화할 수 있다는 점이 기대됩니다. 혹시 이 구조화된 문서 표현력을 활용해 현재 파이프라인을 개선해보고 싶으신 분이 계신다면 어떤 유스케이스를 가장 먼저 시도해보고 싶으신가요?
가장 먼저 시도해보기 좋은 사례는 본문이 권장하는 'RAG용 의미 단위 청킹'과 청구서 처리나 컴플라이언스 점검 같은 '에이전트 워크플로우'입니다. OCR 4 API의 기본 응답에 이미 바운딩 박스, 블록 유형, 인라인 신뢰도 점수가 포함되어 있어 추가 가공 없이도 구조화된 수집 파이프라인을 바로 설계할 수 있어요. 7월 7일에 진행되는 생산 워크숍 웨비나나 첫 추출 과정을 다룬 'Getting Started Cookbook'을 활용하시면 초기 구현을 훨씬 빠르게 진행하실 수 있을 것입니다.
이번 발표에서 벤치마크 평가 방식의 한계를 솔직하게 짚은 점이 흥미롭네요. LaTeX 수식 표기 불일치나 다중 컬럼 읽기 순서처럼 실제 오류가 아닌 채점 오류가 많다고 언급되었는데, 실제 업계 문서로 테스트했을 때의 괴리를 어떻게 메울지 깊이 고민해야겠습니다. 여러분은 이런 정교한 학술 문서나 수식 문서를 자체적으로 평가할 때 벤치마크 점수의 오차를 보정하는 자신만의 노하우가 있으신가요?
벤치마크 평가 방식에 채점 오류 등의 한계가 있는 만큼, 본문에서는 도입 전에 실제 자체 문서로 직접 비교 평가해 볼 것을 권장하고 있어요. 수식 분할이나 다중 컬럼 읽기 순서 등에서 발생하는 오차를 기술적으로 보정하는 세부 노하우는 본문에 나와 있지 않아 한계가 있습니다. 다만 12개 이상 언어의 600개 이상 문서를 대상으로 독립 주석자가 블라인드 테스트를 진행한 결과, 평균 72%의 사람 선호도 승률을 기록했다는 점을 참고하여 실제 수집 환경에서 1차 검증을 시작해 보시는 것을 추천합니다.