컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점

arXiv:2608.182892026-08-20

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점

연구진은 독일 데이터사이언스 석사과정 지원자의 성적증명서 100건을 대상으로, 오픈소스 OCR 엔진과 언어모델(LLM), 시각언어모델(VLM) 조합 35가지가 표에서 과목명·학점·평점을 얼마나 정확히 뽑아내는지 평가했다. 결과는 35개 조합 중 단 4개만 F1 점수 0.5를 넘었고, 약 75%는 0.25 미만으로 사실상 실패 수준이었다. 이는 이런 시스템이 EU AI 법에서 고위험으로 분류되는 공공 업무에 아무 조정 없이 바로 투입하기엔 위험하다는 뜻이다.

METAL MEDIA 해설 도표

공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점

  1. 01학생비자·석사입학 심사처럼 EU AI 법이 '고위험'으로 분류하는 공공부문 서류처리에서, 실제 성적증명서 100건(비정형 PDF, 표+자유문장+도장 혼재)을 손수 정답 데이터로 만들어 벤치마크를 구성했다.
  2. 02OCR 엔진(Pytesseract, PaddleOCR, MinerU, EasyOCR, docTR 등) 뒤에 Qwen3 언어모델(0.6B~235B)을 붙이는 파이프라인과, 이미지를 바로 읽는 시각언어모델(LLaVA, Ministral-3, Gemma3, Qwen2.5VL, Qwen3VL) 방식을 각각 아무런 추가 학습 없이(제로샷) 비교했다.
  3. 03가장 좋은 조합은 MinerU+Qwen3:235B(F1 0.509)와 Qwen2.5-VL(F1 0.509)로 동률이었지만, LLaVA와 Gemma3는 거의 0점을 기록했다. MinerU가 강한 이유는 표를 HTML 태그로, 줄 배치를 그대로 보존해 언어모델이 읽기 쉬운 형태로 출력하기 때문이다.
  4. 04모델 크기를 키운다고 성적이 비례해서 오르지 않았고, Qwen2.5-VL이 후속작 Qwen3-VL보다 오히려 나은 경우도 있었다. 반면 평점(성적)과 학점 항목을 빼고 과목명만 추출하게 하면 정확도가 크게 올라, 어려움의 상당 부분이 다양한 성적 표기 방식을 해석하는 데서 온다는 점도 확인됐다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 학생비자·석사입학 심사처럼 EU AI 법이 '고위험'으로 분류하는 공공부문 서류처리에서, 실제 성적증명서 100건(비정형 PDF, 표+자유문장+도장 혼재)을 손수 정답 데이터로 만들어 벤치마크를 구성했다.
  2. OCR 엔진(Pytesseract, PaddleOCR, MinerU, EasyOCR, docTR 등) 뒤에 Qwen3 언어모델(0.6B~235B)을 붙이는 파이프라인과, 이미지를 바로 읽는 시각언어모델(LLaVA, Ministral-3, Gemma3, Qwen2.5VL, Qwen3VL) 방식을 각각 아무런 추가 학습 없이(제로샷) 비교했다.
  3. 가장 좋은 조합은 MinerU+Qwen3:235B(F1 0.509)와 Qwen2.5-VL(F1 0.509)로 동률이었지만, LLaVA와 Gemma3는 거의 0점을 기록했다. MinerU가 강한 이유는 표를 HTML 태그로, 줄 배치를 그대로 보존해 언어모델이 읽기 쉬운 형태로 출력하기 때문이다.
  4. 모델 크기를 키운다고 성적이 비례해서 오르지 않았고, Qwen2.5-VL이 후속작 Qwen3-VL보다 오히려 나은 경우도 있었다. 반면 평점(성적)과 학점 항목을 빼고 과목명만 추출하게 하면 정확도가 크게 올라, 어려움의 상당 부분이 다양한 성적 표기 방식을 해석하는 데서 온다는 점도 확인됐다.
Figure 1: Anonymized example document.
Figure 1: Anonymized example document.
Table 1: Manually extracted Ground Truth for the Document in Figure 1
Academic FieldCourse NameGradeAwarded Credits
MathematicsMATHEMATICS FOR COMPUTER THEORY ENGINEERING & INFORMATION TECHNOLOGYB4.00
Computer ScienceOPERATING SYSTEMSB3.00
Computer ScienceDESIGN AND ANALYSIS OF ALGORITHMSC3.00
Computer ScienceAPPLICATION DEVELOPMENT TOOLSB2.00
Computer SciencePROGRAMMING FOR SCIENTIFIC THEORY COMPUTINGB+3.00
Computer ScienceNO SQL DATABASE SYSTEMSB+1.00
Figure 2: Workflow of extraction and evaluation pipeline
Figure 2: Workflow of extraction and evaluation pipeline
Table 2: OCR model configurations and output formats.
ModelInputLanguage ConfigOutput Format
docTRPDFauto-detectUnstructured; line breaks between text blocks
EasyOCRImage (JPG)EnglishUnstructured; tabs between text blocks (manually added)
MinerUPDFEnglishStructured; HTML tags for tables, line breaks between text rows
PPOCRv5Image (JPG)EnglishUnstructured; tabs between text blocks (manually added)
PPStructureV3PDFEnglishStructured; HTML tags for tables, line breaks between text blocks
PytesseractImage (JPG)EnglishStructured; line breaks between text rows
Figure 4: Best F1 score per model: top OCR+LLM combination (always Qwen3:235B) versus all VLMs.
Figure 4: Best F1 score per model: top OCR+LLM combination (always Qwen3:235B) versus all VLMs.
Table 3: OCR model architecture components (specified models only).
ModelOrient. Class.Doc UnwarpingText DetectionTextline Orient.Text Recognition
docTRdb_resnet50master
EasyOCR
MinerU
PPOCRv5PP-LCNet_x1_0_doc_oriUVDocOCRv5_server_detPP-LCNet_x1_0_textline_oriPP-OCRv5_server_rec
PPStructureV3PP-LCNet_x1_0_doc_oriUVDocOCRv5_server_detPP-LCNet_x1_0_textline_oriPP-OCRv5_server_rec
Pytesseract
Figure 5: F1 scores across Qwen3 parameter sizes for each OCR engine.
Figure 5: F1 scores across Qwen3 parameter sizes for each OCR engine.
Table 4: Qwen3 model architecture parameters [31]. Context lengths as specified in Ollama [23]. Q/KV heads refer to query and key-value attention heads [29].
ModelParametersContext LengthLayersHeads (Q / KV)
Qwen30.6B40K2816 / 8
Qwen34B256K3632 / 8
Qwen314B40K4040 / 8
Qwen332B40K6464 / 8
Qwen3235B256K9464 / 4
Figure 6: F1 improvement when removing grade, awarded credits, or both.
Figure 6: F1 improvement when removing grade, awarded credits, or both.
Table 5: Vision-language model overview.
ModelYearArchitectureParametersContextVision Encoder
Gemma 32025Decoder-only27B128KSigLIP
LLaVA2024Encoder-decoder7B32KCLIP
Ministral 32025Decoder-only14B256KViT
Qwen2.5-VL2025Encoder-decoder32B125KViT
Qwen3-VL2025Encoder-decoder32B256KSigLIP-2
Table 6: Extraction performance metrics for OCR+LLM pipeline and VLM models.
OCR EngineLLM ModelPrecisionRecallF1
OCR + LLM Pipeline
docTRQwen3 0.6B0.0140.0220.016
docTRQwen3 4B0.1990.2170.201
docTRQwen3 14B0.2020.2380.215
docTRQwen3 32B0.2040.2220.209
docTRQwen3 235B0.3010.3290.311
EasyOCRQwen3 0.6B0.0070.0090.008
EasyOCRQwen3 4B0.0790.0880.080
EasyOCRQwen3 14B0.0790.1110.088
EasyOCRQwen3 32B0.1030.1250.108
EasyOCRQwen3 235B0.1040.1260.112
MinerUQwen3 0.6B0.0780.0810.075
MinerUQwen3 4B0.4150.4720.427
MinerUQwen3 14B0.4550.4990.465
MinerUQwen3 32B0.4710.5510.501
MinerUQwen3 235B0.4890.5420.509
PPOCRv5Qwen3 0.6B0.0020.0020.002
PPOCRv5Qwen3 4B0.1600.1990.170
PPOCRv5Qwen3 14B0.2070.2620.222
PPOCRv5Qwen3 32B0.1630.1840.169
PPOCRv5Qwen3 235B0.3120.3450.324
PPStructureV3Qwen3 0.6B0.0220.0200.020
PPStructureV3Qwen3 4B0.1320.1460.129
PPStructureV3Qwen3 14B0.1230.1330.124
PPStructureV3Qwen3 32B0.1570.1630.157
PPStructureV3Qwen3 235B0.1760.1910.179
PytesseractQwen3 0.6B0.0050.0050.005
PytesseractQwen3 4B0.0910.0950.092
PytesseractQwen3 14B0.0860.1000.091
PytesseractQwen3 32B0.0900.0960.092

왜 중요한가

행정·교육기관이 오픈소스 AI로 서류 심사를 자동화하려 할 때, '최신·대형 모델이니 믿을 만하겠지'라는 가정이 얼마나 위험한지 구체적 수치로 보여준다. 특히 EU AI 법상 고위험 업무에 이런 시스템을 도입하려는 실무자에게 OCR 출력 형식(표 구조 보존 여부)이 모델 크기만큼이나 결과를 좌우한다는 실전 지침을 준다.

이 논문의 용어

  • OCR · 이미지 속 문자를 컴퓨터가 읽을 수 있는 텍스트로 바꾸는 광학문자인식 기술
  • LLM · 대량의 텍스트로 학습된 대형 언어모델
  • VLM · 이미지와 텍스트를 함께 이해하는 시각언어모델
  • 제로샷(zero-shot) · 해당 작업용으로 별도 추가 학습을 하지 않고 사전학습된 모델을 그대로 사용하는 방식
  • F1 점수 · 정답을 얼마나 놓치지 않았는지(재현율)와 틀린 답을 얼마나 안 냈는지(정밀도)를 함께 반영한 정확도 지표, 1에 가까울수록 좋음

본문에 싣지 못한 그림

  • Figure 3: Tokenization visualized
원문에서 그림 보기 →

저자 · Elias Schubert, Felix Bie{\ss}mann

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Elias Schubert et al., arXiv:2608.18289, CC BY-SA 4.0