Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application
공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점
연구진은 독일 데이터사이언스 석사과정 지원자의 성적증명서 100건을 대상으로, 오픈소스 OCR 엔진과 언어모델(LLM), 시각언어모델(VLM) 조합 35가지가 표에서 과목명·학점·평점을 얼마나 정확히 뽑아내는지 평가했다. 결과는 35개 조합 중 단 4개만 F1 점수 0.5를 넘었고, 약 75%는 0.25 미만으로 사실상 실패 수준이었다. 이는 이런 시스템이 EU AI 법에서 고위험으로 분류되는 공공 업무에 아무 조정 없이 바로 투입하기엔 위험하다는 뜻이다.
METAL MEDIA 해설 도표
공공기관 고위험 서류처리에 오픈소스 AI를 그냥 쓰면 4건 중 3건이 낙제점
01학생비자·석사입학 심사처럼 EU AI 법이 '고위험'으로 분류하는 공공부문 서류처리에서, 실제 성적증명서 100건(비정형 PDF, 표+자유문장+도장 혼재)을 손수 정답 데이터로 만들어 벤치마크를 구성했다.
02OCR 엔진(Pytesseract, PaddleOCR, MinerU, EasyOCR, docTR 등) 뒤에 Qwen3 언어모델(0.6B~235B)을 붙이는 파이프라인과, 이미지를 바로 읽는 시각언어모델(LLaVA, Ministral-3, Gemma3, Qwen2.5VL, Qwen3VL) 방식을 각각 아무런 추가 학습 없이(제로샷) 비교했다.
03가장 좋은 조합은 MinerU+Qwen3:235B(F1 0.509)와 Qwen2.5-VL(F1 0.509)로 동률이었지만, LLaVA와 Gemma3는 거의 0점을 기록했다. MinerU가 강한 이유는 표를 HTML 태그로, 줄 배치를 그대로 보존해 언어모델이 읽기 쉬운 형태로 출력하기 때문이다.
04모델 크기를 키운다고 성적이 비례해서 오르지 않았고, Qwen2.5-VL이 후속작 Qwen3-VL보다 오히려 나은 경우도 있었다. 반면 평점(성적)과 학점 항목을 빼고 과목명만 추출하게 하면 정확도가 크게 올라, 어려움의 상당 부분이 다양한 성적 표기 방식을 해석하는 데서 온다는 점도 확인됐다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
학생비자·석사입학 심사처럼 EU AI 법이 '고위험'으로 분류하는 공공부문 서류처리에서, 실제 성적증명서 100건(비정형 PDF, 표+자유문장+도장 혼재)을 손수 정답 데이터로 만들어 벤치마크를 구성했다.
OCR 엔진(Pytesseract, PaddleOCR, MinerU, EasyOCR, docTR 등) 뒤에 Qwen3 언어모델(0.6B~235B)을 붙이는 파이프라인과, 이미지를 바로 읽는 시각언어모델(LLaVA, Ministral-3, Gemma3, Qwen2.5VL, Qwen3VL) 방식을 각각 아무런 추가 학습 없이(제로샷) 비교했다.
가장 좋은 조합은 MinerU+Qwen3:235B(F1 0.509)와 Qwen2.5-VL(F1 0.509)로 동률이었지만, LLaVA와 Gemma3는 거의 0점을 기록했다. MinerU가 강한 이유는 표를 HTML 태그로, 줄 배치를 그대로 보존해 언어모델이 읽기 쉬운 형태로 출력하기 때문이다.
모델 크기를 키운다고 성적이 비례해서 오르지 않았고, Qwen2.5-VL이 후속작 Qwen3-VL보다 오히려 나은 경우도 있었다. 반면 평점(성적)과 학점 항목을 빼고 과목명만 추출하게 하면 정확도가 크게 올라, 어려움의 상당 부분이 다양한 성적 표기 방식을 해석하는 데서 온다는 점도 확인됐다.
Figure 1: Anonymized example document.
Table 1: Manually extracted Ground Truth for the Document in Figure 1
Academic Field
Course Name
Grade
Awarded Credits
Mathematics
MATHEMATICS FOR COMPUTER THEORY ENGINEERING & INFORMATION TECHNOLOGY
B
4.00
Computer Science
OPERATING SYSTEMS
B
3.00
Computer Science
DESIGN AND ANALYSIS OF ALGORITHMS
C
3.00
Computer Science
APPLICATION DEVELOPMENT TOOLS
B
2.00
Computer Science
PROGRAMMING FOR SCIENTIFIC THEORY COMPUTING
B+
3.00
Computer Science
NO SQL DATABASE SYSTEMS
B+
1.00
Figure 2: Workflow of extraction and evaluation pipeline
Table 2: OCR model configurations and output formats.
Model
Input
Language Config
Output Format
docTR
PDF
auto-detect
Unstructured; line breaks between text blocks
EasyOCR
Image (JPG)
English
Unstructured; tabs between text blocks (manually added)
MinerU
PDF
English
Structured; HTML tags for tables, line breaks between text rows
PPOCRv5
Image (JPG)
English
Unstructured; tabs between text blocks (manually added)
PPStructureV3
PDF
English
Structured; HTML tags for tables, line breaks between text blocks
Pytesseract
Image (JPG)
English
Structured; line breaks between text rows
Figure 4: Best F1 score per model: top OCR+LLM combination (always Qwen3:235B) versus all VLMs.
Table 3: OCR model architecture components (specified models only).
Model
Orient. Class.
Doc Unwarping
Text Detection
Textline Orient.
Text Recognition
docTR
—
—
db_resnet50
—
master
EasyOCR
—
—
—
—
—
MinerU
—
—
—
—
—
PPOCRv5
PP-LCNet_x1_0_doc_ori
UVDoc
OCRv5_server_det
PP-LCNet_x1_0_textline_ori
PP-OCRv5_server_rec
PPStructureV3
PP-LCNet_x1_0_doc_ori
UVDoc
OCRv5_server_det
PP-LCNet_x1_0_textline_ori
PP-OCRv5_server_rec
Pytesseract
—
—
—
—
—
Figure 5: F1 scores across Qwen3 parameter sizes for each OCR engine.
Table 4: Qwen3 model architecture parameters [31]. Context lengths as specified in Ollama [23]. Q/KV heads refer to query and key-value attention heads [29].
Model
Parameters
Context Length
Layers
Heads (Q / KV)
Qwen3
0.6B
40K
28
16 / 8
Qwen3
4B
256K
36
32 / 8
Qwen3
14B
40K
40
40 / 8
Qwen3
32B
40K
64
64 / 8
Qwen3
235B
256K
94
64 / 4
Figure 6: F1 improvement when removing grade, awarded credits, or both.
Table 5: Vision-language model overview.
Model
Year
Architecture
Parameters
Context
Vision Encoder
Gemma 3
2025
Decoder-only
27B
128K
SigLIP
LLaVA
2024
Encoder-decoder
7B
32K
CLIP
Ministral 3
2025
Decoder-only
14B
256K
ViT
Qwen2.5-VL
2025
Encoder-decoder
32B
125K
ViT
Qwen3-VL
2025
Encoder-decoder
32B
256K
SigLIP-2
Table 6: Extraction performance metrics for OCR+LLM pipeline and VLM models.
OCR Engine
LLM Model
Precision
Recall
F1
OCR + LLM Pipeline
docTR
Qwen3 0.6B
0.014
0.022
0.016
docTR
Qwen3 4B
0.199
0.217
0.201
docTR
Qwen3 14B
0.202
0.238
0.215
docTR
Qwen3 32B
0.204
0.222
0.209
docTR
Qwen3 235B
0.301
0.329
0.311
EasyOCR
Qwen3 0.6B
0.007
0.009
0.008
EasyOCR
Qwen3 4B
0.079
0.088
0.080
EasyOCR
Qwen3 14B
0.079
0.111
0.088
EasyOCR
Qwen3 32B
0.103
0.125
0.108
EasyOCR
Qwen3 235B
0.104
0.126
0.112
MinerU
Qwen3 0.6B
0.078
0.081
0.075
MinerU
Qwen3 4B
0.415
0.472
0.427
MinerU
Qwen3 14B
0.455
0.499
0.465
MinerU
Qwen3 32B
0.471
0.551
0.501
MinerU
Qwen3 235B
0.489
0.542
0.509
PPOCRv5
Qwen3 0.6B
0.002
0.002
0.002
PPOCRv5
Qwen3 4B
0.160
0.199
0.170
PPOCRv5
Qwen3 14B
0.207
0.262
0.222
PPOCRv5
Qwen3 32B
0.163
0.184
0.169
PPOCRv5
Qwen3 235B
0.312
0.345
0.324
PPStructureV3
Qwen3 0.6B
0.022
0.020
0.020
PPStructureV3
Qwen3 4B
0.132
0.146
0.129
PPStructureV3
Qwen3 14B
0.123
0.133
0.124
PPStructureV3
Qwen3 32B
0.157
0.163
0.157
PPStructureV3
Qwen3 235B
0.176
0.191
0.179
Pytesseract
Qwen3 0.6B
0.005
0.005
0.005
Pytesseract
Qwen3 4B
0.091
0.095
0.092
Pytesseract
Qwen3 14B
0.086
0.100
0.091
Pytesseract
Qwen3 32B
0.090
0.096
0.092
왜 중요한가
행정·교육기관이 오픈소스 AI로 서류 심사를 자동화하려 할 때, '최신·대형 모델이니 믿을 만하겠지'라는 가정이 얼마나 위험한지 구체적 수치로 보여준다. 특히 EU AI 법상 고위험 업무에 이런 시스템을 도입하려는 실무자에게 OCR 출력 형식(표 구조 보존 여부)이 모델 크기만큼이나 결과를 좌우한다는 실전 지침을 준다.