Reliable Financial Named Entity Recognition under Domain Shift
금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
금융 문서(SEC 신고서)로 학습시킨 개체명 인식 AI를 뉴스, 소셜미디어로 옮겨 테스트하니 정확도뿐 아니라 AI가 스스로 매기는 확신도(신뢰도)까지 무너졌다. 특히 문장 전체 확률로 매긴 자신감은 도메인이 바뀌면 믿을 수 없게 되고, 개체명 부분만 본 확률이나 같은 입력을 여러 번 생성해 일치하는 정도(자기일관성)가 더 안정적이었다. 다만 소셜미디어처럼 아주 다른 도메인에서는 어떤 신뢰도 지표도 안전하게 자동 처리할 문장을 골라내지 못했다.
METAL MEDIA 해설 도표
금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
01SEC 신고서로 학습한 BERT 태거와 소형 언어모델(Qwen2.5 0.5B/1.5B, LoRA로 미세조정)을 신고서-금융뉴스-일반 트위터 3단계로 테스트
02다섯 가지 추론 시점 신뢰도 신호(문장 전체 확률, 토큰 확률, 개체명 확률, 유형 확률, 자기일관성)를 비교하고 3개 시드와 부트스트랩 신뢰구간으로 검증
03도메인 내에서는 문장 전체 확률이 오류 탐지에 가장 강했지만 도메인이 바뀌면 성능이 급락, 개체명 확률과 자기일관성이 더 견고했고 특히 자기일관성은 별도 보정 없이도 신뢰도 수치 자체가 더 정확했음
04가장 확신하는 상위 40% 문장만 자동 처리하게 하면 도메인 내 문장 오류율이 34.3%에서 2% 미만으로 급감, 금융뉴스에서도 효과 있었지만 일반 트위터 데이터에서는 어떤 임계값으로도 쓸만한 안전 구간을 찾지 못함
05이를 바탕으로 먼저 입력이 원래 도메인과 얼마나 다른지 감지한 뒤에만 신뢰도 기반 자동/보류 판단을 적용하는 단계적 배포 전략을 제안
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
SEC 신고서로 학습한 BERT 태거와 소형 언어모델(Qwen2.5 0.5B/1.5B, LoRA로 미세조정)을 신고서-금융뉴스-일반 트위터 3단계로 테스트
다섯 가지 추론 시점 신뢰도 신호(문장 전체 확률, 토큰 확률, 개체명 확률, 유형 확률, 자기일관성)를 비교하고 3개 시드와 부트스트랩 신뢰구간으로 검증
도메인 내에서는 문장 전체 확률이 오류 탐지에 가장 강했지만 도메인이 바뀌면 성능이 급락, 개체명 확률과 자기일관성이 더 견고했고 특히 자기일관성은 별도 보정 없이도 신뢰도 수치 자체가 더 정확했음
가장 확신하는 상위 40% 문장만 자동 처리하게 하면 도메인 내 문장 오류율이 34.3%에서 2% 미만으로 급감, 금융뉴스에서도 효과 있었지만 일반 트위터 데이터에서는 어떤 임계값으로도 쓸만한 안전 구간을 찾지 못함
이를 바탕으로 먼저 입력이 원래 도메인과 얼마나 다른지 감지한 뒤에만 신뢰도 기반 자동/보류 판단을 적용하는 단계적 배포 전략을 제안
Fig. 1: Reliability diagrams for self-consistency confidence (0.5B, pooled seeds). Near-diagonal in-domain; on both shifted tiers the top-confidence bin inverts.
TABLE I: Dataset statistics after harmonization and filtering.
Split
Domain
Sent.
Ent.
PER
ORG
LOC
Train
FIN (filings) [27]
1014
980
648
175
157
Valid
FIN (filings) [27]
150
177
97
68
12
Test
FIN (filings) [27]
299
295
201
56
38
Test
FiNER-ORD (news) [28]
300
322
78
151
93
Test
TweetNER7 (tweets) [30]
300
619
381
135
103
Fig. 2: Sentence-level risk–coverage (Qwen2.5-0.5B; line = 3-seed mean, band = seed range; lower is better). Abstention sharply reduces risk in-domain and on news, but cannot rescue the far-shift tier.
TABLE II: Main results (%; mean±std over 3 seeds; Qwen2.5-1.5B is a single-seed scale check).
Model
Domain
P
R
F1
Halluc.%
ECE
BERT-base
FIN
66.7±2.3
74.2±1.4
70.3±1.5
–
0.102±0.016
BERT-base
FiNER-ORD
39.1±0.3
37.6±2.3
38.3±1.1
–
0.071±0.017
BERT-base
TweetNER7
35.2±5.2
18.4±1.7
24.1±2.5
–
0.074±0.007
Qwen-0.5B
FIN
40.5±0.4
34.7±2.1
37.4±1.3
3.6±2.4
0.362±0.009
Qwen-0.5B
FiNER-ORD
30.7±1.3
18.0±4.4
22.6±3.8
8.2±0.7
0.407±0.005
Qwen-0.5B
TweetNER7
30.8±0.7
23.7±4.2
26.7±2.8
5.6±1.1
0.370±0.007
Qwen-1.5B
FIN
47.7
44.7
46.2
4.3
0.322
Qwen-1.5B
FiNER-ORD
56.3
48.4
52.1
3.6
0.227
Qwen-1.5B
TweetNER7
44.9
50.9
47.7
6.8
0.358
TABLE III: Error-detection AUROC and ECE per confidence signal (Qwen2.5-0.5B; mean±std over 3 seeds), by test domain.
Signal
FIN
FiNER-ORD
TweetNER7
AUROC
ECE
AUROC
ECE
AUROC
ECE
Sequence prob.
0.839±0.014
0.512±0.005
0.661±0.015
0.593±0.011
0.626±0.019
0.586±0.006
Token prob.
0.823±0.012
0.531±0.004
0.666±0.019
0.615±0.013
0.605±0.018
0.611±0.006
Span prob.
0.801±0.004
0.362±0.009
0.690±0.030
0.407±0.005
0.721±0.011
0.370±0.007
Type prob.
0.492±0.019
0.506±0.004
0.536±0.022
0.533±0.019
0.511±0.010
0.573±0.002
Self-consistency
0.690±0.019
0.116±0.029
0.671±0.048
0.120±0.015
0.682±0.017
0.100±0.008
TABLE IV: Scale check: error-detection AUROC by signal and domain for Qwen2.5-0.5B (3-seed mean) vs. Qwen2.5-1.5B (single seed).
Signal
0.5B (3 seeds)
1.5B (1 seed)
FIN
FiNER
Tweet
FIN
FiNER
Tweet
Sequence prob.
0.839
0.661
0.626
0.764
0.720
0.637
Span prob.
0.801
0.690
0.721
0.819
0.729
0.638
Self-consistency
0.690
0.671
0.682
0.735
0.744
0.663
TABLE V: Entity-level selective precision (%) at 100/80/60% coverage (Qwen2.5-0.5B; mean±std over 3 seeds).
Domain
Signal
P@100%
P@80%
P@60%
FIN
Seq. prob.
40.5±0.4
49.0±0.8
58.4±0.6
FIN
Span prob.
40.5±0.4
49.2±0.3
56.4±0.6
FIN
Self-consistency
40.5±0.4
47.7±0.4
52.8±1.0
FiNER
Seq. prob.
30.7±1.3
34.9±3.0
40.1±1.3
FiNER
Span prob.
30.7±1.3
35.3±1.7
40.8±2.6
FiNER
Self-consist.
30.7±1.3
34.9±3.0
41.4±2.3
Tweet
Seq. prob.
30.8±0.7
34.2±1.0
36.8±2.9
Tweet
Span prob.
30.8±0.7
36.6±1.1
42.7±1.1
Tweet
Self-consist.
30.8±0.7
35.5±1.7
40.5±1.5
TABLE VI: TweetNER7 filtering sensitivity, main (drop-sentence) vs. relaxed (ignore-entity) protocol. Encoder: 3-seed mean; Qwen: seed 42.
Filtered
Relaxed
Sentences dropped (of 2807)
2179
0
Evaluated (cap 300)
300
300
Gold PER/ORG/LOC
619
443
Ignored entities
0
488
Encoder F1
24.1±2.5
19.5±1.0
Encoder MSP AUROC
0.615±0.054
0.650±0.047
Qwen-0.5B F1
29.7
29.1
Qwen-0.5B span AUROC
0.725
0.715
왜 중요한가
금융 규제·리스크 관리처럼 오류가 실제 피해로 이어지는 분야에서는 AI 정확도 숫자만으로는 언제 결과를 믿고 자동화해도 되는지 알 수 없다. 이 연구는 입력 데이터의 성격이 바뀔 때 AI의 자신감 표시 자체가 오작동할 수 있음을 보여주고, 어떤 신뢰도 지표를 언제 써야 하는지에 대한 구체적 근거를 제공한다.
이 논문의 용어
개체명 인식(NER) · 문장에서 사람, 회사, 지역 같은 고유명사를 찾아 분류하는 AI 작업
도메인 변화(distribution shift) · AI가 학습한 데이터와 실제 사용 환경의 문장 스타일·주제가 달라지는 현상
선택적 예측(selective prediction) · AI가 확신 없는 입력은 답을 내지 않고 사람 검토로 넘기는 방식
자기일관성(self-consistency) · 같은 입력에 대해 AI가 여러 번 답을 생성했을 때 얼마나 같은 답이 나오는지로 신뢰도를 재는 방법
LoRA · 거대 언어모델 전체를 다시 학습시키지 않고 일부 작은 파라미터만 추가로 학습시키는 효율적 미세조정 기법
AUROC / ECE · AUROC는 신뢰도가 실제 오류를 얼마나 잘 구분하는지, ECE는 AI가 말하는 확신 수치가 실제 정답률과 얼마나 잘 맞는지(보정 정도)를 나타내는 지표
저자 · Zihao Zheng, Baichuan Li, Junyi Yao, Jiayu Long