Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals
AI 채용·심사 평가에서 이름보다 학교 간판과 논문 게재지가 점수를 더 크게 흔든다
대형언어모델(LLM) 4종에 후보자 평가를 시켜본 결과, 지원자 이름의 인종적 느낌은 점수에 거의 영향을 주지 않았지만 출신 대학의 명성과 논문이 실린 학술지의 명성은 점수를 뚜렷하게 갈랐다. 특히 세계적 학술지 Nature에 실린 논문 하나가 명문대 졸업장보다 5.7배 더 큰 점수 효과를 냈다. 저자들은 이를 '중립성 편향 지수(NBI)'라는 새 지표로 정량화해, 평균 점수뿐 아니라 평가의 들쭉날쭉함(불확실성)까지 저명하지 않은 학교 출신 후보가 불리하다는 것을 보였다.
METAL MEDIA 해설 도표
AI 채용·심사 평가에서 이름보다 학교 간판과 논문 게재지가 점수를 더 크게 흔든다
01Claude Haiku 4.5, GPT-4o-mini, Gemini 2.0 Flash, Llama 3.1 8B 네 개 모델에 장학금·채용·대출심사·연구비·정책제안 등 5개 분야 평가를 시키고, 이름(앵글로/라틴/아랍)·출신학교 등급·논문 게재지를 요인으로 바꿔가며 총 4,320회 API 호출로 실험했다
0210점 만점 점수에서 이름의 인종적 느낌 차이는 통계적으로 유의하지 않았지만(±0.094, 신뢰구간이 0을 포함), 출신학교 등급이 최상위(MIT급)에서 최하위(무순위)로 내려갈수록 점수가 평균 0.297점 낮아졌다
03출신학교 명성 효과(+0.185)와 출신국가(선진국/개발도상국) 효과(+0.126)를 분리해 비교했더니 명성 효과가 국가 효과보다 1.5배 컸고, 같은 명성이면 후진국 명문대(UNAM)가 선진국 무명대학(Framingham State)보다 낮은 점수를 받지 않아 순수 국가 편견이 원인이 아님을 확인했다
04논문 게재지 명성(Nature vs 주변부 오픈액세스 학술지)과 출신학교 명성을 교차 실험하니, 게재지 효과(+1.937)가 출신학교 효과(+0.341)보다 5.7배 컸고, Nature 게재는 저명하지 않은 대학(과야킬대) 출신 후보의 점수를 명문대(MIT) 출신보다 더 크게 끌어올리는 '구제 효과'를 보였다
05저자들이 새로 제시한 중립성 편향 지수(NBI)로 분석하면, 저명하지 않은 학교 출신 후보는 평균 점수만 낮은 게 아니라 같은 조건에서도 평가가 더 들쭉날쭉해(불확실성 요소 I 높음), 평균값만 보는 기존 감사 방식이 놓치는 불이익이 존재했다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
Claude Haiku 4.5, GPT-4o-mini, Gemini 2.0 Flash, Llama 3.1 8B 네 개 모델에 장학금·채용·대출심사·연구비·정책제안 등 5개 분야 평가를 시키고, 이름(앵글로/라틴/아랍)·출신학교 등급·논문 게재지를 요인으로 바꿔가며 총 4,320회 API 호출로 실험했다
10점 만점 점수에서 이름의 인종적 느낌 차이는 통계적으로 유의하지 않았지만(±0.094, 신뢰구간이 0을 포함), 출신학교 등급이 최상위(MIT급)에서 최하위(무순위)로 내려갈수록 점수가 평균 0.297점 낮아졌다
출신학교 명성 효과(+0.185)와 출신국가(선진국/개발도상국) 효과(+0.126)를 분리해 비교했더니 명성 효과가 국가 효과보다 1.5배 컸고, 같은 명성이면 후진국 명문대(UNAM)가 선진국 무명대학(Framingham State)보다 낮은 점수를 받지 않아 순수 국가 편견이 원인이 아님을 확인했다
논문 게재지 명성(Nature vs 주변부 오픈액세스 학술지)과 출신학교 명성을 교차 실험하니, 게재지 효과(+1.937)가 출신학교 효과(+0.341)보다 5.7배 컸고, Nature 게재는 저명하지 않은 대학(과야킬대) 출신 후보의 점수를 명문대(MIT) 출신보다 더 크게 끌어올리는 '구제 효과'를 보였다
저자들이 새로 제시한 중립성 편향 지수(NBI)로 분석하면, 저명하지 않은 학교 출신 후보는 평균 점수만 낮은 게 아니라 같은 조건에서도 평가가 더 들쭉날쭉해(불확실성 요소 I 높음), 평균값만 보는 기존 감사 방식이 놓치는 불이익이 존재했다
Figure 1: Study 1 – Institution-Tier Gradient by Model with 95% Bootstrap CI (cross-model).
Table 1: Study 1 – Mean Score by Institution Tier. Cross-model CI from 10,000 bootstrap iterations. ✓ = 95% CI entirely positive.
Model
T1 MIT
T2 UChile
T3 UNAL
T5 UGye
Gradient T1−T5
95% CI
Claude Haiku 4.5
7.433
7.233
7.222
7.133
+0.300
[+0.111,+0.478]
GPT-4o-mini
8.378
8.233
8.211
8.156
+0.222
[+0.022,+0.422]
Gemini 2.0 Flash
7.556
7.378
7.311
7.189
+0.367
[+0.133,+0.611]
Llama 3.1 8B
7.678
7.444
7.589∗
7.378
+0.300
[+0.044,+0.556]
Cross-model
7.761
7.572
7.583
7.464
+0.297
[+0.175,+0.422] ✓
Figure 2: Study 2 – 2×2 Prestige × Country Cell Means by Model.
Table 2: Study 1 – Mean Score by Name Origin. Bootstrap CIs cross zero for all contrasts (⇒ non-significant).
Model
Anglo
Latino
Arabic
Max gap
Significant?
Claude Haiku 4.5
7.208
7.233
7.325
0.117
No
GPT-4o-mini
8.217
8.250
8.267
0.050
No
Gemini 2.0 Flash
7.267
7.417
7.392
0.150
No
Llama 3.1 8B
7.467
7.550
7.550
0.083
No
Cross-model
7.540
7.612
7.633
0.094
No (CI ∋ 0)
Figure 3: Study 3 – 2×2 Journal × Institution Prestige. The “rescue effect” cell (UGye + Nature) shows the largest journal premium (Δ=+2.13), indicating that Nature publication compensates for low institutional prestige more than for high institutional prestige.
Table 3: Study 2 – 2×2 Cell Means and Factorial Effects with 95% Bootstrap CIs. † = CI entirely positive (significant). Dev = Developed; Dvlp = Developing.
Model
MIT
UNAM
FSU
UGye
Prestige (95% CI)
Country (95% CI)
(Hi,Dev)
(Hi,Dvlp)
(Lo,Dev)
(Lo,Dvlp)
Haiku 4.5
7.411
7.233
7.011
7.144
+0.244† [+0.106,+0.383]
+0.022 [−0.117,+0.167]
GPT-4o-mini
8.389
8.222
8.178
8.156
+0.139† [+0.000,+0.278]
+0.094 [−0.044,+0.233]
Gemini 2.0F
7.578
7.300
7.300
7.167
+0.206† [+0.039,+0.372]
+0.206† [+0.044,+0.372]
Llama 3.1 8B
7.656
7.344
7.378
7.322
+0.150 [−0.045,+0.344]
+0.183 [−0.017,+0.378]
Cross-model
7.758
7.525
7.467
7.447
+0.185† [+0.093,+0.275]
+0.126† [+0.037,+0.218]
Table 4: Study 2 – Critical Contrast: UNAM (Mexico, high prestige) vs. Framingham State (USA, low prestige).
Model
UNAM
Framingham St.
UNAM−FSU
Interpretation
Claude Haiku 4.5
7.233
7.011
+0.222
Prestige wins
GPT-4o-mini
8.222
8.178
+0.044
≈ Equal
Gemini 2.0 Flash
7.300
7.300
±0.000
≈ Equal
Llama 3.1 8B
7.344
7.378
−0.033
≈ Equal
Cross-model
7.525
7.467
+0.058
[−0.072,+0.186] – trend, n.s.
Table 5: Study 2 – Prestige vs. Country Effect by Domain with 95% Bootstrap CIs. † = CI entirely positive. ∗∗ = normatively unjustified (no legitimate weight under anti-discrimination principles).
Domain
Prestige effect (95% CI)
Country effect (95% CI)
Dominant
Note
Scholarship
+0.160[−0.021,+0.340]
+0.090[−0.090,+0.271]
—
Partially justified
Hiring
+0.160†[+0.035,+0.292]
+0.187†[+0.062,+0.312]
Country
Partially justified
Credit
+0.278†[+0.076,+0.479]
+0.264†[+0.062,+0.465]
Prestige
Not justified ∗∗
Health
+0.125[−0.076,+0.326]
+0.097[−0.104,+0.299]
—
Partially justified
Public Policy
+0.201†[+0.028,+0.375]
−0.007[−0.181,+0.167]
Prestige
Not justified ∗∗
Table 6: Study 3 – 2×2 Journal × Institution Prestige Cell Means. All four models, 5 domains, 3 names, 6 reps per cell. † = 95% bootstrap CI entirely positive.
Nature (hi-journal)
NCML (lo-journal)
MIT (hi-inst)
UGye (lo-inst)
MIT (hi-inst)
UGye (lo-inst)
Mean score
7.971
7.822
6.225
5.694
Journal effect (institution row)
ΔMIT=+1.746†[+1.564,+1.925]
ΔUGye=+2.128†[+1.950,+2.297]
Cross-cell main effects:
Journal (Nature−NCML)
+1.937† [+1.811,+2.062]
Institution (MIT−UGye)
+0.341† [+0.184,+0.504]
Ratio journal/institution
5.7×
Interaction (rescue effect)
−0.382 (Nature rescues UGye more than MIT)
Table 7: Study 3 – Per-Model Journal and Institution Prestige Effects with 95% CIs. † = CI entirely positive.
Model
Journal effect (95% CI)
Institution effect (95% CI)
Claude Haiku 4.5
+2.937†[+2.733,+3.139]
+0.232[−0.128,+0.594]
GPT-4o-mini
+1.322†[+1.139,+1.506]
+0.099[−0.133,+0.328]
Gemini 2.0 Flash
+2.611†[+2.372,+2.844]
+0.598†[+0.244,+0.956]
Llama 3.1 8B
+0.875†[+0.694,+1.053]
+0.430†[+0.231,+0.631]
Cross-model
+1.937†[+1.811,+2.062]
+0.341†[+0.184,+0.504]
Table 8: NBI ⟨T,I,F⟩ for Reference (Anglo-MIT) and T5 Profiles.
Model
Profile
T
I
F
Interpretation
Haiku 4.5
Anglo T1 (ref)
0.740
0.079
0.000
Reference
Anglo T5
0.710
0.118
0.030
Prestige penalty
Latino T5
0.707
0.109
0.033
Prestige penalty
Arabic T5
0.723
0.109
0.017
Prestige penalty
GPT-4o-mini
Anglo T1 (ref)
0.828
0.126
0.000
Reference
Anglo T5
0.811
0.126
0.017
Prestige penalty
Latino T5
0.809
0.125
0.020
Prestige penalty
Arabic T5
0.811
0.126
0.017
Prestige penalty
Gemini 2.0F
Anglo T1 (ref)
0.753
0.139
0.000
Reference
Anglo T5
0.705
0.126
0.046
Prestige penalty
Latino T5
0.723
0.108
0.033
Prestige penalty
Arabic T5
0.727
0.104
0.027
Prestige penalty
Llama 3.1 8B
Anglo T1 (ref)
0.780
0.115
0.000
Reference
Anglo T5
0.722
0.187
0.057
Strongest bias
Latino T5
0.747
0.153
0.033
Prestige penalty
Arabic T5
0.743
0.134
0.037
Prestige penalty
왜 중요한가
채용, 장학금, 대출심사, 연구비 배분 등에 AI 평가 도구가 실제로 쓰이기 시작하는 상황에서, 이름 기반 편향만 검사해 '공정하다'고 판단하면 학교 간판이나 논문 게재지 기반의 더 강력한 편향을 놓칠 수 있다는 경고다. 특히 개발도상국 연구자나 비명문대 출신에게 실질적으로 불리하게 작용할 수 있는 구조를 실증적으로 드러냈다.
이 논문의 용어
부트스트랩 신뢰구간(bootstrap CI) · 표본을 여러 번 무작위로 다시 뽑아(재표집) 결과값의 신뢰구간을 통계적으로 추정하는 방법
중립성 편향 지수(NBI, Neutrosophic Bias Index) · 참(T)·불확실(I)·거짓(F) 세 값으로 편향을 표현하는 이 논문의 새 지표로, 평균 점수 차이뿐 아니라 평가의 불확실성까지 함께 측정한다
요인설계(factorial design) · 이름, 학교 등급, 국가, 게재지 같은 여러 요인을 동시에 바꿔가며 각 요인의 독립적 효과를 분리해내는 실험 설계 방식
구제 효과(rescue effect) · 저명한 학술지에 논문을 게재한 것이 출신 학교의 낮은 명성을 벌충해주는 효과