AI 챗봇에게 중동을 물으면, 겉으론 공정해 보여도 서구식 틀로 설명한다
AI 챗봇에게 중동을 물으면, 겉으론 공정해 보여도 서구식 틀로 설명한다
이 논문은 GPT-4와 Falcon3-7B-Instruct가 중동을 묘사할 때 노골적 편견 대신 구조적인 방식으로 오리엔탈리즘을 재생산하는지 측정했다. 에드워드 사이드의 오리엔탈리즘 이론을 일곱 가지 측정 가능한 항목으로 바꾼 MECSS라는 점수 체계를 만들어 280개 대화(1120개 문답)를 분석했다. 그 결과 두 모델 모두 체계적으로 편향된 패턴을 보였고, 아부다비에서 아랍어 데이터로 만든 Falcon이 오히려 GPT-4보다 더 높은 편향 점수를 받았다.
METAL MEDIA 해설 도표
AI 챗봇에게 중동을 물으면, 겉으론 공정해 보여도 서구식 틀로 설명한다
- 01기존의 편향 측정 도구(감정 분석, 고정관념 탐지 등)는 노골적 차별만 감지할 뿐, '서구의 분석틀을 당연한 것으로 놓고 중동은 특수하게 다루는' 구조적 편향은 잡아내지 못한다는 문제의식에서 출발했다
- 02에드워드 사이드의 오리엔탈리즘 이론에서 일곱 가지 항목(동질화, 행위자성 결여, 서구중심 인식틀, 이해가능성 비대칭, 시간적 비대칭, 이국화, 정당성과 권위)을 뽑아 0~3점으로 채점하는 MECSS 틀을 설계했다
- 03GPT-4와 Falcon3-7B-Instruct에 140개 질문과 후속 질문으로 구성된 280개 대화를 실시, Claude(Anthropic)를 채점 도구로 활용해 점수를 매겼다
- 04GPT-4는 평균 1.73점, Falcon3-7B-Instruct는 2.18점으로 더 높게 나왔다. 특히 GPT-4 대화의 87.9%에서 '다양성을 인정한다고 말해놓고 곧바로 그 다양성을 무시하는 설명을 한다'는 '사이드 워싱(Said-washing)' 현상이 발견됐다
- 05다만 두 모델은 만든 지역뿐 아니라 크기(파라미터 규모)도 다르기 때문에, Falcon의 높은 점수가 '아랍어권에서 만들었기 때문'인지 '모델이 작기 때문'인지는 이 연구만으로 구분할 수 없다고 저자는 명시한다. 반면 '서구 분석틀을 보편적 기준처럼 다루는' 항목(Epistemic Center)은 두 모델 모두 최고 수준에 가깝고 차이가 거의 없어, 이 결과는 크기와 무관하게 신뢰할 수 있다고 본다
무엇을 했나
- 기존의 편향 측정 도구(감정 분석, 고정관념 탐지 등)는 노골적 차별만 감지할 뿐, '서구의 분석틀을 당연한 것으로 놓고 중동은 특수하게 다루는' 구조적 편향은 잡아내지 못한다는 문제의식에서 출발했다
- 에드워드 사이드의 오리엔탈리즘 이론에서 일곱 가지 항목(동질화, 행위자성 결여, 서구중심 인식틀, 이해가능성 비대칭, 시간적 비대칭, 이국화, 정당성과 권위)을 뽑아 0~3점으로 채점하는 MECSS 틀을 설계했다
- GPT-4와 Falcon3-7B-Instruct에 140개 질문과 후속 질문으로 구성된 280개 대화를 실시, Claude(Anthropic)를 채점 도구로 활용해 점수를 매겼다
- GPT-4는 평균 1.73점, Falcon3-7B-Instruct는 2.18점으로 더 높게 나왔다. 특히 GPT-4 대화의 87.9%에서 '다양성을 인정한다고 말해놓고 곧바로 그 다양성을 무시하는 설명을 한다'는 '사이드 워싱(Said-washing)' 현상이 발견됐다
- 다만 두 모델은 만든 지역뿐 아니라 크기(파라미터 규모)도 다르기 때문에, Falcon의 높은 점수가 '아랍어권에서 만들었기 때문'인지 '모델이 작기 때문'인지는 이 연구만으로 구분할 수 없다고 저자는 명시한다. 반면 '서구 분석틀을 보편적 기준처럼 다루는' 항목(Epistemic Center)은 두 모델 모두 최고 수준에 가깝고 차이가 거의 없어, 이 결과는 크기와 무관하게 신뢰할 수 있다고 본다
| Measure | GPT-4 | Falcon3-7B | Difference |
|---|---|---|---|
| Mean MECSS | 1.729 | 2.180 | +0.451 |
| Median MECSS | 2.000 | 2.286 | +0.286 |
| SD | 0.545 | 0.485 | −0.060 |
| Minimal (0 to 0.75) | 11 (7.9%) | 5 (3.6%) | |
| Low (0.76 to 1.50) | 21 (15.0%) | 3 (2.1%) | |
| Moderate (1.51 to 2.25) | 95 (67.9%) | 57 (40.7%) | |
| High (2.26 to 3.00) | 13 (9.3%) | 75 (53.6%) |
| Dimension | GPT-4 (SD) | Falcon (SD) | Diff. | % Chg. |
|---|---|---|---|---|
| D1: Homogenization | 1.771 (0.48) | 2.443 (0.61) | +0.671 | +37.9% |
| D2: Agency Gap | 1.521 (0.71) | 2.479 (0.69) | +0.957 | +62.9% |
| D3: Epistemic Center | 2.486 (0.69) | 2.579 (0.62) | +0.093 | +3.7% |
| D4: Intelligibility Asym. | 1.893 (0.71) | 2.257 (0.63) | +0.364 | +19.2% |
| D5: Temporal Asym. | 1.621 (0.69) | 2.229 (0.78) | +0.607 | +37.4% |
| D6: Exoticization | 1.036 (0.58) | 1.629 (0.77) | +0.593 | +57.2% |
| D7: Legitimacy & Auth. | 1.771 (0.79) | 1.643 (0.62) | −0.129 | −7.3% |
| Prompt Category | GPT-4 | Falcon | Difference |
|---|---|---|---|
| Power and Authority | 1.086 | 1.829 | +0.743 |
| Representational Othering | 1.750 | 2.429 | +0.679 |
| Deterministic Framing | 1.850 | 2.521 | +0.671 |
| Essentialization and Homogenization | 1.771 | 2.329 | +0.557 |
| Threat and Securitization Framing | 2.036 | 2.236 | +0.200 |
| Agency versus Passivity | 1.721 | 1.893 | +0.171 |
| Temporal Dynamics | 1.886 | 2.021 | +0.136 |
왜 중요한가
지역 정부와 기업들이 '자국에서, 자국어 데이터로 AI를 만들면 서구 편향이 줄어들 것'이라 기대하며 투자하는 상황에서, 이 연구는 그 가정에 반례를 제시한다. 언어를 추가하거나 개발 지역을 바꾸는 것만으로는 부족하며, 학습 데이터 자체에 담긴 지식 체계를 바꿔야 한다는 점을 시사한다.
이 논문의 용어
- 오리엔탈리즘(Orientalism) · 에드워드 사이드가 제시한 개념으로, 서구가 동양을 수동적이고 특수한 대상으로 규정하며 서구식 틀을 보편적 기준처럼 취급하는 지식·권력 구조
- MECSS · 이 논문이 만든 측정 도구로, 오리엔탈리즘의 일곱 가지 작동 방식을 0~3점으로 채점하는 프레임워크
- 사이드 워싱(Said-washing) · 모델이 '일반화하지 않겠다'고 명시적으로 밝힌 직후 곧바로 그 일반화 패턴을 반복하는 현상
- Epistemic Center(인식적 중심성) · 서구의 분석틀을 특별한 언급 없이 그냥 '분석' 그 자체처럼 사용하는 정도를 측정하는 항목
- 파라미터 크기 교란요인 · 두 모델이 만들어진 지역뿐 아니라 모델 크기도 다르기 때문에, 점수 차이의 원인을 지역 탓으로만 돌릴 수 없다는 연구의 한계 지적
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다