증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다
증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다
사람은 증거를 하나씩 볼 때마다 판단을 물으면 나중에 나온 증거에 휘둘리지만, 끝에 한 번만 물으면 편향이 사라진다는 연구가 있었다. 이 논문은 GPT, Claude 등 LLM에게 똑같은 실험을 시켜봤더니 정반대 결과가 나왔다는 것을 보여준다. 즉 LLM은 중간중간 물을 때는 편향이 거의 없고, 끝에 한 번에 물을 때 오히려 나중에 나온 증거를 더 믿는 편향이 강하게 나타났다.
METAL MEDIA 해설 도표
증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다
- 01형사, 학사 비위, 사내 비위 세 가지 가상의 사건 시나리오를 만들어 GPT와 Claude 계열, 그리고 오픈소스 모델들에 검사 측 증거 4개와 변호 측 증거 4개를 순서를 바꿔가며 제시했다
- 02증거를 하나씩 보여줄 때마다 중간 질문을 하는 방식(Step-by-Step, SbS)과 한쪽 증거를 다 보여준 뒤에만 질문하는 방식(End-of-Sequence, EoS) 두 가지로 나눠 비교했고, 각 조건을 30번씩 반복 실행해 유죄 판단 비율을 비교했다
- 03통계 검정 결과 대부분 모델에서 SbS 방식일 때는 순서에 따른 차이가 유의미하지 않았지만, EoS 방식일 때는 나중에 제시된 증거 쪽에 더 유리한 판단을 내리는 recency 편향이 뚜렷하게 나타났다
- 04GPT 3.5 Turbo나 Claude 3 Haiku 같은 이전 모델들은 두 방식 모두에서 편향이 거의 없었지만, GPT 4o나 Claude 3.7 Sonnet, Claude 4 Sonnet 같은 최신 모델일수록 EoS 방식에서 편향이 더 강해지는 경향을 보였다
- 05Gemini 2.5 Flash는 두 방식 모두에서 유의미한 편향이 나타나지 않아 예외였고, 오픈소스 모델들은 GPT나 Claude보다 결과가 일관되지 않았다
무엇을 했나
- 형사, 학사 비위, 사내 비위 세 가지 가상의 사건 시나리오를 만들어 GPT와 Claude 계열, 그리고 오픈소스 모델들에 검사 측 증거 4개와 변호 측 증거 4개를 순서를 바꿔가며 제시했다
- 증거를 하나씩 보여줄 때마다 중간 질문을 하는 방식(Step-by-Step, SbS)과 한쪽 증거를 다 보여준 뒤에만 질문하는 방식(End-of-Sequence, EoS) 두 가지로 나눠 비교했고, 각 조건을 30번씩 반복 실행해 유죄 판단 비율을 비교했다
- 통계 검정 결과 대부분 모델에서 SbS 방식일 때는 순서에 따른 차이가 유의미하지 않았지만, EoS 방식일 때는 나중에 제시된 증거 쪽에 더 유리한 판단을 내리는 recency 편향이 뚜렷하게 나타났다
- GPT 3.5 Turbo나 Claude 3 Haiku 같은 이전 모델들은 두 방식 모두에서 편향이 거의 없었지만, GPT 4o나 Claude 3.7 Sonnet, Claude 4 Sonnet 같은 최신 모델일수록 EoS 방식에서 편향이 더 강해지는 경향을 보였다
- Gemini 2.5 Flash는 두 방식 모두에서 유의미한 편향이 나타나지 않아 예외였고, 오픈소스 모델들은 GPT나 Claude보다 결과가 일관되지 않았다
| EoS | SbS | |||
|---|---|---|---|---|
| Model | DP | PD | DP | PD |
| GPT 4o * | 1.00 | 0.033 | 0.30 | 0.033 |
| Claude 3.7 Sonnet * | 1.00 | 0.433 | 0.967 | 0.833 |
| Claude 4 Sonnet * | 1.00 | 0.20 | 1.00 | 0.967 |
| Gemini 2.5 Flash | 1.00 | 1.00 | 1.00 | 1.00 |
| Llama-4-Maverick | 1.00 | 0.8 | 0.6 | 0.033 |
| Qwen2.5-72b-Turbo * | 0.567 | 0.133 | 1.00 | 1.00 |
| EoS | SbS | |||
|---|---|---|---|---|
| Model | DP | PD | DP | PD |
| GPT 4o * | 0.2667 | 0.00 | 0.00 | 0.00 |
| Claude 3.7 Sonnet * | 0.967 | 0.00 | 0.1 | 0.00 |
| Claude 4 Sonnet * | 0.967 | 0.00 | 0.367 | 0.067 |
| Gemini 2.5 Flash | 0.567 | 0.467 | 0.30 | 0.33 |
| Llama-4-Maverick * | 0.967 | 0.00 | 0.167 | 0.00 |
| Qwen2.5-72b-Turbo * | 0.9 | 0.033 | 0.367 | 0.167 |
| EoS | SbS | |||
|---|---|---|---|---|
| Model | DP | PD | DP | PD |
| GPT 4o * | 1.00 | 0.20 | 1.00 | 0.867 |
| Claude 3.7 Sonnet * | 0.967 | 0.00 | 0.833 | 1.00 |
| Claude 4 Sonnet * | 0.967 | 0.00 | 0.933 | 0.867 |
| Gemini 2.5 Flash | 0.9 | 0.7 | 0.8 | 0.833 |
| Llama-4-Maverick * | 0.867 | 0.033 | 0.8 | 0.933 |
| Qwen2.5-72b-Turbo | 0.833 | 0.7 | 1.00 | 1.00 |
| Model | DP | PD |
|---|---|---|
| GPT 4o | 0.900 | 0.900 |
| Gemini 2.5 Flash | 0.667 | 0.600 |
| Claude 4 Sonnet (4-6) | 0.033 | 0.233 |
| Claude 4 Sonnet (4-20250514) | 1.000 | 0.400 |
| Meta Llama | 0.133 | 0.100 |
| Qwen | 1.000 | 1.000 |
왜 중요한가
LLM을 재판, 채용, 평가처럼 실제 결정을 내리는 데 쓰는 사례가 늘고 있는데, 증거를 언제 어떻게 제시하느냐만으로 결과가 뒤바뀔 수 있다는 것은 이런 시스템을 그대로 믿기 어렵다는 뜻이다. 게다가 이 편향이 최신 모델일수록 더 심해진다는 점은 모델이 좋아진다고 저절로 해결되는 문제가 아님을 보여준다.
이 논문의 용어
- positional bias (위치 편향) · 증거나 정보를 어떤 순서로 제시하느냐에 따라 판단이 달라지는 현상
- recency bias (최신성 편향) · 가장 나중에 접한 정보에 더 큰 영향을 받는 편향
- primacy bias (초두 편향) · 가장 먼저 접한 정보에 더 큰 영향을 받는 편향
- SbS / EoS (Step-by-Step / End-of-Sequence) · 증거를 하나씩 볼 때마다 판단을 묻는 방식과, 모든 증거를 다 본 뒤 한 번만 판단을 묻는 방식
- LLM-as-a-judge · 대형언어모델을 사람 대신 평가자나 판단자로 활용하는 방식
본문에 싣지 못한 그림
- Figure 1: Changes in proportion of ”guilty” verdicts across GPT model family for criminal misconduct setting
- Figure 2: Changes in proportion of ”guilty” verdicts across Claude models for criminal misconduct setting
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다