컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다

arXiv:2608.123872026-08-14

Query Timing Produces Opposite Positional Biases Between LLMs and Humans

증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다

사람은 증거를 하나씩 볼 때마다 판단을 물으면 나중에 나온 증거에 휘둘리지만, 끝에 한 번만 물으면 편향이 사라진다는 연구가 있었다. 이 논문은 GPT, Claude 등 LLM에게 똑같은 실험을 시켜봤더니 정반대 결과가 나왔다는 것을 보여준다. 즉 LLM은 중간중간 물을 때는 편향이 거의 없고, 끝에 한 번에 물을 때 오히려 나중에 나온 증거를 더 믿는 편향이 강하게 나타났다.

METAL MEDIA 해설 도표

증거를 언제 판단하게 시키느냐에 따라 AI 재판관이 사람과 정반대로 편향된다

  1. 01형사, 학사 비위, 사내 비위 세 가지 가상의 사건 시나리오를 만들어 GPT와 Claude 계열, 그리고 오픈소스 모델들에 검사 측 증거 4개와 변호 측 증거 4개를 순서를 바꿔가며 제시했다
  2. 02증거를 하나씩 보여줄 때마다 중간 질문을 하는 방식(Step-by-Step, SbS)과 한쪽 증거를 다 보여준 뒤에만 질문하는 방식(End-of-Sequence, EoS) 두 가지로 나눠 비교했고, 각 조건을 30번씩 반복 실행해 유죄 판단 비율을 비교했다
  3. 03통계 검정 결과 대부분 모델에서 SbS 방식일 때는 순서에 따른 차이가 유의미하지 않았지만, EoS 방식일 때는 나중에 제시된 증거 쪽에 더 유리한 판단을 내리는 recency 편향이 뚜렷하게 나타났다
  4. 04GPT 3.5 Turbo나 Claude 3 Haiku 같은 이전 모델들은 두 방식 모두에서 편향이 거의 없었지만, GPT 4o나 Claude 3.7 Sonnet, Claude 4 Sonnet 같은 최신 모델일수록 EoS 방식에서 편향이 더 강해지는 경향을 보였다
  5. 05Gemini 2.5 Flash는 두 방식 모두에서 유의미한 편향이 나타나지 않아 예외였고, 오픈소스 모델들은 GPT나 Claude보다 결과가 일관되지 않았다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 형사, 학사 비위, 사내 비위 세 가지 가상의 사건 시나리오를 만들어 GPT와 Claude 계열, 그리고 오픈소스 모델들에 검사 측 증거 4개와 변호 측 증거 4개를 순서를 바꿔가며 제시했다
  2. 증거를 하나씩 보여줄 때마다 중간 질문을 하는 방식(Step-by-Step, SbS)과 한쪽 증거를 다 보여준 뒤에만 질문하는 방식(End-of-Sequence, EoS) 두 가지로 나눠 비교했고, 각 조건을 30번씩 반복 실행해 유죄 판단 비율을 비교했다
  3. 통계 검정 결과 대부분 모델에서 SbS 방식일 때는 순서에 따른 차이가 유의미하지 않았지만, EoS 방식일 때는 나중에 제시된 증거 쪽에 더 유리한 판단을 내리는 recency 편향이 뚜렷하게 나타났다
  4. GPT 3.5 Turbo나 Claude 3 Haiku 같은 이전 모델들은 두 방식 모두에서 편향이 거의 없었지만, GPT 4o나 Claude 3.7 Sonnet, Claude 4 Sonnet 같은 최신 모델일수록 EoS 방식에서 편향이 더 강해지는 경향을 보였다
  5. Gemini 2.5 Flash는 두 방식 모두에서 유의미한 편향이 나타나지 않아 예외였고, 오픈소스 모델들은 GPT나 Claude보다 결과가 일관되지 않았다
Table 1: Verdict proportions for academic misconduct.
EoSSbS
ModelDPPDDPPD
GPT 4o *1.000.0330.300.033
Claude 3.7 Sonnet *1.000.4330.9670.833
Claude 4 Sonnet *1.000.201.000.967
Gemini 2.5 Flash1.001.001.001.00
Llama-4-Maverick1.000.80.60.033
Qwen2.5-72b-Turbo *0.5670.1331.001.00
Table 2: Verdict proportions for social misconduct.
EoSSbS
ModelDPPDDPPD
GPT 4o *0.26670.000.000.00
Claude 3.7 Sonnet *0.9670.000.10.00
Claude 4 Sonnet *0.9670.000.3670.067
Gemini 2.5 Flash0.5670.4670.300.33
Llama-4-Maverick *0.9670.000.1670.00
Qwen2.5-72b-Turbo *0.90.0330.3670.167
Table 3: Verdict proportions for criminal misconduct.
EoSSbS
ModelDPPDDPPD
GPT 4o *1.000.201.000.867
Claude 3.7 Sonnet *0.9670.000.8331.00
Claude 4 Sonnet *0.9670.000.9330.867
Gemini 2.5 Flash0.90.70.80.833
Llama-4-Maverick *0.8670.0330.80.933
Qwen2.5-72b-Turbo0.8330.71.001.00
Table 4: Verdict proportions for criminal misconduct under SbS-Compressed condition.
ModelDPPD
GPT 4o0.9000.900
Gemini 2.5 Flash0.6670.600
Claude 4 Sonnet (4-6)0.0330.233
Claude 4 Sonnet (4-20250514)1.0000.400
Meta Llama0.1330.100
Qwen1.0001.000

왜 중요한가

LLM을 재판, 채용, 평가처럼 실제 결정을 내리는 데 쓰는 사례가 늘고 있는데, 증거를 언제 어떻게 제시하느냐만으로 결과가 뒤바뀔 수 있다는 것은 이런 시스템을 그대로 믿기 어렵다는 뜻이다. 게다가 이 편향이 최신 모델일수록 더 심해진다는 점은 모델이 좋아진다고 저절로 해결되는 문제가 아님을 보여준다.

이 논문의 용어

  • positional bias (위치 편향) · 증거나 정보를 어떤 순서로 제시하느냐에 따라 판단이 달라지는 현상
  • recency bias (최신성 편향) · 가장 나중에 접한 정보에 더 큰 영향을 받는 편향
  • primacy bias (초두 편향) · 가장 먼저 접한 정보에 더 큰 영향을 받는 편향
  • SbS / EoS (Step-by-Step / End-of-Sequence) · 증거를 하나씩 볼 때마다 판단을 묻는 방식과, 모든 증거를 다 본 뒤 한 번만 판단을 묻는 방식
  • LLM-as-a-judge · 대형언어모델을 사람 대신 평가자나 판단자로 활용하는 방식

본문에 싣지 못한 그림

  • Figure 1: Changes in proportion of ”guilty” verdicts across GPT model family for criminal misconduct setting
  • Figure 2: Changes in proportion of ”guilty” verdicts across Claude models for criminal misconduct setting
원문에서 그림 보기 →

저자 · Jasin Cekinmez, Addison J. Wu, Thomas L. Griffiths

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사