최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
연구팀은 2023년부터 지금까지 나온 68개 AI 모델에게 창의성을 요구하는 질문들을 던지고 답변들이 서로 얼마나 다른지 측정했다. 그 결과 시간이 지날수록 서로 다른 회사가 만든 모델들의 답변이 점점 비슷해지는 경향이 통계적으로 뚜렷하게 나타났다. 연구팀은 이런 흐름이 계속되면 AI가 사람의 창의적 작업을 도울 때 오히려 아이디어의 폭을 좁힐 수 있다고 경고한다.
METAL MEDIA 해설 도표
최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- 01'물건의 색다른 용도 말하기'(AUT)라는 표준 창의성 테스트와 실제 사용자 질문 100개를 모은 Infinity-Chat100 두 세트를 12개 회사, 68개 모델에 똑같이 물어봤다
- 02각 답변을 문장을 숫자벡터로 바꾸는 임베딩 기법으로 변환한 뒤 답변끼리 얼마나 다른지(코사인 거리)를 계산하고, 출시 시기를 9개 구간으로 나눠 회귀분석했다
- 03같은 회사 모델끼리는 원래 비슷할 수 있으므로 서로 다른 회사 모델끼리만 비교했고, 특정 회사 모델이 결과를 과대표하지 않도록 1000번 반복 표본추출로 결과를 검증했다
- 04AUT 테스트에서는 답변 간 차이가 초기 약 0.50에서 최근 0.40 이하로 크게 줄었고, 실제 사용자 질문 모음에서도 약 0.34에서 0.32로 완만하지만 꾸준히 줄어들었으며 1000번의 반복 검증 모두 감소 추세를 보였다
무엇을 했나
- '물건의 색다른 용도 말하기'(AUT)라는 표준 창의성 테스트와 실제 사용자 질문 100개를 모은 Infinity-Chat100 두 세트를 12개 회사, 68개 모델에 똑같이 물어봤다
- 각 답변을 문장을 숫자벡터로 바꾸는 임베딩 기법으로 변환한 뒤 답변끼리 얼마나 다른지(코사인 거리)를 계산하고, 출시 시기를 9개 구간으로 나눠 회귀분석했다
- 같은 회사 모델끼리는 원래 비슷할 수 있으므로 서로 다른 회사 모델끼리만 비교했고, 특정 회사 모델이 결과를 과대표하지 않도록 1000번 반복 표본추출로 결과를 검증했다
- AUT 테스트에서는 답변 간 차이가 초기 약 0.50에서 최근 0.40 이하로 크게 줄었고, 실제 사용자 질문 모음에서도 약 0.34에서 0.32로 완만하지만 꾸준히 줄어들었으며 1000번의 반복 검증 모두 감소 추세를 보였다

| Dataset | Models (Pairs) | Slope per Bin | 95% CI |
|---|---|---|---|
| Alternate Uses Task | 68 (273) | −0.01385 | [−0.01695,−0.01044] |
| Infinity-Chat | 67 (268) | −0.00167 | [−0.00267,−0.00074] |

| AUT | Infinity-Chat100 | |||
|---|---|---|---|---|
| Model | Observed | Missing | Observed | Missing |
| minimax/minimax-01 | 0 | 10 | 0 | 100 |
| minimax/minimax-m1 | 6 | 4 | 0 | 100 |
| mistralai/mistral-small-3.1-24b-instruct | 10 | 0 | 89 | 11 |
| qwen/qwen3.6-max-preview | 2 | 8 | 100 | 0 |
| qwen/qwen3-max | 10 | 0 | 94 | 6 |
| meta-llama/llama-3.2-3b-instruct | 10 | 0 | 97 | 3 |
| anthropic/claude-fable-5 | 10 | 0 | 99 | 1 |
| minimax/minimax-m2.1 | 10 | 0 | 99 | 1 |
| qwen/qwen-2.5-72b-instruct | 10 | 0 | 99 | 1 |
| All 69 models | 668 | 22 | 6,677 | 223 |

왜 중요한가
여러 AI 서비스에 매일 수십억 건의 메시지가 오가고 그중 상당수가 아이디어 구상이나 글쓰기 같은 창작 목적인데, 서로 다른 AI들이 점점 비슷한 답만 내놓는다면 사람들이 접하는 생각의 폭 자체가 줄어들 수 있다. 이는 AI를 창작 파트너로 계속 신뢰해도 되는지, 사람의 창의성에 AI가 어떤 영향을 미치는지에 대한 중요한 경고 신호다.

이 논문의 용어
- Alternate Uses Task(AUT) · 책, 신발 같은 흔한 물건의 색다른 용도를 최대한 많이 말하게 해 창의적 사고를 측정하는 심리학 테스트
- Infinity-Chat100 · 실제 사용자들이 AI 챗봇에게 던진 개방형 질문 100개를 모은 데이터셋
- 임베딩(embedding) · 문장의 의미를 숫자로 이루어진 벡터로 표현해 컴퓨터가 비교할 수 있게 만든 것
- 코사인 거리 · 두 벡터(여기서는 두 답변)의 의미가 얼마나 다른지를 방향 차이로 계산한 값, 값이 작을수록 비슷함
- 크로스패밀리(cross-family) 비교 · 같은 회사 모델끼리가 아니라 서로 다른 회사가 만든 모델끼리만 비교하는 방식
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Nirav Patel et al., arXiv:2608.19437, CC BY 4.0