물건이 어디로 옮겨졌는지 추적하는 능력, AI는 4억 파라미터부터 이미 사람 수준
물건이 어디로 옮겨졌는지 추적하는 능력, AI는 4억 파라미터부터 이미 사람 수준
연구팀은 사람 48명과 여러 크기의 언어모델에게 '물건을 이 상자에서 저 서랍으로 옮기는' 식의 자연스러운 짧은 이야기를 읽히고, 마지막에 물건이 어디 있는지 맞히게 했다. 사람은 이야기가 복잡해질수록(등장하는 물건과 이동 횟수가 늘수록) 정답률이 뚜렷이 떨어졌지만, 최신 700억 파라미터급 모델(Llama 3.3, Qwen 2.5)은 복잡도와 무관하게 거의 만점을 유지했다. 완전 공개된 소형 모델들을 분석한 결과, 사람 수준의 추적 능력은 이미 4억 1000만 파라미터 모델에서 나타났고, 모델 크기가 커질수록 꾸준히 향상되었다.
METAL MEDIA 해설 도표
물건이 어디로 옮겨졌는지 추적하는 능력, AI는 4억 파라미터부터 이미 사람 수준
- 01다섯 단계 복잡도(물건 1~4개, 이동 여러 번)의 짧은 이야기를 만들어 사람과 언어모델에게 동일하게 테스트했다. 정답을 직접 답하게 하는 방식(명시적 과제)과, 정답 문장과 오답 문장 중 어느 쪽이 더 그럴듯한지 확률로 비교하는 방식(암묵적 과제) 두 가지를 병행했다.
- 02사람은 복잡도가 오를수록 정확도가 뚜렷이 떨어졌다(명시적 과제 87.2%→65.0%, 암묵적 과제 89.0%→76.0%). 이 저하는 이야기가 단순히 길어져서 최근 언급된 내용을 잊는 효과(최신성 효과)가 아니라 추적해야 할 대상이 늘어나는 복잡성 자체 때문임을 통계적으로 확인했다.
- 03완전 공개된 Pythia(7000만~120억 파라미터), OLMo 2(10억~320억 파라미터) 모델군을 비교하니, 크기가 커질수록 정확도가 대체로 올라갔다(Pythia는 7000만에서 53.5%였다가 120억에서 89.6%로 상승). 4억 1000만 파라미터 모델이 이미 사람 수준의 정확도를 보였는데, 이는 기존 연구가 필요하다고 본 규모(코드 특화 학습을 받은 130억 파라미터 이상)보다 훨씬 작다.
- 04질문에 직접 답하도록 추가 훈련(지시 튜닝)을 받은 모델은 명시적 과제 점수는 크게 올랐지만(최대 52.4%p 상승) 암묵적 과제 점수는 거의 그대로였다. 이는 지시 튜닝이 답을 표현하는 능력만 키울 뿐, 물건 위치를 실제로 추적하는 내부 능력 자체를 늘리는 것은 아님을 시사한다.
- 05이야기 속 물건 이름을 실제 단어, 발음만 그럴듯한 가짜 단어, 있을 법하지 않은 단어로 바꿔도 모델의 정확도는 거의 변하지 않았다(3%p 이내). 이는 모델이 단어 연상이 아니라 이야기의 사건 구조 자체를 따라가며 추적하고 있다는 근거다.
무엇을 했나
- 다섯 단계 복잡도(물건 1~4개, 이동 여러 번)의 짧은 이야기를 만들어 사람과 언어모델에게 동일하게 테스트했다. 정답을 직접 답하게 하는 방식(명시적 과제)과, 정답 문장과 오답 문장 중 어느 쪽이 더 그럴듯한지 확률로 비교하는 방식(암묵적 과제) 두 가지를 병행했다.
- 사람은 복잡도가 오를수록 정확도가 뚜렷이 떨어졌다(명시적 과제 87.2%→65.0%, 암묵적 과제 89.0%→76.0%). 이 저하는 이야기가 단순히 길어져서 최근 언급된 내용을 잊는 효과(최신성 효과)가 아니라 추적해야 할 대상이 늘어나는 복잡성 자체 때문임을 통계적으로 확인했다.
- 완전 공개된 Pythia(7000만~120억 파라미터), OLMo 2(10억~320억 파라미터) 모델군을 비교하니, 크기가 커질수록 정확도가 대체로 올라갔다(Pythia는 7000만에서 53.5%였다가 120억에서 89.6%로 상승). 4억 1000만 파라미터 모델이 이미 사람 수준의 정확도를 보였는데, 이는 기존 연구가 필요하다고 본 규모(코드 특화 학습을 받은 130억 파라미터 이상)보다 훨씬 작다.
- 질문에 직접 답하도록 추가 훈련(지시 튜닝)을 받은 모델은 명시적 과제 점수는 크게 올랐지만(최대 52.4%p 상승) 암묵적 과제 점수는 거의 그대로였다. 이는 지시 튜닝이 답을 표현하는 능력만 키울 뿐, 물건 위치를 실제로 추적하는 내부 능력 자체를 늘리는 것은 아님을 시사한다.
- 이야기 속 물건 이름을 실제 단어, 발음만 그럴듯한 가짜 단어, 있을 법하지 않은 단어로 바꿔도 모델의 정확도는 거의 변하지 않았다(3%p 이내). 이는 모델이 단어 연상이 아니라 이야기의 사건 구조 자체를 따라가며 추적하고 있다는 근거다.
| Template | Objects |
|---|---|
| Standard | ring, key, postcard, pen, bookmark, book, wallet, watch, coin, photo, scarf, letter |
| Pseudoword | rint, kel, pothlard, pes, boolmarm, bood, gallel, wawed, coft, knolo, scact, lunter |
| Improbable | |
| Rare | kidney, squid, brick, urn |
| Phys. Impos. | volcano, mountain, skyscraper, cathedral |
| Abstract | happiness, silence, justice, peace |
왜 중요한가
이 연구는 언어모델이 겉으로만 그럴듯한 문장을 만드는 게 아니라, 이야기 속에서 벌어지는 일을 실제로 따라가며 이해하고 있는지 가늠하는 새로운 잣대를 제시한다. 기존 연구들이 사람과의 비교 없이 인위적인 퍼즐식 과제로 '대형 코드 특화 모델만 가능하다'고 결론 낸 것과 달리, 훨씬 작고 자연스러운 조건에서도 이 능력이 이미 존재한다는 걸 보여줘, 모델 능력 평가 방식 자체를 다시 생각하게 만든다.
이 논문의 용어
- 엔티티 추적(entity tracking) · 이야기 속 사물이나 인물의 상태·위치가 명시적으로 언급되지 않아도 문맥을 통해 계속 파악하는 능력
- 명시적/암묵적 과제 · 명시적 과제는 답을 직접 생성하게 하는 방식, 암묵적 과제는 정답 문장과 오답 문장 중 어느 쪽 확률이 더 높은지 비교하는 방식
- 지시 튜닝(instruction tuning) · 질문에 바로 답하도록 모델을 추가로 학습시키는 과정
- 가짜 단어(pseudoword) · 실제 뜻은 없지만 발음이 그 언어답게 자연스러운 단어
- 복잡도(situational complexity) · 이야기에서 추적해야 할 물건 수와 이동 횟수로 정의한 난이도
본문에 싣지 못한 그림
- Figure 1: Conceptual overview. Left: language understanding requires tracking entities in an internal model of discourse context, as a narrative unfolds. Right: in humans (top), entity tracking accuracy decreases with situational complexity; in language models (bottom), we find a similar pattern, and an increase in capability with scale.
- Figure 2: Overview of the experimental design. The top panel displays a simplified narrative at complexity 3, with two target objects (F0, F1). The bottom panels show the two evaluation formats: an explicit open recall task (left) requiring generation of the correct final location of the evaluated object, and an implicit task (right) administered as a forced-choice selection for human participants and as a probability read-out comparing correct versus incorrect continuations for language models. For full example narratives at multiple complexitiy levels, see Appendix D.
- Figure 3: Humans show declining accuracy with increasing complexity while contemporary 70B LMs (Llama 3.3 and Qwen 2.5) maintain ceiling performance. (A) Explicit entity tracking task. (B) Implicit entity tracking task. Error bars represent 95% confidence intervals.
- Figure 4: Model scaling effects on implicit entity tracking accuracy. (A) Pythia models (70M to 12B parameters). (B) OLMo 2 base models (1B to 32B parameters). Larger models generally show improved performance, with the exception of OLMo 32B-base.
- Figure 5: Instruction tuning effects on OLMo 2 models (A) Explicit task. (B) Implicit task. Instruction tuning substantially improves explicit task performance, with gains increasing with model size. In contrast, instruction tuning has mixed effects on implicit task performance.
- Figure 6: (A) Examples of standard, pseudoword, and improbable object types used in the stimuli. (B) Explicit task accuracy. (C) Implicit task accuracy. Object type does not affect model performance.
- Figure 7: OLMo 2 Instruct models on the explicit (generation) task. Instruction-tuned models show substantial scaling effects, with accuracy improving from 55% (1B) to 94% (32B) overall. The 32B model maintains high accuracy even at C5, while smaller instruction-tuned models show steep performance declines with increasing complexity.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다