AI가 확신할 근거가 부족할 때도 자꾸 단정적으로 답하는 이유를, 모델 내부 회로를 뜯어서 찾아냈다
AI가 확신할 근거가 부족할 때도 자꾸 단정적으로 답하는 이유를, 모델 내부 회로를 뜯어서 찾아냈다
연구진은 Qwen3-4B라는 언어모델이 '확실하지 않은 상황'에서도 자신 있게 답하는 과잉확신 현상을 언어 표현(어쩌면, 아마도 같은 표현), 모른다고 답하기(기권), 1~5점 확신도 점수 세 가지 방식으로 살펴봤다. 그 결과 모델 내부에는 '확신'을 만드는 넓고 공유된 기본 회로와, '불확실'을 만드는 작고 특화된 소수의 회로가 따로 있다는 것을 발견했다. 이 불확실 담당 회로를 인위적으로 더 세게 작동시키면 잘못된 과잉확신 답변의 상당수를 실제로 고칠 수 있었다.
METAL MEDIA 해설 도표
AI가 확신할 근거가 부족할 때도 자꾸 단정적으로 답하는 이유를, 모델 내부 회로를 뜯어서 찾아냈다
- 01논문은 논리적으로 답이 확실히 정해지는 상황(필연)과 확실하지 않은 상황(가능성)을 통제된 이야기 문제로 만들어, Qwen3-4B가 세 가지 방식(어쩌면/아마도 같은 말투, 모른다고 기권하기, 1~5점 확신 점수)으로 얼마나 정확하게 불확실함을 표현하는지 측정했다.
- 02확실해야 하는 상황에서는 모델이 항상 확신 있게 답했지만, 불확실해야 하는 상황에서도 말투 방식에서는 14%, 기권 방식에서는 27%, 점수 방식에서는 무려 80%나 틀리게 확신에 찬 답을 냈다. 특히 점수로 답하게 하면 거의 항상 최고점인 5점을 줘서 가장 신뢰하기 어려운 방식으로 나타났다.
- 03모델 내부를 뜯어보는 해석가능성 기법(circuit-tracer, 트랜스코더 특징 분석)을 이용해, 확신을 만드는 데는 여러 특징이 폭넓게 관여하는 반면 불확실을 만드는 데는 소수의 전담 특징만 관여한다는 비대칭 구조를 찾아냈다.
- 04이 소수의 불확실 담당 특징들을 인위적으로 2.5배 이상 증폭시키자, 원래 틀리게 확신했던 사례 중 약 94%가 올바른 불확실 표현으로 고쳐졌다. 같은 특징을 증폭시키자 기권(모른다) 방식의 정확도도 72.7%에서 82.7%로 올랐고, 중국어와 이탈리아어로 번역한 문제에서도 비슷한 효과가 나타나 언어와 상관없이 작동하는 추상적인 불확실 신호임이 확인됐다.
- 05다만 숫자 점수 방식은 이미 5점 쪽으로 확률이 거의 포화되어 있어서, 같은 개입을 해도 거의 개선되지 않았다. 이는 숫자 점수로 확신도를 물어보는 방식 자체가 구조적으로 신뢰하기 어렵다는 것을 시사한다.
무엇을 했나
- 논문은 논리적으로 답이 확실히 정해지는 상황(필연)과 확실하지 않은 상황(가능성)을 통제된 이야기 문제로 만들어, Qwen3-4B가 세 가지 방식(어쩌면/아마도 같은 말투, 모른다고 기권하기, 1~5점 확신 점수)으로 얼마나 정확하게 불확실함을 표현하는지 측정했다.
- 확실해야 하는 상황에서는 모델이 항상 확신 있게 답했지만, 불확실해야 하는 상황에서도 말투 방식에서는 14%, 기권 방식에서는 27%, 점수 방식에서는 무려 80%나 틀리게 확신에 찬 답을 냈다. 특히 점수로 답하게 하면 거의 항상 최고점인 5점을 줘서 가장 신뢰하기 어려운 방식으로 나타났다.
- 모델 내부를 뜯어보는 해석가능성 기법(circuit-tracer, 트랜스코더 특징 분석)을 이용해, 확신을 만드는 데는 여러 특징이 폭넓게 관여하는 반면 불확실을 만드는 데는 소수의 전담 특징만 관여한다는 비대칭 구조를 찾아냈다.
- 이 소수의 불확실 담당 특징들을 인위적으로 2.5배 이상 증폭시키자, 원래 틀리게 확신했던 사례 중 약 94%가 올바른 불확실 표현으로 고쳐졌다. 같은 특징을 증폭시키자 기권(모른다) 방식의 정확도도 72.7%에서 82.7%로 올랐고, 중국어와 이탈리아어로 번역한 문제에서도 비슷한 효과가 나타나 언어와 상관없이 작동하는 추상적인 불확실 신호임이 확인됐다.
- 다만 숫자 점수 방식은 이미 5점 쪽으로 확률이 거의 포화되어 있어서, 같은 개입을 해도 거의 개선되지 않았다. 이는 숫자 점수로 확신도를 물어보는 방식 자체가 구조적으로 신뢰하기 어렵다는 것을 시사한다.
왜 중요한가
의료나 정보 분석처럼 실수가 위험한 분야에서 AI를 쓸 때, 모델이 정말 자신 있는지 아니면 근거 없이 확신하는 척하는지 구분하는 것은 매우 중요하다. 이 연구는 모델이 왜 과잉확신하는지를 내부 회로 수준에서 설명하고, 실제로 그 회로를 조작해 오류를 줄일 수 있음을 보여줘 더 신뢰할 수 있는 AI 설계에 실마리를 준다.
이 논문의 용어
- 과잉확신(overconfidence) · 근거가 부족한데도 단정적으로 확신에 찬 답을 내놓는 경향
- 기권(abstention) · 모른다고 답하며 판단을 유보하는 방식
- 트랜스코더 특징(transcoder feature) · 모델 내부 계산을 사람이 해석할 수 있는 단위로 분해해 보여주는 해석가능성 도구의 구성요소
- 회로(circuit) · 특정 행동(여기선 확신/불확실 표현)을 만들어내는 모델 내부 뉴런·특징들의 연결 경로
- 필연/가능성(necessity/possibility) · 논리적으로 답이 반드시 하나로 정해지는 상황과, 여러 답이 가능해 확실히 정할 수 없는 상황
본문에 싣지 못한 그림
- Figure 1: Qwen3-4B overconfidence in the three settings. Left: accuracy in the certainty and uncertainty scenarios. Right: distribution of the probability on the uncertainty-side response per scenario: in the verbal confidence setting is the summed mass for the observed epistemic tokens P(might,could), in the abstention is the abstention rate, in the numeric confidence is P(score<5). The diamond marks the mean.
- Figure 2: Error intervention on the top-20 uncertainty features for errors (uncertainty scenarios with certainty outputs). Left: graded effect of the boost multiplier on the error samples; P(assertive) decays while P(epistemic) and the rescued correct rate rise, reaching ≈94% from ×2.5 on. Right: per-setting accuracy under the ×3 boost.
- Figure 3: Generalization to the modality task. Change in the number of responses per certainty label under the prototype-value boost: from the baseline (×1) to ×5.
- Figure 4: Accuracy by template and condition for the verbal setting.
- Figure 5: Decomposition of each attribution pool’s total |mean_act| by DFA tag. Errors under-use the possibility-specific coalition (16.9% vs. 30.2% in the possibility prototype) and over-use necessity-specific features; enumeration looks like a properly-fired possibility pass.
- Figure 6: Ablation on correct samples. Progressively suppressing the top-20 possibility-specific features zeroes out possibility accuracy, whereas the symmetric suppression of the top-20 necessity-specific features leaves necessity accuracy at 100%. Random-feature baselines (dotted) are flat in both conditions.
- Figure 7: Cross-lingual transfer of the ×3 uncertainty-feature boost, on errors only (following Section 3.3).
- Figure 8: Prototypical circuits for certainty (left) and uncertainty (right) in Qwen3-4B, under a backward-from-logit node selection. Columns are the Constraints / Question / Answer zones; rows are model layers. Nodes are colored by statistical tag (shared, necessity-specific, possibility-specific) and sized by |mean_inf|; solid and dashed edges go to the assertive and epistemic logit targets respectively, colored by sign. Certainty is carried by a broad distribution of features across layers 22–29, whereas uncertainty concentrates on a sparse set of strongly activated possibility-specific features in the same band.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다