문장 9개짜리 감정 이름만으로 AI 속 '긍정-부정' 방향을 찾아내면, 그 방향이 텍스트뿐 아니라 그림, 소리, 심지어 뇌파에서도 똑같이 통했다
문장 9개짜리 감정 이름만으로 AI 속 '긍정-부정' 방향을 찾아내면, 그 방향이 텍스트뿐 아니라 그림, 소리, 심지어 뇌파에서도 똑같이 통했다
언어모델 안에는 문장이 긍정적인지 부정적인지를 나타내는 하나의 내부 방향(V축)이 숨어 있다. 연구자는 라벨 수천 개가 필요한 기존 방식 대신, 감정 단어 9개와 짧은 이야기 약 450개만으로 이 방향을 뽑아냈고, 이렇게 찾은 방향이 이미지·오디오·뇌파를 다루는 서로 다른 인공지능 모델에서도 그대로 나타났다. 이 방향을 모델에서 강제로 지우면 감정 분류 성능이 크게 떨어져, 단순한 상관관계가 아니라 실제로 감정 판단에 쓰이는 핵심 요소임이 확인됐다.
METAL MEDIA 해설 도표
문장 9개짜리 감정 이름만으로 AI 속 '긍정-부정' 방향을 찾아내면, 그 방향이 텍스트뿐 아니라 그림, 소리, 심지어 뇌파에서도 똑같이 통했다
- 01분노, 혐오, 공포, 슬픔, 즐거움 등 9가지 감정 이름과 감정별 짧은 이야기 약 50개(총 450개)만 사용해, 기존 지도학습 방식보다 라벨을 약 1500배 적게 쓰고도 '긍정-부정' 방향(V축)을 찾아냈다.
- 02이야기들을 얼려둔(추가 학습 없는) 인공지능 모델에 넣어 나온 내부 벡터를 감정별로 평균 낸 뒤, 이 9개 평균 벡터가 가장 크게 퍼지는 방향(주성분 분석의 1번 방향)을 V축으로 정했다.
- 03이 V축은 텍스트(Llama-3-8B 기준 SST-2 감정분류 AUC 0.772, 지도학습 대비 93% 수준), 이미지(EmoSet, 사람이 매긴 감정 점수와 상관계수 0.636), 오디오(ESC-50, AUC 0.906), 뇌파(FACED, AUC 0.720)에서 모두 지도학습 분류기와 7퍼센트포인트 이내로 근접한 성능을 보였다.
- 04언어모델의 내부 상태에서 V축 방향을 수술하듯 제거하자 감정분류 정확도가 3개 모델에서 5.5~37.2퍼센트포인트나 떨어졌지만, 크기가 같은 무작위 방향을 제거했을 때는 최대 0.88퍼센트포인트만 떨어져, V축이 실제로 감정 판단에 쓰이고 있음을 보여줬다.
- 05텍스트로만 학습한 2개짜리 아주 단순한 분류기가 이미지(AUC 0.961), 오디오(0.764), 뇌파(0.828) 데이터에도 라벨 없이 그대로 통했는데, 이는 일반적인 16차원 공통 특징을 쓴 경우(0.525, 우연 수준)보다 훨씬 뛰어난 결과였다.
무엇을 했나
- 분노, 혐오, 공포, 슬픔, 즐거움 등 9가지 감정 이름과 감정별 짧은 이야기 약 50개(총 450개)만 사용해, 기존 지도학습 방식보다 라벨을 약 1500배 적게 쓰고도 '긍정-부정' 방향(V축)을 찾아냈다.
- 이야기들을 얼려둔(추가 학습 없는) 인공지능 모델에 넣어 나온 내부 벡터를 감정별로 평균 낸 뒤, 이 9개 평균 벡터가 가장 크게 퍼지는 방향(주성분 분석의 1번 방향)을 V축으로 정했다.
- 이 V축은 텍스트(Llama-3-8B 기준 SST-2 감정분류 AUC 0.772, 지도학습 대비 93% 수준), 이미지(EmoSet, 사람이 매긴 감정 점수와 상관계수 0.636), 오디오(ESC-50, AUC 0.906), 뇌파(FACED, AUC 0.720)에서 모두 지도학습 분류기와 7퍼센트포인트 이내로 근접한 성능을 보였다.
- 언어모델의 내부 상태에서 V축 방향을 수술하듯 제거하자 감정분류 정확도가 3개 모델에서 5.5~37.2퍼센트포인트나 떨어졌지만, 크기가 같은 무작위 방향을 제거했을 때는 최대 0.88퍼센트포인트만 떨어져, V축이 실제로 감정 판단에 쓰이고 있음을 보여줬다.
- 텍스트로만 학습한 2개짜리 아주 단순한 분류기가 이미지(AUC 0.961), 오디오(0.764), 뇌파(0.828) 데이터에도 라벨 없이 그대로 통했는데, 이는 일반적인 16차원 공통 특징을 쓴 경우(0.525, 우연 수준)보다 훨씬 뛰어난 결과였다.

| Modality | Encoder | Dataset | Recipe AUC | Sup. AUC | Ratio | p |
|---|---|---|---|---|---|---|
| Text | Llama-3-8B-Inst (block 20) | SST-2 | 0.772 | 0.828 | 93% | — |
| Text | Qwen3-8B (block 31, depth 0.86) | SST-2 | 0.787 | 0.840 | 94% | — |
| Vision | CLIP-img-768 | EmoSet | r=+0.636 | r=+0.81 | 79% | null 0.112 |
| Audio | CLAP-aud-512 | ESC-50 | 0.906 | 0.94 | 96% | 2.2×10−15 |
| EEG | CBraMod-200 | FACED | 0.720±0.055 | 0.83 | 87% | 3.65×10−8 |

| Model | Block | Base (%) | V-abl. (%) | Drop (V) | Random (μ±σ) | z |
|---|---|---|---|---|---|---|
| Llama-3-8B-Inst | 20 | 87.96 | 82.45 | −5.50 pp | −0.15±0.05 pp | 109 |
| Qwen3-1.7B | 18 | 84.40 | 68.58 | −15.83 pp | −0.88±1.24 pp | 12 |
| Qwen3-8B | 23 | 87.61 | 50.46 | −37.16 pp | −0.08±0.19 pp | 196 |

| Source ↓ Target → | Text | Image | Audio | EEG |
|---|---|---|---|---|
| Text | 0.741 (CV) | 0.961 | 0.764 | 0.828 |
| Image | 0.725 | 0.960 (CV) | 0.764 | 0.828 |
| Audio | 0.725 | 0.961 | 0.751 (CV) | 0.828 |
| EEG | 0.725 | 0.961 | 0.764 | 0.867 (CV) |
| Bridge between text and image encoder | Cross-modal AUC |
|---|---|
| Generic K=16 substrate (same encoder family) | 0.525 (chance) |
| Random K=16 subspace | ≈ chance |
| Cross-encoder-family substrate (CLIP-text + CLAP-audio) | ≈ chance |
| Raw 768-D CLIP-text features | 0.771 |
| V-axis (1-D, sentiment-specific) | 0.961 |
왜 중요한가
감정처럼 사람이 느끼는 애매한 속성도 아주 적은 예시만으로 AI 내부에서 정확히 짚어낼 수 있고, 그 방향이 텍스트를 넘어 이미지·소리·뇌파까지 공유된다는 것은 감정 인식 시스템을 훨씬 싸고 빠르게 만들 수 있다는 뜻이다. 다만 같은 방법으로 Llama와 Mistral 계열 모델은 생성 결과를 감정 방향으로 조종할 수 있었지만 Qwen과 Gemma 계열은 안 됐다는 점에서, 이 기술이 모델을 감정적으로 조작하는 데 악용될 위험도 함께 논의해야 한다.
이 논문의 용어
- V축(valence axis) · AI 내부 표현 공간에서 문장·이미지 등이 얼마나 긍정적인지 부정적인지를 나타내는 단일 방향
- 잔차 스트림(residual stream) · 트랜스포머 모델의 각 층이 정보를 계속 더해가며 쌓아가는 내부 상태의 흐름
- 주성분 분석(PCA) · 여러 데이터가 가장 크게 퍼져 있는 방향을 찾아내는 통계 기법
- AUC · 분류기가 정답과 오답을 얼마나 잘 구분하는지 나타내는 지표로, 1에 가까울수록 좋고 0.5는 무작위 수준
- 방향성 제거(directional ablation) · 모델 내부 상태에서 특정 방향의 성분만 골라 강제로 지워버리는 실험 기법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Yousef Radwan et al., arXiv:2608.18090, CC BY 4.0