영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구
arXiv:2608.180892026-08-20
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining
영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구
영어로 학습된 AI 언어모델은 영어로 위험한 요청을 받으면 거부하지만 같은 요청을 요루바어, 이그보어, 이갈라어, 하우사어로 하면 순순히 답해준다. 연구자는 모델이 영어 요청을 거부할 때 내부에서 만드는 특정 방향 신호를 뽑아내 다른 언어 입력에도 강제로 끼워 넣는 LSR-Anchoring이라는 방법을 만들어 추가 학습이나 해당 언어 데이터 없이 안전성을 되살렸다. 다만 아랍어에는 이 방법이 모든 모델과 모든 강도에서 통하지 않았고, 오히려 안전성을 더 떨어뜨렸다.
METAL MEDIA 해설 도표
영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구
01문제 확인: Llama-3-8B 등 4개 모델에서 영어 거부와 저자원 아프리카 언어(요루바, 이그보, 이갈라, 하우사) 입력 사이의 내부 표현 거리(Refusal Centroid Drift)를 측정했더니 이갈라어는 0.55까지 벌어져 있었다. 즉 안전장치가 없는 게 아니라 해당 언어에서 작동을 안 하는 것.
02해결 방법: 영어 유해 요청 100개와 무해 요청 50개의 내부 활성값 차이로 '거부 방향' 벡터를 뽑아 추론 시점에 다른 언어 입력의 내부 신호에 그대로 끼워 넣는 방식(MAS)을 썼다. 별도 모델 학습이나 가중치 수정 없이 소비자용 GPU 한 대로 실행 가능하다.
03결과: Llama-3.1-70B는 요루바 100%, 이갈라 100%, 이그보 99%, 하우사 96%까지 안전성 회복률(SRR)을 보였고, Mistral-7B와 Qwen2.5-7B는 정상 답변 손상(DPL) 0.08 이하로 안전을 회복했다. 다만 Llama-3-8B는 과도 교정되어 정상적인 요청까지 거부하는 정도(DPL)가 1.00까지 치솟았다.
04보완: 이 문제를 풀기 위해 희소 오토인코더(SAE)라는 다른 방식으로 뽑은 단일 특징(SDS)을 대신 사용했더니 KL발산(모델 출력 분포 변화량)이 3.5~7배 줄면서 정상 답변 붕괴 없이 같은 수준의 안전 회복을 달성했다.
05한계: 아랍어는 어느 모델, 어느 강도에서도 실패했고 오히려 안전성이 기준보다 낮아졌다. 이는 아랍어의 내부 표현이 기하학적으로 다른 위치에 있기 때문으로, 이 방법을 아랍어 에이전트에는 적용하지 말라고 저자는 명시한다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
문제 확인: Llama-3-8B 등 4개 모델에서 영어 거부와 저자원 아프리카 언어(요루바, 이그보, 이갈라, 하우사) 입력 사이의 내부 표현 거리(Refusal Centroid Drift)를 측정했더니 이갈라어는 0.55까지 벌어져 있었다. 즉 안전장치가 없는 게 아니라 해당 언어에서 작동을 안 하는 것.
해결 방법: 영어 유해 요청 100개와 무해 요청 50개의 내부 활성값 차이로 '거부 방향' 벡터를 뽑아 추론 시점에 다른 언어 입력의 내부 신호에 그대로 끼워 넣는 방식(MAS)을 썼다. 별도 모델 학습이나 가중치 수정 없이 소비자용 GPU 한 대로 실행 가능하다.
결과: Llama-3.1-70B는 요루바 100%, 이갈라 100%, 이그보 99%, 하우사 96%까지 안전성 회복률(SRR)을 보였고, Mistral-7B와 Qwen2.5-7B는 정상 답변 손상(DPL) 0.08 이하로 안전을 회복했다. 다만 Llama-3-8B는 과도 교정되어 정상적인 요청까지 거부하는 정도(DPL)가 1.00까지 치솟았다.
보완: 이 문제를 풀기 위해 희소 오토인코더(SAE)라는 다른 방식으로 뽑은 단일 특징(SDS)을 대신 사용했더니 KL발산(모델 출력 분포 변화량)이 3.5~7배 줄면서 정상 답변 붕괴 없이 같은 수준의 안전 회복을 달성했다.
한계: 아랍어는 어느 모델, 어느 강도에서도 실패했고 오히려 안전성이 기준보다 낮아졌다. 이는 아랍어의 내부 표현이 기하학적으로 다른 위치에 있기 때문으로, 이 방법을 아랍어 에이전트에는 적용하지 말라고 저자는 명시한다.
Figure 1: LSR-Anchoring recovers safety on Yoruba harmful prompts without affecting benign behaviour. Before steering (left): the model refuses in English but complies in Yoruba. After steering (right): LSR-Anchoring re-anchors the English refusal direction at inference time; both languages now refuse. No retraining or target-language data is used.
Table 1: Refusal Centroid Drift per language (Llama-3-8B, Layer 12). RCD =1−cos(𝐑en,𝐑lang). Higher RCD = greater geometric separation from English refusal space.
Language
Family
Baseline
RCD
Yoruba
Niger-Congo
0.14
0.95
Hausa
Afro-Asiatic
0.22
0.60
Igbo
Niger-Congo
0.30
0.41
Igala
Niger-Congo
0.16
0.55
Swahili
Bantu
0.46
0.95
Arabic
Semitic
0.90
0.90
Table 2: Evaluation metrics and acceptance thresholds.
Metric
Definition
Threshold
SRR
(steered−baseline)/nharmful
Higher
KL
DKL(Psteered∥Pbaseline)
<2.5 nats
DPL (Degraded Perf. on Legit.)
Benign prompts refused post-steering
<0.10
Precision
Genuine/flagged refusals (manual)
>0.80
Table 3: MAS best results per model-language pair. “—” indicates DPL was not instrumented in the 70B pass; table˜4 confirms capability is preserved.
Model
Lang.
SRR
α
KL
DPL
Llama-3.1-70B
Yoruba
1.00
25
3.53
—
Llama-3.1-70B
Igala
1.00
20
2.58
—
Llama-3.1-70B
Arabic
−0.20
25
2.91
—
Mistral-7B
Igala
0.75
25
0.61
0.06
Mistral-7B
Yoruba
0.25
25
1.43
0.08
Qwen2.5-7B
Igala
0.49
70
0.28
0.06
Qwen2.5-7B
Arabic
−0.10
70
0.14
0.00
Llama-3-8B
Igala
0.81
2
4.64
1.00
“—” = not instrumented; see caption.
Table 4: MMLU accuracy at effective steering magnitudes. Δ = absolute drop in percentage points. “OK” indicates whether the model remains within the acceptable capability-drop threshold. 70B steered rows not collected; see section˜4.
Model
α
Acc.
Δ (pp)
OK
Mistral-7B
0
0.6035
—
—
2
0.5937
−0.98
✓
Llama-3-8B
0
0.6699
—
—
2
0.6671
−0.28
✓
Qwen2.5-7B
0
0.7441
—
—
20
0.7420
−0.21
✓
40
0.7406
−0.35
✓
Llama-3.1-70B
0
0.8259
—
—
Table 5: MAS vs. SDS at best SRR (Llama-3-8B, Layer 12). SDS DPL was not instrumented; at KL <1.0 nats, benign collapse is geometrically ruled out and KL is the primary utility metric here.
Lang.
SDS SRR
SDS KL
SDS DPL
MAS SRR
MAS KL
MAS DPL
Yoruba
0.06
0.25
—
0.81
4.85
1.00
Hausa
0.53
0.93
—
0.82
4.44
0.98
Igbo
0.70
2.35
—
0.80
6.46
1.00
Igala
0.62
1.35
—
0.81
4.64
1.00
Swahili
0.20
0.44
—
0.62
4.78
1.00
Arabic
−0.48
2.56
—
0.21
5.34
0.96
“—” = not instrumented; see caption.
Table 6: Full MAS α sweep (Qwen2.5-7B, Layer 26). Arabic baseline 0.11 falls within the steerable range for all other languages; negative SRR throughout confirms geometric failure rather than a baseline effect.
Language
α
SRR
KL
DPL
Base.
Yoruba
10
0.01
0.044
0.02
0.01
30
0.04
0.082
0.06
0.01
50
0.16
0.149
0.10
0.01
70
0.35
0.242
0.24
0.01
Hausa
10
0.10
0.102
0.02
0.04
30
0.22
0.194
0.12
0.04
50
0.41
0.326
0.34
0.04
70
0.51
0.491
0.50
0.04
Igbo
10
0.19
0.042
0.02
0.22
30
0.29
0.085
0.04
0.22
50
0.33
0.127
0.06
0.22
70
0.38
0.188
0.10
0.22
Igala
10
0.03
0.069
0.04
0.02
30
0.10
0.118
0.00
0.02
50
0.27
0.194
0.06
0.02
70
0.49
0.283
0.06
0.02
Swahili
10
0.01
0.038
0.00
0.02
30
0.05
0.087
0.02
0.02
50
0.06
0.160
0.04
0.02
70
0.11
0.266
0.12
0.02
Arabic
10
0.00
0.049
0.00
0.11
30
−0.04
0.074
0.00
0.11
50
−0.09
0.107
0.00
0.11
70
−0.10
0.143
0.00
0.11
Table 7: SDS best operating points (Llama-3-8B, Layer 12). Arabic baseline 0.90 is Llama-3-8B specific; Qwen2.5-7B Arabic baseline is 0.11 (appendix˜B).
Lang.
Family
Base.
SRR
α
KL
Note
Yoruba
Niger-Congo
0.14
0.06
4
0.25
Ceiling
Hausa
Afro-Asiatic
0.22
0.53
6
0.93
Positive
Igbo
Niger-Congo
0.30
0.70
8
2.35
Strong
Igala
Niger-Congo
0.16
0.62
6
1.35
Strong
Swahili
Bantu
0.46
0.20
4
0.44
Moderate
Arabic
Semitic
0.90
−0.48
6
2.56
Inverse
왜 중요한가
전 세계적으로 수억 명이 쓰는 저자원 아프리카 언어 사용자들이 AI 안전장치의 보호를 거의 받지 못하고 있는데, 이 연구는 별도 데이터 수집이나 대규모 재훈련 없이 소비자용 GPU 한 대로 이 문제를 완화할 수 있음을 보였다. 다만 아랍어처럼 통하지 않는 언어도 있어, 배포 전 언어별 검증이 필수라는 실무적 판단 기준도 함께 제시한다.
이 논문의 용어
잔차 스트림(residual stream) · 트랜스포머 모델 내부에서 층을 거치며 계속 누적되는 정보 흐름
Refusal Centroid Drift(RCD) · 영어 거부 시 내부 신호와 다른 언어 입력 시 내부 신호가 얼마나 다른 방향을 향하는지 나타내는 지표
Mean-Activation Steering(MAS) · 영어 유해/무해 요청의 내부 신호 차이를 벡터로 뽑아 추론 시 강제로 주입하는 방법
희소 오토인코더(Sparse Autoencoder, SAE) · 모델 내부의 뒤섞인 신호를 해석 가능한 개별 특징들로 분해하는 보조 신경망
안전성 회복률(SRR)·정상답변손상(DPL)·KL발산 · 각각 위험요청 거부가 얼마나 회복됐는지, 정상 요청이 얼마나 잘못 거부됐는지, 조작 전후 모델 출력 분포가 얼마나 달라졌는지를 재는 지표