컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구

arXiv:2608.180892026-08-20

Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining

영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구

영어로 학습된 AI 언어모델은 영어로 위험한 요청을 받으면 거부하지만 같은 요청을 요루바어, 이그보어, 이갈라어, 하우사어로 하면 순순히 답해준다. 연구자는 모델이 영어 요청을 거부할 때 내부에서 만드는 특정 방향 신호를 뽑아내 다른 언어 입력에도 강제로 끼워 넣는 LSR-Anchoring이라는 방법을 만들어 추가 학습이나 해당 언어 데이터 없이 안전성을 되살렸다. 다만 아랍어에는 이 방법이 모든 모델과 모든 강도에서 통하지 않았고, 오히려 안전성을 더 떨어뜨렸다.

METAL MEDIA 해설 도표

영어로는 위험한 요청을 거부하는 AI가 요루바어·이그보어·하우사어로 물으면 순순히 답해버리는 문제를, 재훈련 없이 모델 내부 신호만 조작해 고친 연구

  1. 01문제 확인: Llama-3-8B 등 4개 모델에서 영어 거부와 저자원 아프리카 언어(요루바, 이그보, 이갈라, 하우사) 입력 사이의 내부 표현 거리(Refusal Centroid Drift)를 측정했더니 이갈라어는 0.55까지 벌어져 있었다. 즉 안전장치가 없는 게 아니라 해당 언어에서 작동을 안 하는 것.
  2. 02해결 방법: 영어 유해 요청 100개와 무해 요청 50개의 내부 활성값 차이로 '거부 방향' 벡터를 뽑아 추론 시점에 다른 언어 입력의 내부 신호에 그대로 끼워 넣는 방식(MAS)을 썼다. 별도 모델 학습이나 가중치 수정 없이 소비자용 GPU 한 대로 실행 가능하다.
  3. 03결과: Llama-3.1-70B는 요루바 100%, 이갈라 100%, 이그보 99%, 하우사 96%까지 안전성 회복률(SRR)을 보였고, Mistral-7B와 Qwen2.5-7B는 정상 답변 손상(DPL) 0.08 이하로 안전을 회복했다. 다만 Llama-3-8B는 과도 교정되어 정상적인 요청까지 거부하는 정도(DPL)가 1.00까지 치솟았다.
  4. 04보완: 이 문제를 풀기 위해 희소 오토인코더(SAE)라는 다른 방식으로 뽑은 단일 특징(SDS)을 대신 사용했더니 KL발산(모델 출력 분포 변화량)이 3.5~7배 줄면서 정상 답변 붕괴 없이 같은 수준의 안전 회복을 달성했다.
  5. 05한계: 아랍어는 어느 모델, 어느 강도에서도 실패했고 오히려 안전성이 기준보다 낮아졌다. 이는 아랍어의 내부 표현이 기하학적으로 다른 위치에 있기 때문으로, 이 방법을 아랍어 에이전트에는 적용하지 말라고 저자는 명시한다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 문제 확인: Llama-3-8B 등 4개 모델에서 영어 거부와 저자원 아프리카 언어(요루바, 이그보, 이갈라, 하우사) 입력 사이의 내부 표현 거리(Refusal Centroid Drift)를 측정했더니 이갈라어는 0.55까지 벌어져 있었다. 즉 안전장치가 없는 게 아니라 해당 언어에서 작동을 안 하는 것.
  2. 해결 방법: 영어 유해 요청 100개와 무해 요청 50개의 내부 활성값 차이로 '거부 방향' 벡터를 뽑아 추론 시점에 다른 언어 입력의 내부 신호에 그대로 끼워 넣는 방식(MAS)을 썼다. 별도 모델 학습이나 가중치 수정 없이 소비자용 GPU 한 대로 실행 가능하다.
  3. 결과: Llama-3.1-70B는 요루바 100%, 이갈라 100%, 이그보 99%, 하우사 96%까지 안전성 회복률(SRR)을 보였고, Mistral-7B와 Qwen2.5-7B는 정상 답변 손상(DPL) 0.08 이하로 안전을 회복했다. 다만 Llama-3-8B는 과도 교정되어 정상적인 요청까지 거부하는 정도(DPL)가 1.00까지 치솟았다.
  4. 보완: 이 문제를 풀기 위해 희소 오토인코더(SAE)라는 다른 방식으로 뽑은 단일 특징(SDS)을 대신 사용했더니 KL발산(모델 출력 분포 변화량)이 3.5~7배 줄면서 정상 답변 붕괴 없이 같은 수준의 안전 회복을 달성했다.
  5. 한계: 아랍어는 어느 모델, 어느 강도에서도 실패했고 오히려 안전성이 기준보다 낮아졌다. 이는 아랍어의 내부 표현이 기하학적으로 다른 위치에 있기 때문으로, 이 방법을 아랍어 에이전트에는 적용하지 말라고 저자는 명시한다.
Figure 1: LSR-Anchoring recovers safety on Yoruba harmful prompts without affecting benign behaviour. Before steering (left): the model refuses in English but complies in Yoruba. After steering (right): LSR-Anchoring re-anchors the English refusal direction at inference time; both languages now refuse. No retraining or target-language data is used.
Figure 1: LSR-Anchoring recovers safety on Yoruba harmful prompts without affecting benign behaviour. Before steering (left): the model refuses in English but complies in Yoruba. After steering (right): LSR-Anchoring re-anchors the English refusal direction at inference time; both languages now refuse. No retraining or target-language data is used.
Table 1: Refusal Centroid Drift per language (Llama-3-8B, Layer 12). RCD =1−cos⁡(𝐑en,𝐑lang). Higher RCD = greater geometric separation from English refusal space.
LanguageFamilyBaselineRCD
YorubaNiger-Congo0.140.95
HausaAfro-Asiatic0.220.60
IgboNiger-Congo0.300.41
IgalaNiger-Congo0.160.55
SwahiliBantu0.460.95
ArabicSemitic0.900.90
Table 2: Evaluation metrics and acceptance thresholds.
MetricDefinitionThreshold
SRR(steered−baseline)/nharmfulHigher
KLDKL​(Psteered∥Pbaseline)<2.5 nats
DPL (Degraded Perf. on Legit.)Benign prompts refused post-steering<0.10
PrecisionGenuine/flagged refusals (manual)>0.80
Table 3: MAS best results per model-language pair. “—” indicates DPL was not instrumented in the 70B pass; table˜4 confirms capability is preserved.
ModelLang.SRRαKLDPL
Llama-3.1-70BYoruba1.00253.53
Llama-3.1-70BIgala1.00202.58
Llama-3.1-70BArabic−0.20252.91
Mistral-7BIgala0.75250.610.06
Mistral-7BYoruba0.25251.430.08
Qwen2.5-7BIgala0.49700.280.06
Qwen2.5-7BArabic−0.10700.140.00
Llama-3-8BIgala0.8124.641.00
“—” = not instrumented; see caption.
Table 4: MMLU accuracy at effective steering magnitudes. Δ = absolute drop in percentage points. “OK” indicates whether the model remains within the acceptable capability-drop threshold. 70B steered rows not collected; see section˜4.
ModelαAcc.Δ (pp)OK
Mistral-7B00.6035
20.5937−0.98
Llama-3-8B00.6699
20.6671−0.28
Qwen2.5-7B00.7441
200.7420−0.21
400.7406−0.35
Llama-3.1-70B00.8259
Table 5: MAS vs. SDS at best SRR (Llama-3-8B, Layer 12). SDS DPL was not instrumented; at KL <1.0 nats, benign collapse is geometrically ruled out and KL is the primary utility metric here.
Lang.SDS SRRSDS KLSDS DPLMAS SRRMAS KLMAS DPL
Yoruba0.060.250.814.851.00
Hausa0.530.930.824.440.98
Igbo0.702.350.806.461.00
Igala0.621.350.814.641.00
Swahili0.200.440.624.781.00
Arabic−0.482.560.215.340.96
“—” = not instrumented; see caption.
Table 6: Full MAS α sweep (Qwen2.5-7B, Layer 26). Arabic baseline 0.11 falls within the steerable range for all other languages; negative SRR throughout confirms geometric failure rather than a baseline effect.
LanguageαSRRKLDPLBase.
Yoruba100.010.0440.020.01
300.040.0820.060.01
500.160.1490.100.01
700.350.2420.240.01
Hausa100.100.1020.020.04
300.220.1940.120.04
500.410.3260.340.04
700.510.4910.500.04
Igbo100.190.0420.020.22
300.290.0850.040.22
500.330.1270.060.22
700.380.1880.100.22
Igala100.030.0690.040.02
300.100.1180.000.02
500.270.1940.060.02
700.490.2830.060.02
Swahili100.010.0380.000.02
300.050.0870.020.02
500.060.1600.040.02
700.110.2660.120.02
Arabic100.000.0490.000.11
30−0.040.0740.000.11
50−0.090.1070.000.11
70−0.100.1430.000.11
Table 7: SDS best operating points (Llama-3-8B, Layer 12). Arabic baseline 0.90 is Llama-3-8B specific; Qwen2.5-7B Arabic baseline is 0.11 (appendix˜B).
Lang.FamilyBase.SRRαKLNote
YorubaNiger-Congo0.140.0640.25Ceiling
HausaAfro-Asiatic0.220.5360.93Positive
IgboNiger-Congo0.300.7082.35Strong
IgalaNiger-Congo0.160.6261.35Strong
SwahiliBantu0.460.2040.44Moderate
ArabicSemitic0.90−0.4862.56Inverse

왜 중요한가

전 세계적으로 수억 명이 쓰는 저자원 아프리카 언어 사용자들이 AI 안전장치의 보호를 거의 받지 못하고 있는데, 이 연구는 별도 데이터 수집이나 대규모 재훈련 없이 소비자용 GPU 한 대로 이 문제를 완화할 수 있음을 보였다. 다만 아랍어처럼 통하지 않는 언어도 있어, 배포 전 언어별 검증이 필수라는 실무적 판단 기준도 함께 제시한다.

이 논문의 용어

  • 잔차 스트림(residual stream) · 트랜스포머 모델 내부에서 층을 거치며 계속 누적되는 정보 흐름
  • Refusal Centroid Drift(RCD) · 영어 거부 시 내부 신호와 다른 언어 입력 시 내부 신호가 얼마나 다른 방향을 향하는지 나타내는 지표
  • Mean-Activation Steering(MAS) · 영어 유해/무해 요청의 내부 신호 차이를 벡터로 뽑아 추론 시 강제로 주입하는 방법
  • 희소 오토인코더(Sparse Autoencoder, SAE) · 모델 내부의 뒤섞인 신호를 해석 가능한 개별 특징들로 분해하는 보조 신경망
  • 안전성 회복률(SRR)·정상답변손상(DPL)·KL발산 · 각각 위험요청 거부가 얼마나 회복됐는지, 정상 요청이 얼마나 잘못 거부됐는지, 조작 전후 모델 출력 분포가 얼마나 달라졌는지를 재는 지표

저자 · Godwin Abuh Faruna

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Godwin Abuh Faruna et al., arXiv:2608.18089, CC BY 4.0