사람 귀엔 안 들리는 초저주파 소리로 AI 음성모델을 속일 수 있다
사람 귀엔 안 들리는 초저주파 소리로 AI 음성모델을 속일 수 있다
연구팀은 사람이 들을 수 없는 5~20Hz 초저주파 신호를 음성 인식 AI 마이크에 흘려보내 답변을 크게 틀리게 만드는 공격 방법 ILL을 만들었다. 이 공격은 6개 대형 음성언어모델(LALM)에서 최대 67퍼센트포인트까지 정확도를 떨어뜨리면서도 사람이 듣기엔 깨끗한 소리와 거의 구별되지 않았다. 이를 막기 위한 방어 기법 DRG는 의심스러운 입력을 감지해 녹음을 한 번 더 요청하는 방식으로 공격받은 정확도를 28.5%에서 46.1%로 끌어올렸다.
METAL MEDIA 해설 도표
ILL 공격과 DRG 방어의 흐름
증거 상태측정 결과가 보고됨
- 위협 모델공격자가 사람이 못 듣는 5~20Hz 파형을 사용자 발화와 함께 공기 중에서 섞어 마이크로 들어가게 한다.
- ILL 생성문장 주의 구간 추정으로 켜질 구간을 정하고, 말뭉치 주파수 변화 패턴을 옮겨(주파수 혼동 전이) 연속 위상의 범용 저주파 파형을 만든다.
- 공격 평가6개 LALM과 음성질의응답·인식·번역·감정분류 과제에서 정확도 하락폭과 사람 청취 평가(1~7점)를 측정한다.
- DRG 방어입력의 저주파 분포를 두 그룹으로 나눠 의심스러운 입력이면 두 번째 녹음을 요청하고, 두 녹음을 비교해 일관된 내용만 답하게 한다.
- 결과 회복깨끗한 재녹음을 받으면 6개 모델 평균 공격받은 정확도가 28.5%에서 46.1%로 올라간다.
무엇을 했나
- 연구팀은 사람 귀에는 들리지 않는 5~20Hz 대역 소리를 이용해 대형 음성언어모델(LALM)을 오작동시키는 ILL이라는 공격 기법을 만들었다.
- ILL은 모델이 어느 구간에서 음성에 집중하는지(문장 주의 구간 추정)를 분석하고, 말뭉치의 주파수 변화 패턴을 저주파 파형으로 옮겨(주파수 혼동 전이) 하나의 범용 잡음 파형을 만든다. 이 파형은 목표 모델을 몰라도, 매번 다른 음성에 대해서도 그대로 재사용할 수 있다.
- 6개 모델(공개 4개, 비공개 2개)과 음성 질의응답, 음성인식, 번역, 감정분류 등 여러 과제에서 실험한 결과, ILL은 정확도를 최대 67퍼센트포인트까지 떨어뜨렸다.
- 112명이 참여한 청취 평가에서 ILL이 섞인 소리는 평균 1.33점(7점 만점, 1점이 안 들림)으로 깨끗한 소리의 1.17점과 거의 차이가 없었고, 들리는 잡음 비율도 0.06~0.08%에 불과했다.
- 방어 기법 DRG는 입력 소리의 주파수 분포 변화를 감지해(F1 점수 89.69~99.00%) 의심스러운 경우 녹음을 한 번 더 요청하며, 깨끗한 재녹음을 받았을 때 공격받은 평균 정확도를 28.5%에서 46.1%로 높였다.

| Baseline | Mean accuracy difference (pp) | ILL lower/tied/higher | Holm-adjusted p |
|---|---|---|---|
| Gaussian | 1.2 | 9/5/4 | .422 |
| PNL (Natural) | 1.0 | 10/3/5 | .422 |
| PNL (Mechanical) | 1.4 | 12/0/6 | .422 |
| PNL (Human) | 1.5 | 11/0/7 | .422 |
| Audio-Adv. | 9.8 | 17/0/1 | 3.81×10−5 |
| Whisper | 11.3 | 18/0/0 | 2.29×10−5 |
| Score | Description |
|---|---|
| 1 | Completely imperceptible |
| 2 | Almost imperceptible |
| 3 | Barely noticeable |
| 4 | Slightly noticeable |
| 5 | Moderately noticeable |
| 6 | Clearly noticeable |
| 7 | Highly noticeable |
실제로 확인된 결과
- 6개 LALM과 여러 음성 과제에서 ILL은 정확도를 최대 67퍼센트포인트까지 떨어뜨렸으며, 특히 학습에 쓰이지 않은 StepAudio2 모델에서 가장 큰 감소폭이 나타나 공격이 다른 모델로도 잘 옮겨간다는 것을 보였다.
- ILL의 들리는 잡음 비율(ANR)은 0.06~0.08%인 반면 비교 대상 잡음들은 모두 98.9% 이상이었고, 112명 대상 청취 평가에서도 ILL은 평균 1.33점으로 깨끗한 소리(1.17점)와 가까웠다.
- DRG는 4개 평가 데이터셋에서 F1 89.69~99.00%로 저주파 간섭을 탐지했고, 깨끗한 재녹음을 받았을 때 6개 모델 평균 공격받은 정확도를 28.5%에서 46.1%로 높였다.
- 18개 모델-과제 조합 모두에서 ILL이 정확도를 낮췄으며(평균 13.1퍼센트포인트, 통계적으로 유의), Audio-Adv.와 Whisper 공격보다는 유의하게 강했지만 가우시안 잡음이나 일반 환경음 대비로는 통계적으로 우열이 갈리지 않았다.
- 모델 내부 분석에서 ILL 공격 시 오디오에 대한 주의 비중과 정답 확률(신뢰도)이 크게 낮아졌고, DRG 적용 후에는 이 값들이 깨끗한 상태 쪽으로 되돌아갔다.
어디에 쓸 수 있나
- 스마트 스피커, 음성비서, 통화 기반 AI 상담 등 마이크 입력을 쓰는 음성 AI 서비스의 보안 점검 항목에 초저주파 잡음 내성 테스트를 추가하는 데 참고할 수 있다.
- 음성 AI 제품에 DRG와 같은 저주파 이상 탐지 및 재녹음 요청 로직을 입력 필터로 덧붙이는 방어 설계의 참고 사례로 쓸 수 있다.
- 새로운 음성 모델을 출시하기 전 레드팀 평가 항목에 사람이 들을 수 없는 주파수 대역 공격을 포함시키는 기준으로 활용할 수 있다.
한계와 남은 검증
- 연구팀은 실제 스피커-공기-마이크 전체 물리 경로를 재현하지 않고 마이크가 수신하는 파형을 시뮬레이션했으므로, 실제 기기·환경별 효과는 별도의 물리적 실험이 필요하다.
- 저주파 신호가 사람에게 안전하다는 뜻은 아니며, 논문은 무분별한 실환경 배포 없이 통제된 실험에서만 검증했다.
- DRG의 회복 효과는 두 번째 녹음이 깨끗한 경우에 크고, 간섭이 계속되는 조건에서는 개선 폭이 작아 재녹음 품질에 의존한다.
- 주의·표현·확신도 변화 분석은 상관관계를 보여줄 뿐 완전한 인과 메커니즘을 규명한 것은 아니며, 더 깊은 분석은 향후 과제로 남아 있다.
- ILL이 모든 잡음 기준선보다 항상 더 강력한 것은 아니며, 가우시안 잡음이나 일반 환경음 대비 통계적 우위는 확인되지 않았다.
왜 중요한가
사람이 전혀 인지하지 못하는 소리로 스마트 스피커나 음성비서 같은 AI 시스템의 판단을 크게 틀리게 만들 수 있다는 점을 처음으로 실증했다는 데 의미가 있다. 이는 음성 AI를 실제 제품에 쓸 때 사용자가 알아차릴 수 없는 새로운 보안 구멍이 될 수 있으므로, 관련 서비스 개발자와 보안 담당자가 대비해야 할 위험이다.
이 논문의 용어
- LALM(대형 음성언어모델) · 음성을 듣고 언어로 이해·응답하는 대형 AI 모델
- 블랙박스 공격 · 목표 모델의 내부 구조나 파라미터를 몰라도 작동하는 공격 방식
- ANR(들리는 잡음 비율) · 전체 잡음 에너지 중 사람이 들을 수 있는 대역(약 20Hz~20kHz)에 속하는 비율
- F1 점수 · 탐지 정확도를 정밀도와 재현율을 함께 고려해 나타낸 지표
- DRG(분포 재요청 방어) · 저주파 분포 이상을 감지해 의심되는 입력에 대해 녹음을 한 번 더 요청하는 방어 기법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Yuanhe Zhang et al., arXiv:2608.09158, CC BY 4.0