컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

사람 귀엔 안 들리는 초저주파 소리로 AI 음성모델을 속일 수 있다

arXiv:2608.091582026-08-09

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

사람 귀엔 안 들리는 초저주파 소리로 AI 음성모델을 속일 수 있다

연구팀은 사람이 들을 수 없는 5~20Hz 초저주파 신호를 음성 인식 AI 마이크에 흘려보내 답변을 크게 틀리게 만드는 공격 방법 ILL을 만들었다. 이 공격은 6개 대형 음성언어모델(LALM)에서 최대 67퍼센트포인트까지 정확도를 떨어뜨리면서도 사람이 듣기엔 깨끗한 소리와 거의 구별되지 않았다. 이를 막기 위한 방어 기법 DRG는 의심스러운 입력을 감지해 녹음을 한 번 더 요청하는 방식으로 공격받은 정확도를 28.5%에서 46.1%로 끌어올렸다.

METAL MEDIA 해설 도표

ILL 공격과 DRG 방어의 흐름

증거 상태측정 결과가 보고됨

  1. 위협 모델공격자가 사람이 못 듣는 5~20Hz 파형을 사용자 발화와 함께 공기 중에서 섞어 마이크로 들어가게 한다.
  2. ILL 생성문장 주의 구간 추정으로 켜질 구간을 정하고, 말뭉치 주파수 변화 패턴을 옮겨(주파수 혼동 전이) 연속 위상의 범용 저주파 파형을 만든다.
  3. 공격 평가6개 LALM과 음성질의응답·인식·번역·감정분류 과제에서 정확도 하락폭과 사람 청취 평가(1~7점)를 측정한다.
  4. DRG 방어입력의 저주파 분포를 두 그룹으로 나눠 의심스러운 입력이면 두 번째 녹음을 요청하고, 두 녹음을 비교해 일관된 내용만 답하게 한다.
  5. 결과 회복깨끗한 재녹음을 받으면 6개 모델 평균 공격받은 정확도가 28.5%에서 46.1%로 올라간다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 연구팀은 사람 귀에는 들리지 않는 5~20Hz 대역 소리를 이용해 대형 음성언어모델(LALM)을 오작동시키는 ILL이라는 공격 기법을 만들었다.
  2. ILL은 모델이 어느 구간에서 음성에 집중하는지(문장 주의 구간 추정)를 분석하고, 말뭉치의 주파수 변화 패턴을 저주파 파형으로 옮겨(주파수 혼동 전이) 하나의 범용 잡음 파형을 만든다. 이 파형은 목표 모델을 몰라도, 매번 다른 음성에 대해서도 그대로 재사용할 수 있다.
  3. 6개 모델(공개 4개, 비공개 2개)과 음성 질의응답, 음성인식, 번역, 감정분류 등 여러 과제에서 실험한 결과, ILL은 정확도를 최대 67퍼센트포인트까지 떨어뜨렸다.
  4. 112명이 참여한 청취 평가에서 ILL이 섞인 소리는 평균 1.33점(7점 만점, 1점이 안 들림)으로 깨끗한 소리의 1.17점과 거의 차이가 없었고, 들리는 잡음 비율도 0.06~0.08%에 불과했다.
  5. 방어 기법 DRG는 입력 소리의 주파수 분포 변화를 감지해(F1 점수 89.69~99.00%) 의심스러운 경우 녹음을 한 번 더 요청하며, 깨끗한 재녹음을 받았을 때 공격받은 평균 정확도를 28.5%에서 46.1%로 높였다.
Figure 1: Overview of the low-frequency perception gap, the construction of ILL, the DRG detection pipeline, and the evaluation.
Figure 1: Overview of the low-frequency perception gap, the construction of ILL, the DRG detection pipeline, and the evaluation.
Table 13: Paired comparisons between ILL and the six attack baselines across the 18 model–task cells.
BaselineMean accuracy difference (pp)ILL lower/tied/higherHolm-adjusted p
Gaussian1.29/5/4.422
PNL (Natural)1.010/3/5.422
PNL (Mechanical)1.412/0/6.422
PNL (Human)1.511/0/7.422
Audio-Adv.9.817/0/13.81×10−5
Whisper11.318/0/02.29×10−5
Figure 2: Attack effectiveness on translation and recognition. Lower BLEU and higher WER indicate stronger disruption.
Figure 2: Attack effectiveness on translation and recognition. Lower BLEU and higher WER indicate stronger disruption.
Table 14: Interpretation of the seven-point human audibility scale.
ScoreDescription
1Completely imperceptible
2Almost imperceptible
3Barely noticeable
4Slightly noticeable
5Moderately noticeable
6Clearly noticeable
7Highly noticeable
Figure 3: Human audibility ratings across 100+ responses.
Figure 3: Human audibility ratings across 100+ responses.

실제로 확인된 결과

  • 6개 LALM과 여러 음성 과제에서 ILL은 정확도를 최대 67퍼센트포인트까지 떨어뜨렸으며, 특히 학습에 쓰이지 않은 StepAudio2 모델에서 가장 큰 감소폭이 나타나 공격이 다른 모델로도 잘 옮겨간다는 것을 보였다.
  • ILL의 들리는 잡음 비율(ANR)은 0.06~0.08%인 반면 비교 대상 잡음들은 모두 98.9% 이상이었고, 112명 대상 청취 평가에서도 ILL은 평균 1.33점으로 깨끗한 소리(1.17점)와 가까웠다.
  • DRG는 4개 평가 데이터셋에서 F1 89.69~99.00%로 저주파 간섭을 탐지했고, 깨끗한 재녹음을 받았을 때 6개 모델 평균 공격받은 정확도를 28.5%에서 46.1%로 높였다.
  • 18개 모델-과제 조합 모두에서 ILL이 정확도를 낮췄으며(평균 13.1퍼센트포인트, 통계적으로 유의), Audio-Adv.와 Whisper 공격보다는 유의하게 강했지만 가우시안 잡음이나 일반 환경음 대비로는 통계적으로 우열이 갈리지 않았다.
  • 모델 내부 분석에서 ILL 공격 시 오디오에 대한 주의 비중과 정답 확률(신뢰도)이 크게 낮아졌고, DRG 적용 후에는 이 값들이 깨끗한 상태 쪽으로 되돌아갔다.
Figure 4: Defense effectiveness of DRG.
Figure 4: Defense effectiveness of DRG.

어디에 쓸 수 있나

  • 스마트 스피커, 음성비서, 통화 기반 AI 상담 등 마이크 입력을 쓰는 음성 AI 서비스의 보안 점검 항목에 초저주파 잡음 내성 테스트를 추가하는 데 참고할 수 있다.
  • 음성 AI 제품에 DRG와 같은 저주파 이상 탐지 및 재녹음 요청 로직을 입력 필터로 덧붙이는 방어 설계의 참고 사례로 쓸 수 있다.
  • 새로운 음성 모델을 출시하기 전 레드팀 평가 항목에 사람이 들을 수 없는 주파수 대역 공격을 포함시키는 기준으로 활용할 수 있다.
Figure 5: Recovery under four additional attack types.
Figure 5: Recovery under four additional attack types.

한계와 남은 검증

  • 연구팀은 실제 스피커-공기-마이크 전체 물리 경로를 재현하지 않고 마이크가 수신하는 파형을 시뮬레이션했으므로, 실제 기기·환경별 효과는 별도의 물리적 실험이 필요하다.
  • 저주파 신호가 사람에게 안전하다는 뜻은 아니며, 논문은 무분별한 실환경 배포 없이 통제된 실험에서만 검증했다.
  • DRG의 회복 효과는 두 번째 녹음이 깨끗한 경우에 크고, 간섭이 계속되는 조건에서는 개선 폭이 작아 재녹음 품질에 의존한다.
  • 주의·표현·확신도 변화 분석은 상관관계를 보여줄 뿐 완전한 인과 메커니즘을 규명한 것은 아니며, 더 깊은 분석은 향후 과제로 남아 있다.
  • ILL이 모든 잡음 기준선보다 항상 더 강력한 것은 아니며, 가우시안 잡음이나 일반 환경음 대비 통계적 우위는 확인되지 않았다.
Figure 6: ILL component analysis on Qwen3-Omni. Panels vary (a) amplitude, (b) duty cycle, (c) segment length, and (d) state-sequence construction. Dashed lines mark the configuration used in the main experiments.
Figure 6: ILL component analysis on Qwen3-Omni. Panels vary (a) amplitude, (b) duty cycle, (c) segment length, and (d) state-sequence construction. Dashed lines mark the configuration used in the main experiments.

왜 중요한가

사람이 전혀 인지하지 못하는 소리로 스마트 스피커나 음성비서 같은 AI 시스템의 판단을 크게 틀리게 만들 수 있다는 점을 처음으로 실증했다는 데 의미가 있다. 이는 음성 AI를 실제 제품에 쓸 때 사용자가 알아차릴 수 없는 새로운 보안 구멍이 될 수 있으므로, 관련 서비스 개발자와 보안 담당자가 대비해야 할 위험이다.

이 논문의 용어

  • LALM(대형 음성언어모델) · 음성을 듣고 언어로 이해·응답하는 대형 AI 모델
  • 블랙박스 공격 · 목표 모델의 내부 구조나 파라미터를 몰라도 작동하는 공격 방식
  • ANR(들리는 잡음 비율) · 전체 잡음 에너지 중 사람이 들을 수 있는 대역(약 20Hz~20kHz)에 속하는 비율
  • F1 점수 · 탐지 정확도를 정밀도와 재현율을 함께 고려해 나타낸 지표
  • DRG(분포 재요청 방어) · 저주파 분포 이상을 감지해 의심되는 입력에 대해 녹음을 한 번 더 요청하는 방어 기법

저자 · Yuanhe Zhang

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Yuanhe Zhang et al., arXiv:2608.09158, CC BY 4.0