오디오·비디오를 동시에 이해하는 AI에서, 한쪽 감각이 다른 쪽을 대신 판단하게 하면 답이 사라진다
오디오·비디오를 동시에 이해하는 AI에서, 한쪽 감각이 다른 쪽을 대신 판단하게 하면 답이 사라진다
오디오와 비디오를 함께 처리하는 옴니모달 대형언어모델은 처리할 토큰(정보 조각) 수를 줄여야 실시간으로 쓸 수 있는데, 기존 방법들은 한쪽 감각(예: 오디오)의 중요도로 다른 쪽(비디오)에서 뭘 남길지 정했다. 이 논문은 같은 질문에도 오디오와 비디오가 중요해지는 순간이 서로 다르다는 것을 보이고, 각 감각이 질문을 기준으로 각자 알아서 중요도를 매기는 OmniScope를 제안한다. 추가 학습 없이 적용 가능하며 네 개 벤치마크와 두 모델 크기에서 압축 상황 전반에 걸쳐 평균 정확도가 가장 높았다.
METAL MEDIA 해설 도표
OmniScope의 세 단계 압축 구조
증거 상태측정 결과가 보고됨
- 질문 기반 채점같은 질문을 기준으로 비디오는 CLIP으로, 오디오는 모델 내부 임베딩으로 각각 독립적으로 중요도 점수를 매기고 토큰 예산을 나눈다
- 비디오 가지치기(AD-STC)짝수 프레임은 전체 장면 정보를 남기고 홀수 프레임은 이전 프레임과 달라진 부분만 남겨, 전체 맥락과 변화를 동시에 보존한다
- 오디오 병합1초 단위로 비슷한 오디오 토큰끼리 짝지어 평균 내어 합치면서 중복은 줄이고 시간의 연속성은 유지한다
- 성능 검증4개 벤치마크·2개 모델 크기에서 25%~45% 토큰만 남긴 상태로 정확도, 속도, 메모리를 측정해 비교 방법들보다 우수함을 확인
무엇을 했나
- 문제 제기: 기존 옴니모달 토큰 압축 방법은 한 감각(주로 오디오)의 중요도 점수로 다른 감각(비디오)에서 남길 토큰을 정하는데, 실제로는 같은 질문에서도 오디오가 중요한 순간과 비디오가 중요한 순간이 서로 다른 경우가 많아 이 방식이 답에 필요한 정보를 지워버릴 수 있다.
- 방법: OmniScope는 질문(query)을 두 감각이 공유하는 기준점으로 삼되, 오디오와 비디오 각각 독립적으로 중요도를 계산해 토큰 예산을 나눈다. 비디오 쪽은 앵커-델타 방식으로 전체 장면 정보와 시간에 따른 변화 정보를 번갈아 남기고(AD-STC), 오디오 쪽은 1초 단위로 비슷한 토큰을 합쳐(병합) 시간의 연속성을 유지하면서 중복을 줄인다.
- 검증: 4개의 오디오-비디오 이해 벤치마크(WorldSense, DailyOmni, OmniVideoBench, Video-MME)와 Qwen2.5-Omni 모델 두 크기(7B, 3B)에서 여러 압축 비율로 테스트했다.
- 결과: 45% 토큰만 남겨도 정확도 손실이 거의 없었고, 25%만 남기는 강한 압축에서도 7B 모델 기준 평균 정확도가 전체 토큰 사용 대비 0.35점만 떨어졌다(비교 대상 OmniZip은 1.55점 하락). 동시에 최대 3.53배의 프리필(첫 입력 처리) 속도 향상과 15% 이상의 GPU 메모리 절감을 확인했다.
- 분석: 압축을 하면 서로 다른 시간대·감각 간 정보 교환(어텐션)이 강해지는데, 한쪽 감각이 다른 쪽을 잘못 이끌면 이 강화된 교환이 답과 무관한 신호로 향하는 반면, 각 감각이 독립적으로 압축하면 이 교환이 실제로 질문에 필요한 신호로 향한다는 점을 실험으로 보였다.


실제로 확인된 결과
- 25% 토큰만 남긴 강한 압축에서 7B 모델 평균 정확도가 전체 토큰 대비 0.35점 하락했으며, 비교 방법인 OmniZip은 1.55점, FastV는 0.82점, 무작위 압축은 1.57점 하락해 OmniScope가 가장 손실이 적었다.
- 45% 토큰 유지 설정에서는 7B와 3B 모델 모두 전체 토큰 대비 오히려 소폭 상승(+0.30, +0.03)하거나 거의 동일한 정확도를 보였다.
- 7B 모델에서 25% 유지 시 프리필 시간이 6299ms에서 1784ms로 줄어 3.53배 빨라졌고, GPU 메모리는 28.31G에서 24.00G로 약 15% 이상 줄었다.
- 오디오와 비디오 각각에 독립적으로 압축 비율을 바꿔가며 실험한 결과(그림4), OmniScope가 비교 방법들보다 정확도 하락 곡선이 가장 완만했다.
- 질문 기반 중요도 계산을 양쪽 모두 균일 압축으로 바꾸면 평균 1.65점 하락, 한쪽만 다른 쪽을 이끌게 하면 1.0점 안팎 하락해 독립적 압축 방식의 효과가 확인됐다.


어디에 쓸 수 있나
- 실시간 화상 통화나 영상 스트리밍에서 소리와 화면을 함께 분석해야 하는 서비스의 처리 속도·메모리 개선 시도
- 긴 영상에 대한 질의응답, 콘텐츠 검열, 영상 캡션 생성 등에서 추가 학습 없이 기존 옴니모달 모델의 추론 비용을 줄이는 용도
- 자원이 제한된 기기(엣지 디바이스)에서 오디오-비디오 모델을 돌릴 때 참고할 수 있는 압축 설계 원칙


한계와 남은 검증
- 실험은 Qwen2.5-Omni 계열(7B, 3B) 모델과 특정 4개 벤치마크에 한정되어 있어 다른 옴니모달 모델 구조에서의 동작은 확인되지 않았다.
- 비디오 입력을 128프레임으로 제한한 조건에서 측정한 결과이며, 이보다 훨씬 긴 영상이나 다른 데이터 조건에서는 별도 검증이 필요하다.
- 비디오 쪽 중요도 계산에는 외부 CLIP 모델을 별도로 돌려야 해 일정한 고정 비용이 추가되며, 짧은 답변 생성 상황에서는 이 비용이 상대적으로 크게 느껴질 수 있다.
- 학습이 필요한 비교 방법(OmniSIFT)은 코드가 공개되지 않아 직접 비교하지 못했다.
- 오디오 쪽 내부 임베딩을 이용한 중요도 계산이 비디오에도 그대로 적용될 만큼 정교하지 않다고 저자들이 밝혀, 비디오는 여전히 외부 모델(CLIP)에 의존한다.


왜 중요한가
실시간 화상 상담, 영상 검색, 콘텐츠 검열처럼 소리와 영상을 함께 이해해야 하는 서비스는 처리할 토큰이 많아 속도와 메모리가 문제인데, OmniScope는 추가 학습 없이 이 문제를 줄이는 실용적인 설계 원칙을 제시한다. 특정 모델 구조에 크게 의존하지 않는 방식이라 다른 옴니모달 모델에도 적용을 시도해볼 수 있다는 점에서 실무적으로 참고할 만하다.
이 논문의 용어
- 옴니모달 대형언어모델(OmniLLM) · 영상, 소리, 텍스트를 한 모델이 동시에 처리하는 AI
- 토큰 압축 · 모델이 처리해야 할 정보 조각(토큰) 수를 줄여 속도와 메모리를 아끼는 기법
- 쿼리(query) · 사용자가 던진 질문. 이 논문에서는 압축 시 무엇을 남길지 판단하는 기준으로 쓰인다
- 앵커-델타 압축(AD-STC) · 일부 프레임은 전체 장면 정보를 남기고(앵커), 나머지 프레임은 변화한 부분만 남기는(델타) 비디오 압축 방식
- 프리필(prefill) · 모델이 답을 만들기 전에 입력 전체를 한 번 처리하는 단계
본문에 싣지 못한 그림
- Figure 6
- Figure 7
- Figure 8
- Figure 9
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Jinsen Su et al., arXiv:2607.23193, arxiv-nonexclusive