텍스트와 이미지가 겉으로는 잘 맞아도 속뜻이 어긋나면 비꼬는 말이다, AI가 그 함정을 잡아낸다
텍스트와 이미지가 겉으로는 잘 맞아도 속뜻이 어긋나면 비꼬는 말이다, AI가 그 함정을 잡아낸다
글과 사진을 함께 올리는 SNS 게시물에서 비꼼(풍자)을 감지하는 AI는 표면적으로 말과 그림이 잘 어울려 보여도 실제로는 반대 의미를 담고 있는 경우를 놓치기 쉬웠다. 이 연구는 텍스트와 이미지 중 어느 쪽이 더 결정적인 단서인지 게시물마다 다르게 판단하는 장치와, 겉보기 일치가 오히려 함정임을 학습시키는 대조 학습 기법을 결합한 프레임워크를 제안한다. MMSD와 MMSD2.0이라는 두 벤치마크 실험에서 기존 강력한 비교 모델들보다 꾸준히 높은 성능을 보였다.
METAL MEDIA 해설 도표
텍스트와 이미지가 겉으로는 잘 맞아도 속뜻이 어긋나면 비꼬는 말이다, AI가 그 함정을 잡아낸다
- 01게시물마다 텍스트와 이미지 중 어느 것이 비꼼의 핵심 단서인지 다르다는 점에 착안해, 두 모달리티(정보 형태) 정보를 양방향으로 걸러내고 사례별로 비중을 다르게 조절하는 '동적 게이트 융합' 모듈을 만들었다
- 02비꼬는 게시물은 말과 그림이 표면적으로는 잘 맞아 보이지만 속뜻은 반대인 경우가 많다는 점을 노려, 비꼼이 아닌 경우에는 텍스트-이미지 유사도를 높이고 비꼼인 경우에는 그 유사도를 억누르는 'SaCR'이라는 대조 정규화 기법을 도입했다
- 03CLIP이라는 사전학습 비전-언어 모델로 텍스트와 이미지 특징을 뽑은 뒤, 값(value) 단계에서 게이트를 걸어 불필요하거나 오도하는 신호를 거르는 양방향 교차 주의(attention) 메커니즘을 적용했다
- 04최종 분류 손실, 텍스트/이미지 단일 모달 보조 분류 손실, SaCR 대조 손실을 한꺼번에 최적화하는 다중 목표 학습으로 전체 모델을 엔드투엔드 학습시켰다
- 05MMSD와 MMSD2.0 두 데이터셋에서 강력한 비교 모델들 대비 F1 점수가 가장 높았고, 구성 요소를 하나씩 제거하는 실험에서 교차 모달 상호작용과 동적 융합 게이트를 제거했을 때 성능 저하가 가장 컸다
무엇을 했나
- 게시물마다 텍스트와 이미지 중 어느 것이 비꼼의 핵심 단서인지 다르다는 점에 착안해, 두 모달리티(정보 형태) 정보를 양방향으로 걸러내고 사례별로 비중을 다르게 조절하는 '동적 게이트 융합' 모듈을 만들었다
- 비꼬는 게시물은 말과 그림이 표면적으로는 잘 맞아 보이지만 속뜻은 반대인 경우가 많다는 점을 노려, 비꼼이 아닌 경우에는 텍스트-이미지 유사도를 높이고 비꼼인 경우에는 그 유사도를 억누르는 'SaCR'이라는 대조 정규화 기법을 도입했다
- CLIP이라는 사전학습 비전-언어 모델로 텍스트와 이미지 특징을 뽑은 뒤, 값(value) 단계에서 게이트를 걸어 불필요하거나 오도하는 신호를 거르는 양방향 교차 주의(attention) 메커니즘을 적용했다
- 최종 분류 손실, 텍스트/이미지 단일 모달 보조 분류 손실, SaCR 대조 손실을 한꺼번에 최적화하는 다중 목표 학습으로 전체 모델을 엔드투엔드 학습시켰다
- MMSD와 MMSD2.0 두 데이터셋에서 강력한 비교 모델들 대비 F1 점수가 가장 높았고, 구성 요소를 하나씩 제거하는 실험에서 교차 모달 상호작용과 동적 융합 게이트를 제거했을 때 성능 저하가 가장 컸다

| Dataset | Split | Total | Sarcastic | Non-sarcastic |
|---|---|---|---|---|
| MMSD | Train | 19,816 | 8,642 | 11,174 |
| Val | 2,410 | 959 | 1,451 | |
| Test | 2,409 | 959 | 1,450 | |
| MMSD2.0 | Train | 19,816 | 9,576 | 10,240 |
| Val | 2,410 | 1,042 | 1,368 | |
| Test | 2,409 | 1,037 | 1,372 |

| Modality | Method | MMSD | MMSD2.0 | ||||||
|---|---|---|---|---|---|---|---|---|---|
| Acc.% | P% | R% | F1% | Acc.% | P% | R% | F1% | ||
| Text | TextCNN | 80.03 | 74.29 | 76.39 | 75.32 | 71.61 | 64.62 | 75.22 | 69.52 |
| SMSD | 80.90 | 76.46 | 75.18 | 75.82 | 73.56 | 68.45 | 71.55 | 69.97 | |
| BERT | 83.60 | 78.50 | 82.51 | 80.45 | 76.52 | 74.48 | 73.09 | 73.91 | |
| Image | ResNet | 64.76 | 54.41 | 70.80 | 61.53 | 65.50 | 61.17 | 54.39 | 57.58 |
| ViT | 67.83 | 57.93 | 70.07 | 63.40 | 72.02 | 65.26 | 74.83 | 69.72 | |
| Multimodal | DIP | 89.59 | 87.76 | 86.58 | 87.17 | 80.96 | 78.02 | 77.56 | 77.79 |
| Multi-view CLIP | 88.33 | 82.66 | 88.65 | 85.55 | 85.64 | 80.33 | 88.24 | 84.10 | |
| MoBA | 88.96 | 82.84 | 88.12 | 85.40 | 85.83 | 80.42 | 88.67 | 84.34 | |
| G2SAM | 90.48 | 87.95 | 89.02 | 88.48 | 79.43 | 72.04 | 78.07 | 78.07 | |
| TFCD | 89.57 | 84.83 | 89.43 | 88.13 | 86.54 | 82.46 | 87.95 | 84.31 | |
| DGLF | 89.43 | 85.81 | 89.27 | 87.51 | 86.82 | 81.90 | 89.85 | 85.69 | |
| LLaVA+RAG | 89.97 | 89.26 | 89.58 | 89.42 | 86.43 | 87.00 | 86.30 | 86.34 | |
| ESAM | 90.11 | 86.87 | 89.54 | 88.19 | 85.87 | 83.12 | 86.05 | 84.56 | |
| GPT-5.4 (zeroshot) | 71.05 | 76.51 | 75.50 | 71.01 | 72.85 | 78.79 | 75.78 | 72.55 | |
| Ours | 92.62 | 91.96 | 92.82 | 92.33 | 89.66 | 89.36 | 89.74 | 89.51 |

| Variant | MMSD | MMSD2.0 | ||
|---|---|---|---|---|
| Acc.% | F1% | Acc.% | F1% | |
| Full | 92.62 | 92.33 | 89.66 | 89.36 |
| w/o CMI | 87.91 | 87.42 | 85.10 | 84.97 |
| w/o BiXAtt (only v→t) | 87.48 | 87.03 | 81.86 | 81.70 |
| w/o BiXAtt (only t→v) | 81.84 | 81.07 | 80.53 | 80.37 |
| w/o VGate | 92.08 | 91.77 | 88.71 | 88.59 |
| w/o DFGate | 90.35 | 89.80 | 88.34 | 88.28 |
| w/o SaCR | 91.28 | 91.00 | 88.54 | 88.49 |
| w/o UniAux | 91.31 | 90.92 | 89.16 | 89.03 |
왜 중요한가
온라인 게시물의 감정과 의도를 정확히 파악하려는 서비스(콘텐츠 조정, 여론 분석, 챗봇 응답 등)에서 비꼼을 놓치면 정반대로 해석하는 오류가 생길 수 있어, 이런 함정을 구조적으로 다루는 방법론은 실무 적용 가치가 크다. 또한 텍스트와 이미지가 겉보기엔 어울려도 실제 의미는 어긋날 수 있다는 통찰은 비꼼 탐지를 넘어 다른 멀티모달 이해 문제에도 참고가 될 수 있다.
이 논문의 용어
- 멀티모달 풍자 탐지(MSD) · 텍스트와 이미지처럼 서로 다른 형태의 정보를 함께 보고 비꼬는 의도를 찾아내는 작업
- CLIP · 텍스트와 이미지를 같은 공간에서 비교할 수 있게 사전학습된 비전-언어 모델
- 게이트(gate) · 신호를 얼마나 통과시킬지 0~1 사이 값으로 조절하는 학습 가능한 장치
- 대조 학습(contrastive regularization) · 비슷한 것끼리는 가깝게, 다른 것끼리는 멀게 표현을 학습시키는 보조 학습 방식
- Grad-CAM · 모델이 이미지의 어느 부분을 근거로 판단했는지 시각적으로 보여주는 기법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Hao Guo et al., arXiv:2608.19942, arxiv-nonexclusive