텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
실제 환경에서는 음성, 영상, 텍스트 중 일부가 누락되거나 손상된 채로 들어오는 경우가 많아, 감정 분석 AI의 정확도가 떨어진다. 기존 방법들은 텍스트가 부족할 때 이를 대신할 '대리 표현'을 한 번만 만들어 바로 사용했는데, 이 초기 대리 표현이 부정확하면 오류가 뒤로 전파되는 문제가 있었다. 이 논문은 대리 표현을 한 번에 확정 짓지 않고 여러 단계에 걸쳐 점진적으로 고쳐나가는 방식을 제안해, MOSI, MOSEI, SIMS 세 데이터셋에서 기존 최고 성능 모델보다 안정적으로 더 나은 결과를 보였다.
METAL MEDIA 해설 도표
텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
- 01문제 상황: 실제 환경에서 텍스트, 음성, 영상 중 일부 정보가 누락되거나 노이즈가 섞여 들어오면, 기존 감정 분석 모델의 예측이 흔들린다
- 02기존 방식의 한계: 텍스트가 부실할 때 음성·영상 정보로 텍스트를 대신할 '대리 표현(proxy)'을 만들어 쓰는데, 이를 한 번만 만들고 바로 써버려서 초기 오류가 그대로 이어진다
- 03제안 방법: 음성과 영상 정보만으로 대리 표현을 처음 만든 뒤, 게이트가 달린 잔차 보정 방식으로 여러 단계에 걸쳐 이 대리 표현을 점차 다듬는다
- 04보정된 대리 표현은 실제 관찰된 텍스트 표현과, 그 텍스트가 얼마나 믿을만한지 점수를 매겨 적절한 비율로 섞어서 최종 판단에 사용한다
- 05학습 시에는 손상되지 않은 완전한 텍스트 표현을 기준점으로 삼아 각 보정 단계가 올바른 방향으로 가도록 안내하는 추가 학습 목표를 사용했다
무엇을 했나
- 문제 상황: 실제 환경에서 텍스트, 음성, 영상 중 일부 정보가 누락되거나 노이즈가 섞여 들어오면, 기존 감정 분석 모델의 예측이 흔들린다
- 기존 방식의 한계: 텍스트가 부실할 때 음성·영상 정보로 텍스트를 대신할 '대리 표현(proxy)'을 만들어 쓰는데, 이를 한 번만 만들고 바로 써버려서 초기 오류가 그대로 이어진다
- 제안 방법: 음성과 영상 정보만으로 대리 표현을 처음 만든 뒤, 게이트가 달린 잔차 보정 방식으로 여러 단계에 걸쳐 이 대리 표현을 점차 다듬는다
- 보정된 대리 표현은 실제 관찰된 텍스트 표현과, 그 텍스트가 얼마나 믿을만한지 점수를 매겨 적절한 비율로 섞어서 최종 판단에 사용한다
- 학습 시에는 손상되지 않은 완전한 텍스트 표현을 기준점으로 삼아 각 보정 단계가 올바른 방향으로 가도록 안내하는 추가 학습 목표를 사용했다
- 결과: MOSI, MOSEI, SIMS 세 벤치마크에서 기존 최고 성능 모델인 LNLN 대비 전반적으로 우수하거나 대등한 성능을 보였고, 특히 데이터가 많이 손상될수록 성능 저하가 더 완만했다
| Method | MOSI | MOSEI | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | |
| MISA | 29.85 | 33.08 | 71.49/70.00 | 71.28/70.33 | 1.085 | 0.524 | 40.84 | 39.39 | 71.27/75.82 | 63.85/68.73 | 0.780 | 0.503 |
| Self-MM | 29.55 | 34.67 | 70.51/69.26 | 66.60/67.54 | 1.070 | 0.512 | 44.70 | 45.38 | 73.89/77.42 | 68.92/72.31 | 0.695 | 0.498 |
| MMIM | 31.30 | 33.77 | 69.14/67.06 | 66.65/64.04 | 1.077 | 0.507 | 40.75 | 41.74 | 73.32/75.89 | 68.72/70.32 | 0.739 | 0.489 |
| CENET | 30.38 | 37.25 | 71.46/67.73 | 68.41/64.85 | 1.080 | 0.504 | 47.18 | 47.83 | 74.67/77.34 | 70.68/74.08 | 0.685 | 0.535 |
| TETFN | 30.30 | 34.34 | 69.76/67.68 | 65.69/63.29 | 1.087 | 0.507 | 40.30 | 47.70 | 69.76/67.68 | 65.69/63.29 | 1.087 | 0.508 |
| ALMT | 30.30 | 33.42 | 70.40/68.39 | 72.57/71.80 | 1.083 | 0.498 | 40.92 | 41.64 | 76.64/77.54 | 77.14/78.03 | 0.674 | 0.481 |
| LNLN | 34.26 | 38.27 | 72.55/70.94 | 72.73/71.25 | 1.046 | 0.527 | 45.42 | 46.17 | 76.30/78.19 | 77.77/79.95 | 0.692 | 0.530 |
| Ours | 34.52 | 38.55 | 73.27/71.93 | 73.03/71.93 | 1.046 | 0.532 | 47.10 | 47.94 | 78.20/78.94 | 78.46/80.00 | 0.664 | 0.595 |

| Method | Acc-5 | Acc-3 | Acc-2 | F1 | MAE | Corr |
|---|---|---|---|---|---|---|
| MISA | 31.53 | 56.87 | 72.71 | 66.30 | 0.539 | 0.348 |
| Self-MM | 32.28 | 56.75 | 72.81 | 68.43 | 0.508 | 0.376 |
| MMIM | 31.81 | 52.76 | 69.86 | 66.21 | 0.544 | 0.339 |
| CENET | 22.29 | 53.17 | 68.13 | 57.90 | 0.589 | 0.107 |
| TETFN | 33.42 | 56.91 | 73.58 | 68.67 | 0.505 | 0.387 |
| ALMT | 20.00 | 45.36 | 69.66 | 72.76 | 0.561 | 0.364 |
| LNLN | 34.64 | 57.14 | 72.73 | 79.43 | 0.514 | 0.397 |
| Ours | 35.13 | 58.28 | 73.05 | 76.29 | 0.498 | 0.404 |
| Method | MOSI | MOSEI | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | |
| T | 45.58 | 51.70 | 84.91 / 82.75 | 84.84 / 82.68 | 0.731 | 0.790 | 52.39 | 53.81 | 85.75 / 84.46 | 85.7 / 84.14 | 0.548 | 0.769 |
| A | 22.84 | 23.08 | 58.49 / 57.38 | 61.27 / 59.64 | 1.371 | 0.280 | 41.38 | 41.38 | 63.84 / 71.28 | 51.85 / 59.93 | 0.830 | 0.152 |
| V | 22.98 | 24.83 | 58.59 / 56.80 | 51.78 / 53.90 | 1.376 | 0.230 | 42.46 | 42.46 | 65.30 / 71.02 | 61.06 / 58.99 | 0.811 | 0.244 |
| T+A | 45.53 | 51.31 | 85.16 / 83.19 | 84.97 / 83.07 | 0.739 | 0.790 | 52.29 | 53.68 | 85.77 / 84.65 | 85.73 / 84.20 | 0.549 | 0.764 |
| T+V | 45.40 | 51.31 | 84.86 / 82.60 | 84.70 / 82.56 | 0.737 | 0.790 | 52.48 | 53.96 | 86.08 / 84.85 | 85.99 / 84.85 | 0.545 | 0.768 |
| A+V | 22.40 | 24.30 | 59.25 / 58.31 | 56.45 / 57.04 | 1.350 | 0.198 | 42.52 | 42.52 | 65.38 / 71.22 | 60.40 / 60.12 | 0.812 | 0.244 |
| Random | 34.52 | 38.55 | 73.27/71.93 | 73.03/71.93 | 1.046 | 0.532 | 47.10 | 47.94 | 78.20/78.94 | 78.46/80.00 | 0.664 | 0.595 |

| Method | MOSI | SIMS | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | Acc-5 | Acc-3 | Acc-2 | F1 | MAE | Corr | |
| FULL | 34.52 | 38.55 | 73.27/71.93 | 73.03/71.93 | 1.046 | 0.532 | 35.13 | 58.28 | 73.05 | 76.29 | 0.498 | 0.404 |
| w/o Proxy | 34.53 | 38.57 | 72.29 / 71.89 | 72.29 / 71.84 | 1.053 | 0.527 | 30.93 | 54.98 | 70.05 | 62.08 | 0.569 | 0.238 |
| w/o Iterative | 34.27 | 38.32 | 73.19 / 71.84 | 72.37 / 71.69 | 1.051 | 0.536 | 30.98 | 55.23 | 70.58 | 69.74 | 0.565 | 0.241 |
| w/o ℒcorr | 34.23 | 38.25 | 72.37 / 71.29 | 71.48 / 70.45 | 1.051 | 0.529 | 31.05 | 55.03 | 70.09 | 62.12 | 0.570 | 0.236 |
왜 중요한가
음성인식 오류, 통신 불안정, 사생활 보호를 위한 정보 차단 등으로 일부 정보가 빠진 채 들어오는 상황은 실제 서비스에서 흔하다. 이런 상황에서도 감정 분석이 안정적으로 작동해야 콜센터, 리뷰 분석, 대화형 AI 등에서 신뢰할 수 있는 판단을 내릴 수 있다.
이 논문의 용어
- 멀티모달 감정 분석(MSA) · 텍스트, 음성, 영상 등 여러 형태의 정보를 함께 활용해 감정 상태를 추정하는 작업
- 대리 표현(proxy) · 누락되거나 손상된 정보를 대신하기 위해 다른 정보로부터 만들어낸 보조 표현
- 게이트 잔차 보정 · 얼마나 수정할지를 조절하는 게이트와 함께, 기존 값에 수정치를 더해가며 점진적으로 고치는 방식
- 신뢰도 점수(reliability score) · 관찰된 텍스트 정보가 얼마나 믿을 만한지를 0에서 1 사이 값으로 추정한 점수
- MAE, F1, Acc · 각각 예측 오차 크기, 분류 정확도의 균형 지표, 정답을 맞춘 비율을 나타내는 평가 지표
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Zhifa Geng et al., arXiv:2608.19971, arxiv-nonexclusive