AI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
AI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
밝기 변화와 흔들림처럼 여러 왜곡이 동시에 섞인 입력에서 AI 모델이 얼마나 잘 버티는지 확인하려면 조합 경우의 수가 폭발적으로 늘어난다. TESTNAV는 '성능이 많이 떨어지면서도 원본과 비슷하게 보이는' 조합을 두 목표 사이의 균형점(파레토 프론트)으로 정의하고, 진화 알고리즘 NSGA-II로 이를 효율적으로 찾아낸다. 이미지, 문장, 코드 네 개 벤치마크에서 전체 경우의 수의 35.8~89.3%만 확인하고도 기존 탐색법보다 최대 2.15배 빠르게 같은 결과를 얻었다.
METAL MEDIA 해설 도표
AI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- 01밝기, 블러, 노이즈 등 여러 손상을 동시에 조합해 테스트하면 실제 상황과 비슷하지만, 경우의 수가 4개 차원×6단계면 1,296가지로 폭발적으로 늘어나고 그중 상당수는 비현실적으로 심하게 망가진 입력이라 진단 가치가 낮다는 문제를 다뤘다
- 02TESTNAV는 '모델 성능이 얼마나 떨어지는가(성능 저하)'와 '왜곡된 입력이 원본과 얼마나 비슷한가(입력 충실도)'라는 두 목표를 동시에 만족시키는 조합만 골라내는 다목적 최적화 문제로 문제를 재정의했다
- 03이미지에는 SSIM·KID, 문장·코드에는 chrF·BERT-F1 같은 분야별 유사도 지표로 충실도를 재고, 두 목표를 동시에 최적화하는 진화 알고리즘 NSGA-II로 전체 경우를 다 안 보고도 최적 조합 집합(파레토 프론트)을 근사했다
- 04Tiny-ImageNet, QQP, HumanEval, MBPP 네 개 벤치마크에서 전체 1,296개 조합을 모두 평가해 정답을 만든 뒤 비교한 결과, TESTNAV는 기존 탐색법 대비 최대 2.15배 빠르게, 전체 경우의 수의 35.8~89.3%만 평가하고도 동일한 결과에 도달했다
- 05성능 저하만 보거나 충실도만 보는 단일 목표 탐색, 또는 신경망 내부 활성화 패턴을 보는 기존 커버리지 지표들은 모두 TESTNAV보다 결과가 떨어져, 두 목표를 함께 봐야 한다는 점을 확인했다
무엇을 했나
- 밝기, 블러, 노이즈 등 여러 손상을 동시에 조합해 테스트하면 실제 상황과 비슷하지만, 경우의 수가 4개 차원×6단계면 1,296가지로 폭발적으로 늘어나고 그중 상당수는 비현실적으로 심하게 망가진 입력이라 진단 가치가 낮다는 문제를 다뤘다
- TESTNAV는 '모델 성능이 얼마나 떨어지는가(성능 저하)'와 '왜곡된 입력이 원본과 얼마나 비슷한가(입력 충실도)'라는 두 목표를 동시에 만족시키는 조합만 골라내는 다목적 최적화 문제로 문제를 재정의했다
- 이미지에는 SSIM·KID, 문장·코드에는 chrF·BERT-F1 같은 분야별 유사도 지표로 충실도를 재고, 두 목표를 동시에 최적화하는 진화 알고리즘 NSGA-II로 전체 경우를 다 안 보고도 최적 조합 집합(파레토 프론트)을 근사했다
- Tiny-ImageNet, QQP, HumanEval, MBPP 네 개 벤치마크에서 전체 1,296개 조합을 모두 평가해 정답을 만든 뒤 비교한 결과, TESTNAV는 기존 탐색법 대비 최대 2.15배 빠르게, 전체 경우의 수의 35.8~89.3%만 평가하고도 동일한 결과에 도달했다
- 성능 저하만 보거나 충실도만 보는 단일 목표 탐색, 또는 신경망 내부 활성화 패턴을 보는 기존 커버리지 지표들은 모두 TESTNAV보다 결과가 떨어져, 두 목표를 함께 봐야 한다는 점을 확인했다

| Dataset 𝒟 | Size | Model | Perturbations | Fidelity ϕ | Task ψ | Clean ψ(𝒟) | |
|---|---|---|---|---|---|---|---|
| Tiny-ImageNet | 10,000 | CaiT-S36 | speckle noise, glass blur, brightness, pixelate | KID, SSIM | Accuracy | 86.7% | |
| QQP | 1,000 | RoBERTa-base | synonym, typo, contraction, punctuation | BERT-F1, chrF | Accuracy | 91.2% | |
| HumanEval | 164 | CodeGen-2B-mono | butterfingers, char case, whitespace, newline | BERT-F1, chrF | RP5@1 | 23.2% | |
| MBPP | 974 | CodeGen-2B-mono | butterfingers, char case, whitespace, newline | BERT-F1, chrF | RP5@1 | 31.9% |


| Method | SSIM | KID | chrF | BERT-F1 | chrF | BERT-F1 | chrF | BERT-F1 |
|---|---|---|---|---|---|---|---|---|
| TestNav | 0.704 | 0.686 | 0.646 | 0.651 | 0.729 | 0.730 | 0.697 | 0.690 |
| Greedy Search | 0.557 | 0.464 | 0.638 | 0.782 | 0.742 | 0.783 | 0.681 | 0.751 |
| Genetic Algorithm | 0.540 | 0.552 | 0.693 | 0.707 | 0.753 | 0.767 | 0.640 | 0.631 |
| Random Search | 0.510 | 0.503 | 0.526 | 0.514 | 0.502 | 0.522 | 0.514 | 0.490 |

| Metric pair | 𝒫∗ | Θ1 | Θ2 | Θ3 | Θ4 |
|---|---|---|---|---|---|
| (δ,ρSSIM) | 27 | 9 | 12 | 4 | 2 |
| (δ,ρKID) | 27 | 4 | 7 | 14 | 2 |
왜 중요한가
AI 모델을 실전에 배포하기 전 모든 왜곡 조합을 다 테스트하는 것은 계산 비용이 너무 커서 현실적으로 불가능한데, TESTNAV는 한정된 시험 횟수 안에서 자율주행이나 의료 영상처럼 여러 손상이 동시에 나타나는 환경에서 실제로 위험한 실패 사례를 효율적으로 찾아내는 방법을 제시한다. 이는 모델 검증팀이 제한된 자원으로 더 신뢰할 수 있는 견고성 테스트를 설계하는 데 실질적인 지침이 된다.
이 논문의 용어
- 파레토 프론트(Pareto front) · 한쪽을 개선하면 다른 쪽이 나빠질 수밖에 없는, 두 목표 사이의 최적 균형점들의 집합
- NSGA-II · 여러 목표를 동시에 최적화하기 위해 사용하는 진화 알고리즘의 한 종류
- SSIM/KID · 이미지가 원본과 얼마나 비슷한지 구조·통계적으로 비교하는 지표
- chrF/BERT-F1 · 문장이나 코드가 원본 텍스트와 얼마나 비슷한지 재는 지표
- Recall@P* · 탐색 과정에서 실제 최적 조합 집합 중 얼마나 많이 찾아냈는지 나타내는 비율
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Arooj Arif et al., arXiv:2608.19882, CC BY 4.0