AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가
AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가
CLIP, SigLIP 같은 이미지-문장 매칭 AI는 텍스트 프롬프트(질문 문구)를 여러 개 섞어 쓰면 성능이 좋아진다고 알려져 있지만, 음식 사진에서는 잘 통하고 식물병 사진에서는 잘 안 통한다는 것을 이 논문이 보였다. 연구진은 프롬프트별로 얼마나 믿을 만한지 점수를 매기는 기존 기법 ZPE를 분석하고, 프롬프트들이 서로 얼마나 의견이 다른지를 이용해 AI가 틀릴 것 같은 순간을 미리 감지하는 PID라는 방법을 새로 제안했다. 그 결과 익숙한 영역(음식)에서는 AI 스스로의 확신도만으로 충분했지만, 낯선 영역(식물병)에서는 PID가 훨씬 더 정확하게 오답 위험을 잡아냈다.
METAL MEDIA 해설 도표
AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가
- 01CLIP과 SigLIP 두 계열, 총 6개 모델을 음식 데이터셋 2개(Food-101, Food-11)와 농업 데이터셋 2개(Agricultural crops, Beans 콩잎병)에 적용해 비교했다.
- 02프롬프트마다 얼마나 판별력이 있는지 라벨 없이 점수를 매겨 가중치를 주는 기존 기법 ZPE(Zero-shot Prompt Ensembling)를 분석한 결과, 학습 데이터와 비슷한 음식 영역에서는 효과가 크지 않았지만 낯선 콩잎병 영역에서는 정확도를 크게 끌어올렸다.
- 03프롬프트 문구를 단어 단위로 뜯어보니 'aerial(항공)', 'view(시점)'처럼 구체적 시각 정보를 담은 단어는 좋은 프롬프트와 연관되고, 'type', 'demonstration'처럼 추상적인 단어는 나쁜 프롬프트와 연관됐다.
- 04음식 영역과 농업 영역에서 좋은 프롬프트 목록을 비교하니 상관계수 0.765로 상당히 겹쳐, 한 분야에서 검증한 프롬프트 품질 판단이 다른 분야에도 어느 정도 옮겨갈 수 있음을 보였다.
- 05새로 제안한 PID는 여러 프롬프트의 예측이 서로 얼마나 어긋나는지를 신뢰도 신호로 활용하는데, 콩잎병 데이터에서 CLIP-B/16 모델 기준으로 기존 방식(모델 스스로의 확신도, AUROC 0.275)보다 PID(AUROC 0.646)가 오답 예측력에서 훨씬 앞서 이번 실험 전체에서 가장 큰 차이(+0.37)를 보였다.
무엇을 했나
- CLIP과 SigLIP 두 계열, 총 6개 모델을 음식 데이터셋 2개(Food-101, Food-11)와 농업 데이터셋 2개(Agricultural crops, Beans 콩잎병)에 적용해 비교했다.
- 프롬프트마다 얼마나 판별력이 있는지 라벨 없이 점수를 매겨 가중치를 주는 기존 기법 ZPE(Zero-shot Prompt Ensembling)를 분석한 결과, 학습 데이터와 비슷한 음식 영역에서는 효과가 크지 않았지만 낯선 콩잎병 영역에서는 정확도를 크게 끌어올렸다.
- 프롬프트 문구를 단어 단위로 뜯어보니 'aerial(항공)', 'view(시점)'처럼 구체적 시각 정보를 담은 단어는 좋은 프롬프트와 연관되고, 'type', 'demonstration'처럼 추상적인 단어는 나쁜 프롬프트와 연관됐다.
- 음식 영역과 농업 영역에서 좋은 프롬프트 목록을 비교하니 상관계수 0.765로 상당히 겹쳐, 한 분야에서 검증한 프롬프트 품질 판단이 다른 분야에도 어느 정도 옮겨갈 수 있음을 보였다.
- 새로 제안한 PID는 여러 프롬프트의 예측이 서로 얼마나 어긋나는지를 신뢰도 신호로 활용하는데, 콩잎병 데이터에서 CLIP-B/16 모델 기준으로 기존 방식(모델 스스로의 확신도, AUROC 0.275)보다 PID(AUROC 0.646)가 오답 예측력에서 훨씬 앞서 이번 실험 전체에서 가장 큰 차이(+0.37)를 보였다.
| Model | F101 | F11 | Agri. | Beans | Avg |
|---|---|---|---|---|---|
| CLIP-B/32 | 0.830 | 0.809 | 0.616 | 0.287 | 0.636 |
| CLIP-B/16 | 0.881 | 0.810 | 0.709 | 0.307 | 0.677 |
| CLIP-L/14 | 0.932 | 0.848 | 0.780 | 0.398 | 0.740 |
| SigLIP-B | 0.912 | 0.844 | 0.869 | 0.404 | 0.757 |
| SigLIP-L | 0.943 | 0.845 | 0.910 | 0.635 | 0.833 |
| SigLIP-400M | 0.957 | 0.842 | 0.941 | 0.635 | 0.844 |
왜 중요한가
농업·식품 분야처럼 학습 데이터에 잘 없는 전문 영역에 범용 AI를 쓸 때, 언제 AI를 믿고 언제 의심해야 하는지 알려주는 실용적 신호를 제공한다. 라벨(정답) 없이도 프롬프트 품질과 AI의 실패 가능성을 미리 짚어낼 수 있어, 실제 서비스에 배포하기 전 위험 구간을 찾는 데 도움이 된다.
이 논문의 용어
- 제로샷 분류 · 정답 예시를 따로 학습하지 않고, 텍스트 설명만으로 이미지를 분류하는 방식
- 프롬프트 앙상블 · 같은 클래스를 여러 문구(프롬프트)로 물어본 뒤 결과를 종합하는 기법
- ZPE(Zero-shot Prompt Ensembling) · 정답 라벨 없이 각 프롬프트의 판별력을 점수화해 가중치를 주는 기존 기법
- PID(Prompt-based Inconsistency Detection) · 여러 프롬프트의 예측이 서로 얼마나 어긋나는지를 측정해 AI가 틀릴 위험을 미리 알려주는 이 논문의 새 방법
- OOD(도메인 밖 데이터) · AI가 학습할 때 거의 보지 못한, 학습 분포와 동떨어진 낯선 데이터
- AUROC · 어떤 판별 기준이 맞고 틀림을 얼마나 잘 구분하는지 나타내는 성능 지표, 1에 가까울수록 좋음
본문에 싣지 못한 그림
- Figure 1: Zero-shot performance for SigLIP SO400M and CLIP ViT-L/14 (all prompt pools).
- Figure 2: Word discriminability of top vs. bottom 25% ZPE-ranked prompts per dataset (SigLIP-SO400M, Pool-247).
- Figure 3: Cross-domain ZPE-norm prompt scores: Food vs. Agriculture (SigLIP-SO400M, Pool-247). ρ=0.765 indicates strong cross-domain prompt quality transferability.
- Figure 4: PID-based uncertainty evaluation across all prompt pools.
- Figure 5: PID AUROC as a function of τa across all datasets and prompt pools. Peaked curves (Food) indicate quality-gating is beneficial; monotonically increasing curves (Beans with CLIP) indicate full domain shift.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다