컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가

arXiv:2608.181162026-08-20

You Are What You Prompt: Prompt Quality, Domain Shift, and Uncertainty in Agrifood Vision-Language Models

AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가

CLIP, SigLIP 같은 이미지-문장 매칭 AI는 텍스트 프롬프트(질문 문구)를 여러 개 섞어 쓰면 성능이 좋아진다고 알려져 있지만, 음식 사진에서는 잘 통하고 식물병 사진에서는 잘 안 통한다는 것을 이 논문이 보였다. 연구진은 프롬프트별로 얼마나 믿을 만한지 점수를 매기는 기존 기법 ZPE를 분석하고, 프롬프트들이 서로 얼마나 의견이 다른지를 이용해 AI가 틀릴 것 같은 순간을 미리 감지하는 PID라는 방법을 새로 제안했다. 그 결과 익숙한 영역(음식)에서는 AI 스스로의 확신도만으로 충분했지만, 낯선 영역(식물병)에서는 PID가 훨씬 더 정확하게 오답 위험을 잡아냈다.

METAL MEDIA 해설 도표

AI에게 '음식 사진'과 '식물병 사진'을 같은 방식으로 물으면 왜 병 진단은 틀리는가

  1. 01CLIP과 SigLIP 두 계열, 총 6개 모델을 음식 데이터셋 2개(Food-101, Food-11)와 농업 데이터셋 2개(Agricultural crops, Beans 콩잎병)에 적용해 비교했다.
  2. 02프롬프트마다 얼마나 판별력이 있는지 라벨 없이 점수를 매겨 가중치를 주는 기존 기법 ZPE(Zero-shot Prompt Ensembling)를 분석한 결과, 학습 데이터와 비슷한 음식 영역에서는 효과가 크지 않았지만 낯선 콩잎병 영역에서는 정확도를 크게 끌어올렸다.
  3. 03프롬프트 문구를 단어 단위로 뜯어보니 'aerial(항공)', 'view(시점)'처럼 구체적 시각 정보를 담은 단어는 좋은 프롬프트와 연관되고, 'type', 'demonstration'처럼 추상적인 단어는 나쁜 프롬프트와 연관됐다.
  4. 04음식 영역과 농업 영역에서 좋은 프롬프트 목록을 비교하니 상관계수 0.765로 상당히 겹쳐, 한 분야에서 검증한 프롬프트 품질 판단이 다른 분야에도 어느 정도 옮겨갈 수 있음을 보였다.
  5. 05새로 제안한 PID는 여러 프롬프트의 예측이 서로 얼마나 어긋나는지를 신뢰도 신호로 활용하는데, 콩잎병 데이터에서 CLIP-B/16 모델 기준으로 기존 방식(모델 스스로의 확신도, AUROC 0.275)보다 PID(AUROC 0.646)가 오답 예측력에서 훨씬 앞서 이번 실험 전체에서 가장 큰 차이(+0.37)를 보였다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. CLIP과 SigLIP 두 계열, 총 6개 모델을 음식 데이터셋 2개(Food-101, Food-11)와 농업 데이터셋 2개(Agricultural crops, Beans 콩잎병)에 적용해 비교했다.
  2. 프롬프트마다 얼마나 판별력이 있는지 라벨 없이 점수를 매겨 가중치를 주는 기존 기법 ZPE(Zero-shot Prompt Ensembling)를 분석한 결과, 학습 데이터와 비슷한 음식 영역에서는 효과가 크지 않았지만 낯선 콩잎병 영역에서는 정확도를 크게 끌어올렸다.
  3. 프롬프트 문구를 단어 단위로 뜯어보니 'aerial(항공)', 'view(시점)'처럼 구체적 시각 정보를 담은 단어는 좋은 프롬프트와 연관되고, 'type', 'demonstration'처럼 추상적인 단어는 나쁜 프롬프트와 연관됐다.
  4. 음식 영역과 농업 영역에서 좋은 프롬프트 목록을 비교하니 상관계수 0.765로 상당히 겹쳐, 한 분야에서 검증한 프롬프트 품질 판단이 다른 분야에도 어느 정도 옮겨갈 수 있음을 보였다.
  5. 새로 제안한 PID는 여러 프롬프트의 예측이 서로 얼마나 어긋나는지를 신뢰도 신호로 활용하는데, 콩잎병 데이터에서 CLIP-B/16 모델 기준으로 기존 방식(모델 스스로의 확신도, AUROC 0.275)보다 PID(AUROC 0.646)가 오답 예측력에서 훨씬 앞서 이번 실험 전체에서 가장 큰 차이(+0.37)를 보였다.
Table 1: Average accuracy across pools using a uniform ensemble.
ModelF101F11Agri.BeansAvg
CLIP-B/320.8300.8090.6160.2870.636
CLIP-B/160.8810.8100.7090.3070.677
CLIP-L/140.9320.8480.7800.3980.740
SigLIP-B0.9120.8440.8690.4040.757
SigLIP-L0.9430.8450.9100.6350.833
SigLIP-400M0.9570.8420.9410.6350.844

왜 중요한가

농업·식품 분야처럼 학습 데이터에 잘 없는 전문 영역에 범용 AI를 쓸 때, 언제 AI를 믿고 언제 의심해야 하는지 알려주는 실용적 신호를 제공한다. 라벨(정답) 없이도 프롬프트 품질과 AI의 실패 가능성을 미리 짚어낼 수 있어, 실제 서비스에 배포하기 전 위험 구간을 찾는 데 도움이 된다.

이 논문의 용어

  • 제로샷 분류 · 정답 예시를 따로 학습하지 않고, 텍스트 설명만으로 이미지를 분류하는 방식
  • 프롬프트 앙상블 · 같은 클래스를 여러 문구(프롬프트)로 물어본 뒤 결과를 종합하는 기법
  • ZPE(Zero-shot Prompt Ensembling) · 정답 라벨 없이 각 프롬프트의 판별력을 점수화해 가중치를 주는 기존 기법
  • PID(Prompt-based Inconsistency Detection) · 여러 프롬프트의 예측이 서로 얼마나 어긋나는지를 측정해 AI가 틀릴 위험을 미리 알려주는 이 논문의 새 방법
  • OOD(도메인 밖 데이터) · AI가 학습할 때 거의 보지 못한, 학습 분포와 동떨어진 낯선 데이터
  • AUROC · 어떤 판별 기준이 맞고 틀림을 얼마나 잘 구분하는지 나타내는 성능 지표, 1에 가까울수록 좋음

본문에 싣지 못한 그림

  • Figure 1: Zero-shot performance for SigLIP SO400M and CLIP ViT-L/14 (all prompt pools).
  • Figure 2: Word discriminability of top vs. bottom 25% ZPE-ranked prompts per dataset (SigLIP-SO400M, Pool-247).
  • Figure 3: Cross-domain ZPE-norm prompt scores: Food vs. Agriculture (SigLIP-SO400M, Pool-247). ρ=0.765 indicates strong cross-domain prompt quality transferability.
  • Figure 4: PID-based uncertainty evaluation across all prompt pools.
  • Figure 5: PID AUROC as a function of τa across all datasets and prompt pools. Peaked curves (Food) indicate quality-gating is beneficial; monotonically increasing curves (Beans with CLIP) indicate full domain shift.
원문에서 그림 보기 →

저자 · Andrea Morales-Garz\'on, Salvador L\'opez-Joya, Miguel L\'opez-P\'erez, Maria J. Martin-Bautista

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사