LLM은 데이터 오류 검사에서 만능이 아니다: 어떤 작업이냐에 따라 쓸모가 갈린다
LLM은 데이터 오류 검사에서 만능이 아니다: 어떤 작업이냐에 따라 쓸모가 갈린다
GPT-4o-mini를 이커머스 데이터 품질 검사 두 가지 작업(중복 상품 매칭, 브랜드 오표기 탐지)에 투입해 규칙 기반 방법과 비교했다. 상품명 문자열이 비슷한 매칭 작업에서는 단순 규칙과 성능이 거의 같았지만, 배경지식이 필요한 브랜드 오표기 탐지에서는 LLM이 크게 앞섰다. 또한 같은 질문을 반복해도 LLM은 99% 이상 똑같이 답했지만, 소규모 샘플로 검증한 프롬프트 개선안은 전체 데이터에 적용하자 오히려 성능이 떨어졌다.
METAL MEDIA 해설 도표
LLM은 데이터 오류 검사에서 만능이 아니다: 어떤 작업이냐에 따라 쓸모가 갈린다
- 01Abt-Buy 벤치마크(레이블 있는 상품 쌍 2,194개)에서 같은 상품인지 판별하는 작업을 단어 겹침 기반 규칙(자카드 유사도)과 LLM 제로샷 프롬프팅으로 각각 수행해 비교했다
- 02아마존 상품 500개에 인위적으로 제조사명을 뒤바꿔 넣은 데이터로 브랜드 오표기 탐지 작업도 같은 방식으로 비교했다
- 03상품 매칭에서는 규칙 기반(F1 0.950)과 LLM 제로샷(F1 0.948)이 거의 동일했지만, 브랜드 오표기 탐지에서는 LLM(F1 0.833)이 단순 규칙(F1 0.721)을 크게 앞섰다
- 04소규모 표본(오류 67건+정상 50건)에서 효과적으로 보인 프롬프트 개선(모델명·SKU 코드 우선 지시)을 전체 2,194쌍에 적용하자 F1이 0.948에서 0.914로 오히려 떨어졌다
- 05같은 200개 쌍을 온도 0.7로 5번 반복 질문했을 때 평균 99.7% 일치율을 보였고, 5번 답변 다수결을 써도 F1은 0.005밖에 오르지 않아 5배 비용 대비 실익이 적었다
무엇을 했나
- Abt-Buy 벤치마크(레이블 있는 상품 쌍 2,194개)에서 같은 상품인지 판별하는 작업을 단어 겹침 기반 규칙(자카드 유사도)과 LLM 제로샷 프롬프팅으로 각각 수행해 비교했다
- 아마존 상품 500개에 인위적으로 제조사명을 뒤바꿔 넣은 데이터로 브랜드 오표기 탐지 작업도 같은 방식으로 비교했다
- 상품 매칭에서는 규칙 기반(F1 0.950)과 LLM 제로샷(F1 0.948)이 거의 동일했지만, 브랜드 오표기 탐지에서는 LLM(F1 0.833)이 단순 규칙(F1 0.721)을 크게 앞섰다
- 소규모 표본(오류 67건+정상 50건)에서 효과적으로 보인 프롬프트 개선(모델명·SKU 코드 우선 지시)을 전체 2,194쌍에 적용하자 F1이 0.948에서 0.914로 오히려 떨어졌다
- 같은 200개 쌍을 온도 0.7로 5번 반복 질문했을 때 평균 99.7% 일치율을 보였고, 5번 답변 다수결을 써도 F1은 0.005밖에 오르지 않아 5배 비용 대비 실익이 적었다

| Method | Precision | Recall | F1 | Accuracy |
|---|---|---|---|---|
| Rule-based (Jaccard, threshold=0.2) | 0.994 | 0.910 | 0.950 | 0.952 |
| LLM zero-shot | 0.999 | 0.902 | 0.948 | 0.951 |
| LLM few-shot + SKU guidance | 0.994 | 0.846 | 0.914 | 0.920 |

| Method | Precision | Recall | F1 | Accuracy |
|---|---|---|---|---|
| Rule-based (manufacturer-title) | 0.564 | 1.000 | 0.721 | 0.622 |
| LLM zero-shot | 0.827 | 0.840 | 0.833 | 0.836 |

왜 중요한가
LLM을 데이터 정제 파이프라인에 도입하려는 실무자에게, 문자열이 비슷한 단순 매칭 작업에는 굳이 비싼 LLM을 쓸 필요가 없고 배경지식이 필요한 판단에서만 이득이 크다는 근거를 준다. 또한 소규모 샘플로 프롬프트를 검증하고 전체 배포에 확신을 갖는 관행이 위험할 수 있음을 구체적 수치로 보여준다.
이 논문의 용어
- 제로샷/퓨샷 프롬프팅 · 예시 없이(제로샷) 혹은 몇 개의 예시를 주고(퓨샷) 모델에게 작업을 지시하는 방식
- F1 점수 · 정밀도와 재현율을 함께 고려한 정확도 지표, 1에 가까울수록 좋음
- 자카드 유사도 · 두 텍스트가 공유하는 단어 비율로 유사성을 계산하는 단순 규칙 기반 방법
- 다수결(majority voting) · 같은 질문을 여러 번 물어본 뒤 가장 많이 나온 답을 최종 답으로 채택하는 방법
- 온도(temperature) · 모델 답변의 무작위성을 조절하는 값, 0이면 항상 같은 답, 높을수록 답이 달라질 가능성 커짐
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Praphulla Lal Shrestha et al., arXiv:2608.18158, CC BY 4.0