로마자로 쓴 우르두어 혐오 발언, AI 모델 전체를 다시 학습시키지 않고 일부만 조정해도 정확도가 크게 오른다
로마자로 쓴 우르두어 혐오 발언, AI 모델 전체를 다시 학습시키지 않고 일부만 조정해도 정확도가 크게 오른다
로마 우르두어는 남아시아 소셜미디어에서 널리 쓰이지만 철자 표기가 제각각이라 AI가 혐오 발언을 걸러내기 어려운 언어다. 연구진은 Mistral, LLaMA, Falcon, Gemma, DeepSeek, 다국어 BERT 등 여섯 개 언어모델을 아무 학습 없이 바로 쓰는 방식(제로샷)과, 모델 전체가 아니라 일부 파라미터만 학습시키는 LoRA 방식으로 각각 시험했다. 제로샷은 최고 성능 모델도 F1 점수 0.56에 그쳤지만, LoRA로 미세조정한 뒤에는 최고 모델(Mistral-7B)이 F1 0.93 이상을 기록했다.
METAL MEDIA 해설 도표
로마자로 쓴 우르두어 혐오 발언, AI 모델 전체를 다시 학습시키지 않고 일부만 조정해도 정확도가 크게 오른다
- 017만 2000여 개의 로마 우르두어 소셜미디어 댓글로 구성된 PURUTT 데이터셋 사용, 이 중 약 18%가 혐오성(toxic) 댓글로 표시됨
- 02여섯 개 트랜스포머 모델을 제로샷(추가 학습 없음)과 LoRA 미세조정(전체 모델이 아니라 약 700만 개 파라미터만 학습, 메모리 절약을 위해 4비트로 압축) 두 조건에서 비교
- 03제로샷 모델은 혐오 발언이 아닌 댓글도 혐오로 잘못 판정하는 경우가 많았고, 모델에 따라 F1 점수가 0.15에서 0.56 사이에 머물렀다
- 04LoRA 미세조정 후에는 모든 모델의 F1 점수가 0.75~0.94로 뛰었고, 그중 Mistral-7B-v0.3이 0.9387로 가장 높았다
- 05혐오성 댓글이 전체의 18%뿐인 데이터 불균형을 보정하기 위해 클래스 가중치(cost-sensitive learning) 기법을 적용했다
무엇을 했나
- 7만 2000여 개의 로마 우르두어 소셜미디어 댓글로 구성된 PURUTT 데이터셋 사용, 이 중 약 18%가 혐오성(toxic) 댓글로 표시됨
- 여섯 개 트랜스포머 모델을 제로샷(추가 학습 없음)과 LoRA 미세조정(전체 모델이 아니라 약 700만 개 파라미터만 학습, 메모리 절약을 위해 4비트로 압축) 두 조건에서 비교
- 제로샷 모델은 혐오 발언이 아닌 댓글도 혐오로 잘못 판정하는 경우가 많았고, 모델에 따라 F1 점수가 0.15에서 0.56 사이에 머물렀다
- LoRA 미세조정 후에는 모든 모델의 F1 점수가 0.75~0.94로 뛰었고, 그중 Mistral-7B-v0.3이 0.9387로 가장 높았다
- 혐오성 댓글이 전체의 18%뿐인 데이터 불균형을 보정하기 위해 클래스 가중치(cost-sensitive learning) 기법을 적용했다
왜 중요한가
이 결과는 대규모 라벨링 데이터나 막대한 연산 자원이 없는 언어에서도 실용적인 혐오 발언 탐지 시스템을 만들 수 있는 길을 보여준다. 모델 전체를 재학습시키는 대신 일부만 가볍게 조정하는 방식이 로마 우르두어를 넘어 다른 자원 부족 언어의 콘텐츠 관리에도 현실적인 대안이 될 수 있음을 시사한다.
이 논문의 용어
- 저자원 언어(Low-Resource Language) · 라벨링된 데이터나 자연어처리 도구가 부족해 AI 모델이 다루기 어려운 언어
- 제로샷 추론(Zero-shot inference) · 별도의 추가 학습 없이 사전학습된 모델을 그대로 새로운 과제에 적용하는 방식
- LoRA(저랭크 적응) · 모델 원래 가중치는 고정한 채 작은 추가 행렬만 학습시켜 미세조정 비용을 줄이는 기법
- PEFT(파라미터 효율적 미세조정) · 모델 전체가 아니라 일부 파라미터만 업데이트해 적은 자원으로 모델을 특정 과제에 맞추는 방법군
- F1 점수 · 정밀도와 재현율을 함께 고려한 지표로, 데이터가 한쪽으로 치우쳤을 때 특히 유용하다
- 4비트 NF4 양자화 · 모델 내부 수치를 4비트로 압축해 학습·추론 시 메모리 사용량을 줄이는 기법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다