AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
LLM에게 특정 인물처럼 글을 쓰게 하는 여러 방법들을 테스트했더니, 생성된 글끼리는 인물별로 구분이 되지만 실제 그 사람이 쓴 글과 비교하면 여전히 남남 수준으로 다르게 나왔다. 연구팀은 저자 판별 AI 모델, LLM 심사, 문체 통계 세 가지 잣대로 50명 저자, 1000개 생성물을 측정하는 PersonalBench라는 평가 도구를 공개했다. 결론은 프롬프트로 말투를 흉내내는 방식은 한계가 있고, 진짜 그 사람처럼 쓰게 하려면 모델 자체를 다시 학습시켜야 한다는 것이다.
METAL MEDIA 해설 도표
AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
- 01문제의식: 기존 개인화 벤치마크들은 과제 정확도나 선호도만 재고, 실제로 글이 그 사람 문체와 닮았는지는 측정하지 않았다
- 02방법: 저자 판별 전용 AI 모델 LUAR, LLM을 심사관으로 쓰는 방식, 함수어·구두점 통계 분석 세 가지를 동시에 적용해 Qwen 3와 GLM-4 두 모델군으로 50명 저자당 다양한 개인화 기법(예시 제시, 프로필 추출, 대조군 제시 등)을 실험
- 03결과: 생성글끼리는 인물 구분이 잘 되지만(AUC 0.918), 실제 저자 글과 비교한 유사도는 0.484~0.508로, 아예 남남인 두 사람의 글 유사도(0.626)보다도 낮았다
- 04의외의 발견: LLM 심사관에게는 '프로필 추출' 방식이 제일 잘한 것처럼 보였지만, 이는 심사관과 생성 방식이 같은 절차를 쓰는 순환 오류였고 실제 저자 판별 모델로는 차이가 없었다
- 05한계: 두 모델 다 32B급 양자화 모델이고, 2000년대 초 블로그 글에 국한된 실험이며, LLM 심사관은 사람 평가와 아직 비교 검증되지 않았다
무엇을 했나
- 문제의식: 기존 개인화 벤치마크들은 과제 정확도나 선호도만 재고, 실제로 글이 그 사람 문체와 닮았는지는 측정하지 않았다
- 방법: 저자 판별 전용 AI 모델 LUAR, LLM을 심사관으로 쓰는 방식, 함수어·구두점 통계 분석 세 가지를 동시에 적용해 Qwen 3와 GLM-4 두 모델군으로 50명 저자당 다양한 개인화 기법(예시 제시, 프로필 추출, 대조군 제시 등)을 실험
- 결과: 생성글끼리는 인물 구분이 잘 되지만(AUC 0.918), 실제 저자 글과 비교한 유사도는 0.484~0.508로, 아예 남남인 두 사람의 글 유사도(0.626)보다도 낮았다
- 의외의 발견: LLM 심사관에게는 '프로필 추출' 방식이 제일 잘한 것처럼 보였지만, 이는 심사관과 생성 방식이 같은 절차를 쓰는 순환 오류였고 실제 저자 판별 모델로는 차이가 없었다
- 한계: 두 모델 다 32B급 양자화 모델이고, 2000년대 초 블로그 글에 국한된 실험이며, LLM 심사관은 사람 평가와 아직 비교 검증되지 않았다
| Prompt type | Non-personalized | Few-shot vs. baseline | ||
|---|---|---|---|---|
| TMR | SA% | ΔTMR | Win% | |
| Raw first sentence | 0.587 | 50% | −0.080 | 23% |
| Content summary | 0.384 | 22% | +0.049 | 33% |
| Method | LUAR ↑ | TMR ↑ | SA% ↑ | FuncCos ↑ |
|---|---|---|---|---|
| Non-Personalized | 0.484±.019 | 0.384±.058 | 22%±7 | 0.741±.011 |
| Few-Shot | 0.508±.020 | 0.433±.061 | 31%±8 | 0.749±.011 |
| Profile Extraction | 0.502±.019 | 0.542±.060 | 29%±8 | 0.761±.010 |
| Contrastive | 0.494±.020 | 0.447±.059 | 36%±8 | 0.752±.011 |
| Real Author (ceiling) | 0.756 | 0.427 | 30% | — |
| Cross-Author (floor) | 0.626 | 0.390 | 7% | — |
| LUAR | TMR | FuncCos | |
|---|---|---|---|
| LUAR | 1.00 | — | — |
| TMR | 0.013 | 1.00 | — |
| FuncCos | 0.026 | 0.067 | 1.00 |
왜 중요한가
AI 글쓰기 도우미나 챗봇을 특정 사용자 말투에 맞추는 서비스를 만들 때, 프롬프트만 잘 짜면 된다는 가정이 근본적으로 틀릴 수 있음을 보여준다. 개인화 기능을 평가할 때 그럴듯해 보이는 것과 실제로 통하는 것을 구분할 측정 기준이 필요하다는 것을 알려준다.
이 논문의 용어
- LUAR · 레딧 게시물 수백만 개로 훈련된, 두 글이 같은 사람이 썼는지 판별하는 AI 모델
- LLM-as-judge · 사람 대신 다른 언어모델이 결과물의 품질이나 특성을 평가하게 하는 방식
- AUC · 판별 성능을 나타내는 지표로 1에 가까울수록 두 그룹을 잘 구분한다는 뜻
- 인퍼런스 타임 개인화 · 모델 가중치를 다시 학습시키지 않고 입력 프롬프트만으로 특정 사람 스타일을 흉내내게 하는 방식
- 문체 통계(stylometrics) · 함수어 사용 빈도, 구두점 패턴 등 글쓴이 고유의 습관을 수치로 분석하는 방법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
METAL MEDIA 최신 기사
그림 출처: Yash Ganpat Sawant et al., arXiv:2608.19746, CC BY 4.0