여러 페르소나를 가진 LLM들이 서로 토론하며 단체 여행 일정을 합의하는 시뮬레이션 틀
여러 페르소나를 가진 LLM들이 서로 토론하며 단체 여행 일정을 합의하는 시뮬레이션 틀
AI Tour Meeting은 서로 다른 성격과 취향을 가진 LLM 에이전트 여러 명이 대화와 투표를 반복하며 단체 여행 일정을 합의해 가는 프레임워크다. 연구팀은 Qwen3.5, GPT 계열 등 여러 모델로 시스템이 실제로 잘 작동하는지 검증하고, 참가자 간 선호 충돌 정도와 발언 순서가 회의 결과에 미치는 영향을 분석했다. 그 결과 충돌이 클수록 회의가 길어지고 만족도가 떨어지며, 먼저 말하는 참가자의 제안이 오히려 덜 받아들여지는 경향이 관찰됐다.
METAL MEDIA 해설 도표
AI Tour Meeting 회의 진행 구조
증거 상태측정 결과가 보고됨
- 설정 단계사용자가 전체 목표, 제약(예산·시간), 참가자 페르소나, 발언·투표 규칙을 지정해 회의를 시작한다.
- 대화 단계참가자가 차례로 정보 검색, 질문, 반성 등의 행동을 하며 새로운 여행 일정을 제안한다.
- 투표 단계제안이 나오면 나머지 참가자가 수락·거절·점수 매기기 중 하나로 투표해 채택 여부를 결정한다.
- 반복과 합의모든 참가자가 연속으로 현재 일정에 만족을 표시하면 회의가 끝나고, 아니면 대화-투표 단계를 반복한다.
- 검증·분석여러 모델로 완료율·제약위반율을 측정하고, 선호 충돌 정도와 발언 순서가 합의 과정에 미치는 영향을 분석한다.
무엇을 했나
- 서로 다른 이름·배경·성격·취향·목표를 가진 LLM 참가자를 만들고, 이들이 대화(정보 검색, 질문, 제안)와 투표를 오가며 하나의 여행 일정을 합의하도록 설계했다.
- 라운드로빈, 초대형, 진행자형 등 다양한 발언 순서 규칙과 다수결, 만장일치, 단독 결정 등 다양한 투표 규칙을 조합할 수 있게 만들어 회의 방식을 유연하게 설정할 수 있다.
- Qwen3.5-2B/4B/9B, gpt-oss-20b, gpt-5.4-mini 다섯 개 모델로 50개의 합성 회의를 돌려 프레임워크가 안정적으로 작동하는지 검증했다.
- 선호 충돌 정도(정렬됨/혼합/충돌)를 다르게 설정한 회의 50개씩을 만들어 회의 길이, 합의율, 참가자 만족도를 비교했다.
- 같은 회의를 참가자 좌석만 돌려가며 세 번 실행해 발언 순서가 제안 수락률에 미치는 영향을 분석했다.

| Model | Completion (%) ↑ | Consensus (%) | Constraint err. (%) ↓ | Action fail. (%) ↓ | Turns | Duration11 1 Since meeting duration largely depends on the machine used to deploy the LLMs, these values are for reference only. (min) | Tokens [K] (in / out) | Usable |
|---|---|---|---|---|---|---|---|---|
| Qwen3.5-2B | 82 | 58 | 14.2 | 1.3 | 61.5 | 72.5 | 7100 / 114 | ✗ |
| Qwen3.5-4B | 100 | 100 | 3.1 | 0.5 | 15.7 | 37.0 | 240 / 44 | ✓ |
| Qwen3.5-9B | 100 | 100 | 0.0 | 0.1 | 12.8 | 33.6 | 134 / 37 | ✓ |
| gpt-oss-20b | 100 | 100 | 0.4 | 0.2 | 20.4 | 11.8 | 315 / 25 | ✓ |
| gpt-5.4-mini | 100 | 80 | 0.0 | 0.1 | 34.5 | 6.3 | 535 / 40 | ✓ |

| Aligned | Mixed | Conflicting | |
|---|---|---|---|
| Turns | 10.3±7.60 | 12.1±9.80 | 25.9±22.7 |
| Proposals | 2.3±2.30 | 2.7±2.50 | 6.5±5.30 |
| Consensus rate | 100% | 100% | 94% |
| Satisfaction | 8.93±1.47 | 8.39±1.70 | 7.13±2.06 |
| Victim rate | 0.7% | 1.3% | 11.3% |

| # Participants | Completion (%) ↑ | Consensus (%) | Constraint err. (%) ↓ | Action fail. (%) ↓ | Turns | Duration (min) | Tokens [K] (in / out) | Validity |
|---|---|---|---|---|---|---|---|---|
| M=3 | 100 | 100 | 0.0 | 0.1 | 12.8 | 33.6 | 134 / 37 | ✓ |
| M=5 | 100 | 100 | 1.6 | 0.8 | 25.4 | 149.3 | 659 / 99 | ✓ |
| M=10 | 100 | 96 | 2.4 | 0.3 | 68.6 | 471.5 | 3074 / 406 | ✓ |

실제로 확인된 결과
- Qwen3.5-2B를 제외한 모든 모델에서 회의 완료율(합의 또는 최대 턴 도달로 종료되면서 최소 한 개 일정이 채택된 비율)이 100%였고, 모델 성능이 좋아질수록 제약 위반율과 행동 실패율이 감소했다.
- 선호 충돌이 클수록(정렬됨→혼합→충돌) 회의 턴 수와 제안 횟수가 늘어나 토론이 길어졌고, 합의율과 평균 만족도(1~10점)는 낮아졌으며 만족도 4점 이하인 참가자 비율(victim rate)은 높아졌다.
- 정렬된 선호 조건에서는 발언 순서에 따른 제안 수락률 차이가 통계적으로 유의하지 않았지만, 혼합·충돌 조건에서는 두 번째와 세 번째로 말한 참가자의 제안 수락률이 첫 번째 참가자보다 유의하게 높았다.
- 첫 번째 발언자가 수락된 제안을 낸 경우 대부분 다른 참가자에게 먼저 질문을 한 뒤였던 반면, 나중에 발언한 참가자는 질문 없이도 앞선 논의 정보를 활용해 수락되는 제안을 만드는 경우가 많았다.
- 참가자 수를 5명, 10명으로 늘려도(Qwen3.5-9B 기준) 완료율은 100%로 유지됐고, 제약 위반율은 목적지 수 증가로 소폭 상승했지만 여전히 낮은 수준이었으며, 턴 수는 참가자 수보다 조금 더 빠르게 늘었다.
어디에 쓸 수 있나
- 여러 명이 참여하는 단체 여행 일정 협상 과정을 사람 없이 대규모로 시뮬레이션해 그룹 추천 시스템을 자동으로 평가하는 연구 도구로 활용할 수 있다.
- 실제 회의에 참석하지 못하는 친구나 가족을 페르소나 기반 LLM 에이전트로 대신 참여시켜, 사용자가 이들과 협의하며 일정을 조율하는 대화형 도구로 응용할 수 있다.
- 선호 충돌이나 발언 순서가 그룹 의사결정에 미치는 영향을 연구하는 사회과학적 시뮬레이션 실험 플랫폼으로 쓸 수 있다.

한계와 남은 검증
- 시스템 검증과 분석 예시는 Qwen3.5 계열과 GPT 계열 등 특정 모델 조합, 3~10명 규모의 참가자, 예산·시간창 등 한정된 설정에서만 이뤄져 다른 모델이나 훨씬 더 큰 그룹, 다른 여행 형태에도 결과가 그대로 적용되는지는 검증되지 않았다.
- 프레임워크가 안정적으로 작동하려면 Qwen3.5-4B와 비슷하거나 그 이상 성능의 LLM이 필요하다고 보고돼, 더 작은 모델에서는 무효 행동(존재하지 않는 경로 언급 등)이 발생할 수 있다.
- 코드는 NTT의 독점 라이선스로 연구 목적 사용만 허용돼 상업적 활용에는 제한이 있다.
- 만족도 평가는 사람이 아니라 LLM 심사자가 매긴 점수에 기반하므로, 실제 사람의 만족도와 얼마나 일치하는지는 별도로 검증되지 않았다.
- 인간 참가자가 함께 참여하는 상호작용 모드(부록 C)는 기능 설명 위주로 제시됐고, 이에 대한 별도의 정량적 검증 결과는 보고되지 않았다.
왜 중요한가
AI 에이전트끼리 토론시키는 방식으로 사람이 참여하기 힘든 대규모 그룹 여행 계획 실험을 자동으로, 저비용으로 반복할 수 있게 해 준다. 또한 실제 여행 계획에 참여하지 못하는 사람을 대신하는 AI 대리인으로 활용될 수 있어, 추천 시스템이나 협업 도구를 만드는 사람에게 실용적인 시사점을 준다.
이 논문의 용어
- 페르소나 · 이름, 성격, 취향, 목표 등으로 구성된 가상의 인물 설정
- LLM-as-a-judge · 별도의 대형언어모델을 심사자로 활용해 결과의 품질이나 만족도를 점수로 매기는 평가 방식
- 라운드로빈 · 참가자가 정해진 순서대로 돌아가며 발언하는 규칙
- Wilson 95% 신뢰구간 · 비율 추정치의 불확실성 범위를 계산하는 통계 방법 중 하나
- vLLM · 대형언어모델을 서버로 빠르게 서빙하기 위한 오픈소스 도구
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Daisuke Kikuta et al., arXiv:2607.18806, CC BY 4.0