컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

여러 페르소나를 가진 LLM들이 서로 토론하며 단체 여행 일정을 합의하는 시뮬레이션 틀

arXiv:2607.188062026-07-20

AI Tour Meeting: Group Travel Planning by LLM Agents

여러 페르소나를 가진 LLM들이 서로 토론하며 단체 여행 일정을 합의하는 시뮬레이션 틀

AI Tour Meeting은 서로 다른 성격과 취향을 가진 LLM 에이전트 여러 명이 대화와 투표를 반복하며 단체 여행 일정을 합의해 가는 프레임워크다. 연구팀은 Qwen3.5, GPT 계열 등 여러 모델로 시스템이 실제로 잘 작동하는지 검증하고, 참가자 간 선호 충돌 정도와 발언 순서가 회의 결과에 미치는 영향을 분석했다. 그 결과 충돌이 클수록 회의가 길어지고 만족도가 떨어지며, 먼저 말하는 참가자의 제안이 오히려 덜 받아들여지는 경향이 관찰됐다.

METAL MEDIA 해설 도표

AI Tour Meeting 회의 진행 구조

증거 상태측정 결과가 보고됨

  1. 설정 단계사용자가 전체 목표, 제약(예산·시간), 참가자 페르소나, 발언·투표 규칙을 지정해 회의를 시작한다.
  2. 대화 단계참가자가 차례로 정보 검색, 질문, 반성 등의 행동을 하며 새로운 여행 일정을 제안한다.
  3. 투표 단계제안이 나오면 나머지 참가자가 수락·거절·점수 매기기 중 하나로 투표해 채택 여부를 결정한다.
  4. 반복과 합의모든 참가자가 연속으로 현재 일정에 만족을 표시하면 회의가 끝나고, 아니면 대화-투표 단계를 반복한다.
  5. 검증·분석여러 모델로 완료율·제약위반율을 측정하고, 선호 충돌 정도와 발언 순서가 합의 과정에 미치는 영향을 분석한다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 서로 다른 이름·배경·성격·취향·목표를 가진 LLM 참가자를 만들고, 이들이 대화(정보 검색, 질문, 제안)와 투표를 오가며 하나의 여행 일정을 합의하도록 설계했다.
  2. 라운드로빈, 초대형, 진행자형 등 다양한 발언 순서 규칙과 다수결, 만장일치, 단독 결정 등 다양한 투표 규칙을 조합할 수 있게 만들어 회의 방식을 유연하게 설정할 수 있다.
  3. Qwen3.5-2B/4B/9B, gpt-oss-20b, gpt-5.4-mini 다섯 개 모델로 50개의 합성 회의를 돌려 프레임워크가 안정적으로 작동하는지 검증했다.
  4. 선호 충돌 정도(정렬됨/혼합/충돌)를 다르게 설정한 회의 50개씩을 만들어 회의 길이, 합의율, 참가자 만족도를 비교했다.
  5. 같은 회의를 참가자 좌석만 돌려가며 세 번 실행해 발언 순서가 제안 수락률에 미치는 영향을 분석했다.
Figure 1: An overview of AI Tour Meeting. The user first configures the meeting settings, including the global goals, constraints, participants, and workflow, and then starts the meeting. The meeting alternates between conversation and voting phases whenever a new itinerary is proposed. Once all participants are satisfied with the currently accepted itinerary, the meeting concludes.
Figure 1: An overview of AI Tour Meeting. The user first configures the meeting settings, including the global goals, constraints, participants, and workflow, and then starts the meeting. The meeting alternates between conversation and voting phases whenever a new itinerary is proposed. Once all participants are satisfied with the currently accepted itinerary, the meeting concludes.
Table 1: System validation results across different models and model sizes. These results suggest that our framework requires an LLM with performance comparable to or higher than Qwen3.5-4B.
ModelCompletion (%) ↑Consensus (%)Constraint err. (%) ↓Action fail. (%) ↓TurnsDuration11 1 Since meeting duration largely depends on the machine used to deploy the LLMs, these values are for reference only. (min)Tokens [K] (in / out)Usable
Qwen3.5-2B825814.21.361.572.57100 / 114
Qwen3.5-4B1001003.10.515.737.0240 / 44
Qwen3.5-9B1001000.00.112.833.6134 / 37
gpt-oss-20b1001000.40.220.411.8315 / 25
gpt-5.4-mini100800.00.134.56.3535 / 40
Figure 2: The graphical user interface of AI Tour Meeting. From left to right: the participant settings, the meeting settings, the ongoing meeting screen, and the analytics dashboard.
Figure 2: The graphical user interface of AI Tour Meeting. From left to right: the participant settings, the meeting settings, the ongoing meeting screen, and the analytics dashboard.
Table 2: Meeting results under controlled preference conflict among LLM participants.
AlignedMixedConflicting
Turns10.3±7.6012.1±9.8025.9±22.7
Proposals2.3±2.302.7±2.506.5±5.30
Consensus rate100%100%94%
Satisfaction8.93±1.478.39±1.707.13±2.06
Victim rate0.7%1.3%11.3%
Figure 4: Examples of consensus-building patterns.
Figure 4: Examples of consensus-building patterns.
Table 3: Additional system validation with Qwen3.5-9B across participant sizes M∈{3,5,10}
# ParticipantsCompletion (%) ↑Consensus (%)Constraint err. (%) ↓Action fail. (%) ↓TurnsDuration (min)Tokens [K] (in / out)Validity
M=31001000.00.112.833.6134 / 37
M=51001001.60.825.4149.3659 / 99
M=10100962.40.368.6471.53074 / 406
(b) A pattern of mediation by another participant.
(b) A pattern of mediation by another participant.

실제로 확인된 결과

  • Qwen3.5-2B를 제외한 모든 모델에서 회의 완료율(합의 또는 최대 턴 도달로 종료되면서 최소 한 개 일정이 채택된 비율)이 100%였고, 모델 성능이 좋아질수록 제약 위반율과 행동 실패율이 감소했다.
  • 선호 충돌이 클수록(정렬됨→혼합→충돌) 회의 턴 수와 제안 횟수가 늘어나 토론이 길어졌고, 합의율과 평균 만족도(1~10점)는 낮아졌으며 만족도 4점 이하인 참가자 비율(victim rate)은 높아졌다.
  • 정렬된 선호 조건에서는 발언 순서에 따른 제안 수락률 차이가 통계적으로 유의하지 않았지만, 혼합·충돌 조건에서는 두 번째와 세 번째로 말한 참가자의 제안 수락률이 첫 번째 참가자보다 유의하게 높았다.
  • 첫 번째 발언자가 수락된 제안을 낸 경우 대부분 다른 참가자에게 먼저 질문을 한 뒤였던 반면, 나중에 발언한 참가자는 질문 없이도 앞선 논의 정보를 활용해 수락되는 제안을 만드는 경우가 많았다.
  • 참가자 수를 5명, 10명으로 늘려도(Qwen3.5-9B 기준) 완료율은 100%로 유지됐고, 제약 위반율은 목적지 수 증가로 소폭 상승했지만 여전히 낮은 수준이었으며, 턴 수는 참가자 수보다 조금 더 빠르게 늘었다.
Figure 5: Proposal acceptance rates by preference conflict level and speaking position. Error bars are Wilson 95% confidence intervals on the total rate.
Figure 5: Proposal acceptance rates by preference conflict level and speaking position. Error bars are Wilson 95% confidence intervals on the total rate.

어디에 쓸 수 있나

  • 여러 명이 참여하는 단체 여행 일정 협상 과정을 사람 없이 대규모로 시뮬레이션해 그룹 추천 시스템을 자동으로 평가하는 연구 도구로 활용할 수 있다.
  • 실제 회의에 참석하지 못하는 친구나 가족을 페르소나 기반 LLM 에이전트로 대신 참여시켜, 사용자가 이들과 협의하며 일정을 조율하는 대화형 도구로 응용할 수 있다.
  • 선호 충돌이나 발언 순서가 그룹 의사결정에 미치는 영향을 연구하는 사회과학적 시뮬레이션 실험 플랫폼으로 쓸 수 있다.
Figure 6: Chat boxes for human participants.
Figure 6: Chat boxes for human participants.

한계와 남은 검증

  • 시스템 검증과 분석 예시는 Qwen3.5 계열과 GPT 계열 등 특정 모델 조합, 3~10명 규모의 참가자, 예산·시간창 등 한정된 설정에서만 이뤄져 다른 모델이나 훨씬 더 큰 그룹, 다른 여행 형태에도 결과가 그대로 적용되는지는 검증되지 않았다.
  • 프레임워크가 안정적으로 작동하려면 Qwen3.5-4B와 비슷하거나 그 이상 성능의 LLM이 필요하다고 보고돼, 더 작은 모델에서는 무효 행동(존재하지 않는 경로 언급 등)이 발생할 수 있다.
  • 코드는 NTT의 독점 라이선스로 연구 목적 사용만 허용돼 상업적 활용에는 제한이 있다.
  • 만족도 평가는 사람이 아니라 LLM 심사자가 매긴 점수에 기반하므로, 실제 사람의 만족도와 얼마나 일치하는지는 별도로 검증되지 않았다.
  • 인간 참가자가 함께 참여하는 상호작용 모드(부록 C)는 기능 설명 위주로 제시됐고, 이에 대한 별도의 정량적 검증 결과는 보고되지 않았다.
Figure 7: Input context of a participant.
Figure 7: Input context of a participant.

왜 중요한가

AI 에이전트끼리 토론시키는 방식으로 사람이 참여하기 힘든 대규모 그룹 여행 계획 실험을 자동으로, 저비용으로 반복할 수 있게 해 준다. 또한 실제 여행 계획에 참여하지 못하는 사람을 대신하는 AI 대리인으로 활용될 수 있어, 추천 시스템이나 협업 도구를 만드는 사람에게 실용적인 시사점을 준다.

이 논문의 용어

  • 페르소나 · 이름, 성격, 취향, 목표 등으로 구성된 가상의 인물 설정
  • LLM-as-a-judge · 별도의 대형언어모델을 심사자로 활용해 결과의 품질이나 만족도를 점수로 매기는 평가 방식
  • 라운드로빈 · 참가자가 정해진 순서대로 돌아가며 발언하는 규칙
  • Wilson 95% 신뢰구간 · 비율 추정치의 불확실성 범위를 계산하는 통계 방법 중 하나
  • vLLM · 대형언어모델을 서버로 빠르게 서빙하기 위한 오픈소스 도구

저자 · Daisuke Kikuta

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Daisuke Kikuta et al., arXiv:2607.18806, CC BY 4.0