컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

mental-world/mentis

37PythonMIT

장면 속 인물이 무엇을 믿고 원하는지까지 헤아려 다음 행동을 예측하는 AI

Mentis는 물리적 장면뿐 아니라 등장인물의 믿음, 욕구, 감정, 사회적 판단 같은 눈에 보이지 않는 마음 상태까지 함께 추적해 다음 행동을 예측하는 'Mental World Modeling' 프레임워크의 기준 구현체다. 별도 학습 없이 기존 LLM 위에서 동작하며, 장면 해석, 대상 인물이 실제로 보고 알 수 있는 것만 걸러내기, 후보 행동 시뮬레이션, 결과 채점까지 전 과정을 그대로 기록해 어디서 예측이 틀렸는지 짚어낼 수 있다. 함께 공개된 평가셋 Menti-Bench는 텍스트, 이미지, 영상으로 구성된 448개 시나리오로 현재 LLM들이 이런 마음 상태 추론을 얼마나 잘하는지 측정한다.

무엇을 하는 레포인가

  1. 기존 월드 모델은 '무엇이 어디 있는지' 같은 물리적 사실만 다루기 때문에, 몰래 옮겨진 물건을 계속 찾는 사람처럼 숨은 마음 상태가 중요한 상황에서는 잘못된 예측을 내놓는다.
  2. Mentis는 6단계 파이프라인으로 동작한다: 장면을 물리+마음 상태로 함께 해석하고, 대상 인물이 실제로 보고 들을 수 있는 정보만 걸러 관찰로 만들고, 각 후보 행동을 물리적 행위와 마음/사회적 효과로 나누고, 각 선택지의 결과 상태를 시뮬레이션하고, 마음 일관성·물리적 타당성·사회적 적절성 세 기준과 안전 거부권으로 채점한 뒤, LLM 바깥의 결정론적 규칙으로 최종 행동을 고른다.
  3. 모든 중간 결과가 기록으로 남기 때문에 예측이 틀렸을 때 상태 해석이 틀렸는지, 관찰 필터링이 새어나갔는지, 시뮬레이션이 비현실적인지, 채점이 잘못됐는지 구체적으로 짚을 수 있다.
  4. 짝을 이루는 평가셋 Menti-Bench는 텍스트 320개, 이미지 시퀀스 100개, 소리 있는 영상 28개로 구성되며, 오답 선택지들은 장면에서 추론 가능한 단서(믿음, 물건 상태, 약속, 규범, 타이밍 등) 중 하나를 반드시 위반하도록 설계됐다.
  5. 별도 파인튜닝 없이 OpenAI 호환 채팅 API로 바로 작동하며, 선택지가 4개인 샘플 하나를 처리하는 데 LLM 호출 12회가 드는 반면, 단순히 답만 내는 베이스라인은 호출 1회로 끝난다.

왜 중요한가

다른 사람의 의도, 잘못된 믿음, 사회적 규범까지 고려해야 하는 AI 에이전트나 비서를 만드는 사람들에게 직접적인 참고가 된다. 또한 연구자들에게는 LLM이 타인의 마음을 추론할 때 정확히 어느 단계에서 실패하는지 투명하게 진단할 수 있는 도구를 제공한다.

이 레포의 용어

  • 월드 모델(World model) · AI가 상황이 시간에 따라 어떻게 바뀔지 예측하기 위해 갖는 내부 표현
  • LLM · GPT처럼 대량의 텍스트로 학습된 대형 언어 모델
  • 매크로 F1(Macro-F1) · 각 답안 범주의 성능을 동등한 비중으로 평균 낸 정확도 지표, 범주 개수가 불균형할 때 유용
  • 학습 없이(Training-free) · 추가 학습이나 파인튜닝 없이 기존 모델을 그대로 활용하는 방식
  • 안전 거부권(Safety veto) · 다른 점수가 좋아도 안전 기준을 통과하지 못하면 해당 행동을 선택하지 못하게 막는 규칙

레포 원문 소개 (영문)

A Baseline Implementation of Mental World Model

GitHub에서 보기

관련 기사

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사