mental-world/mentis
장면 속 인물이 무엇을 믿고 원하는지까지 헤아려 다음 행동을 예측하는 AI
Mentis는 물리적 장면뿐 아니라 등장인물의 믿음, 욕구, 감정, 사회적 판단 같은 눈에 보이지 않는 마음 상태까지 함께 추적해 다음 행동을 예측하는 'Mental World Modeling' 프레임워크의 기준 구현체다. 별도 학습 없이 기존 LLM 위에서 동작하며, 장면 해석, 대상 인물이 실제로 보고 알 수 있는 것만 걸러내기, 후보 행동 시뮬레이션, 결과 채점까지 전 과정을 그대로 기록해 어디서 예측이 틀렸는지 짚어낼 수 있다. 함께 공개된 평가셋 Menti-Bench는 텍스트, 이미지, 영상으로 구성된 448개 시나리오로 현재 LLM들이 이런 마음 상태 추론을 얼마나 잘하는지 측정한다.
무엇을 하는 레포인가
- 기존 월드 모델은 '무엇이 어디 있는지' 같은 물리적 사실만 다루기 때문에, 몰래 옮겨진 물건을 계속 찾는 사람처럼 숨은 마음 상태가 중요한 상황에서는 잘못된 예측을 내놓는다.
- Mentis는 6단계 파이프라인으로 동작한다: 장면을 물리+마음 상태로 함께 해석하고, 대상 인물이 실제로 보고 들을 수 있는 정보만 걸러 관찰로 만들고, 각 후보 행동을 물리적 행위와 마음/사회적 효과로 나누고, 각 선택지의 결과 상태를 시뮬레이션하고, 마음 일관성·물리적 타당성·사회적 적절성 세 기준과 안전 거부권으로 채점한 뒤, LLM 바깥의 결정론적 규칙으로 최종 행동을 고른다.
- 모든 중간 결과가 기록으로 남기 때문에 예측이 틀렸을 때 상태 해석이 틀렸는지, 관찰 필터링이 새어나갔는지, 시뮬레이션이 비현실적인지, 채점이 잘못됐는지 구체적으로 짚을 수 있다.
- 짝을 이루는 평가셋 Menti-Bench는 텍스트 320개, 이미지 시퀀스 100개, 소리 있는 영상 28개로 구성되며, 오답 선택지들은 장면에서 추론 가능한 단서(믿음, 물건 상태, 약속, 규범, 타이밍 등) 중 하나를 반드시 위반하도록 설계됐다.
- 별도 파인튜닝 없이 OpenAI 호환 채팅 API로 바로 작동하며, 선택지가 4개인 샘플 하나를 처리하는 데 LLM 호출 12회가 드는 반면, 단순히 답만 내는 베이스라인은 호출 1회로 끝난다.
왜 중요한가
다른 사람의 의도, 잘못된 믿음, 사회적 규범까지 고려해야 하는 AI 에이전트나 비서를 만드는 사람들에게 직접적인 참고가 된다. 또한 연구자들에게는 LLM이 타인의 마음을 추론할 때 정확히 어느 단계에서 실패하는지 투명하게 진단할 수 있는 도구를 제공한다.
이 레포의 용어
- 월드 모델(World model) · AI가 상황이 시간에 따라 어떻게 바뀔지 예측하기 위해 갖는 내부 표현
- LLM · GPT처럼 대량의 텍스트로 학습된 대형 언어 모델
- 매크로 F1(Macro-F1) · 각 답안 범주의 성능을 동등한 비중으로 평균 낸 정확도 지표, 범주 개수가 불균형할 때 유용
- 학습 없이(Training-free) · 추가 학습이나 파인튜닝 없이 기존 모델을 그대로 활용하는 방식
- 안전 거부권(Safety veto) · 다른 점수가 좋아도 안전 기준을 통과하지 못하면 해당 행동을 선택하지 못하게 막는 규칙
레포 원문 소개 (영문)
A Baseline Implementation of Mental World Model
GitHub에서 보기관련 기사
주목받는 레포
- vorssaint/vorssaint-utils메뉴바 아이콘 하나로 유료 맥 앱 열 개 값을 대신하는 오픈소스 도구
- Alishahryar1/free-claude-code코딩 AI 에이전트를 무료 모델 49곳에 자유롭게 연결해주는 로컬 프록시
- freestylefly/awesome-gpt-image-2GPT-Image2로 원하는 이미지를 정확히 뽑아내는 프롬프트 설계도 532개를 모아놓은 저장소
- block/buzz사람과 AI 에이전트가 같은 채팅방에서 함께 일하는 오픈소스 협업 플랫폼
- NousResearch/hermes-agentNous Research가 만든, 쓰면 쓸수록 스스로 똑똑해지는 AI 에이전트 Hermes
- virgiliojr94/book-to-skill기술서 PDF를 AI 에이전트가 언제든 펼쳐볼 수 있는 '스킬'로 바꿔주는 도구
- VoltAgent/awesome-agent-skillsAI 코딩 도구가 특정 작업을 '전문가처럼' 하도록 도와주는 매뉴얼 1000개 이상을 한곳에 모았다
- anthropics/claude-plugins-community누구나 만든 Claude 확장 기능을 한곳에 모아 설치하게 해주는 저장소