i3T4AN/KADATH
AI 에이전트를 목표에 맞춰 여러 세대에 걸쳐 경쟁시켜 진화시키는 오픈소스 런타임
KADATH는 사용자가 목표를 입력하면 여러 AI 에이전트(organism)를 만들어 같은 기준으로 채점하고, 잘한 것은 남기고 못한 것은 도태시키며 다음 세대를 낳는 방식으로 점점 더 목표를 잘 달성하는 에이전트를 만들어낸다. 각 에이전트는 시스템 프롬프트뿐 아니라 파이썬 코드, 도구, 의존성까지 통째로 진화 대상이 되고, 실행·채점·선발을 담당하는 커널은 진화하지 않고 규칙을 고정한 채 실행만 관리한다. 저장소가 공개한 10세대 실험에서 상위권 점수 중앙값이 8점에서 77점으로, 최고점은 18점에서 91점으로 올랐다.
무엇을 하는 레포인가
- 목표와 세대 수, 개체군 크기, 세대당 제한 시간을 입력하면 Architect라는 전담 모델이 채점 기준(벤치마크)을 만들고 사용자가 승인해야 실행이 시작된다
- 각 에이전트는 격리된 도커 컨테이너에서 읽기 전용으로 마운트된 자기 코드로 실행되며, 작업 결과와 활동 기록을 남긴 뒤 정해진 시간 안에 끝내야 한다
- 세대가 끝나면 Grader가 증거를 기반으로 채점하고, 상위 30%는 그대로 보존, 중간 그룹은 스스로 변이 여부를 결정, 하위 그룹은 도태되고 새 에이전트로 대체된다
- Tweaker가 우수 개체의 특징을 분석해 번식 방침을 제시하고 Birther가 그 방침에 따라 새 에이전트(자식 genome)를 낳아 다음 세대 개체군을 채운다
- 10세대 실험에서 상위 5개 에이전트의 최고 점수가 18에서 91로, 중앙값이 8에서 77로, 최저 점수가 1에서 71로 상승했다
왜 중요한가
목표만 던져주면 AI가 스스로 개선을 반복해 점점 더 목표에 맞는 에이전트를 만들어내는 실험적 틀이라, 프롬프트 하나에 의존하는 대신 경쟁과 선발로 결과물의 질을 끌어올리는 방법을 보여준다. 채점, 격리, 계보 관리, 복구 절차를 세세히 갖춰 재현 가능한 실험 환경을 원하는 연구자나 실무자에게 참고가 될 수 있다.
이 레포의 용어
- genome · 에이전트의 시스템 프롬프트, 코드, 도구, 의존성을 모두 포함한 진화 대상 전체 묶음
- epoch · 한 세대의 에이전트들이 목표를 수행하고 채점받는 한 번의 실행 주기
- Architect/Grader/Tweaker/Birther · 각각 채점 기준 설계, 채점, 우수 개체 분석, 새 에이전트 생성을 맡는 전담 모델 역할
- fitness · 채점 기준에 따라 매겨지는 에이전트의 성과 점수
레포 원문 소개 (영문)
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
GitHub에서 보기주목받는 레포
- vorssaint/vorssaint-utils메뉴바 아이콘 하나로 유료 맥 앱 열 개 값을 대신하는 오픈소스 도구
- Alishahryar1/free-claude-code코딩 AI 에이전트를 무료 모델 49곳에 자유롭게 연결해주는 로컬 프록시
- freestylefly/awesome-gpt-image-2GPT-Image2로 원하는 이미지를 정확히 뽑아내는 프롬프트 설계도 532개를 모아놓은 저장소
- block/buzz사람과 AI 에이전트가 같은 채팅방에서 함께 일하는 오픈소스 협업 플랫폼
- NousResearch/hermes-agentNous Research가 만든, 쓰면 쓸수록 스스로 똑똑해지는 AI 에이전트 Hermes
- virgiliojr94/book-to-skill기술서 PDF를 AI 에이전트가 언제든 펼쳐볼 수 있는 '스킬'로 바꿔주는 도구
- VoltAgent/awesome-agent-skillsAI 코딩 도구가 특정 작업을 '전문가처럼' 하도록 도와주는 매뉴얼 1000개 이상을 한곳에 모았다
- anthropics/claude-plugins-community누구나 만든 Claude 확장 기능을 한곳에 모아 설치하게 해주는 저장소