i3T4AN/KADATH
一个让AI智能体像生物一样竞争进化、逐代逼近目标的开源运行时
KADATH接收用户设定的目标后,会生成一批AI智能体,在每一轮用同一套固定评分标准打分,保留表现好的、淘汰表现差的,从而逐代培育出更擅长完成目标的智能体。被进化的不只是提示词,而是智能体的完整框架,包括Python代码、工具和依赖声明,而负责执行、评分和选拔的内核本身并不参与进化。在其公开的十代实验中,前五名的中位分从8分升到77分,最高分从18分升到91分。
它做什么
- 用户输入目标、每代运行时长、种群规模和代数后,专门的Architect模型会设计评分基准,需经用户确认批准才会开始运行
- 每个智能体在独立的Docker容器中运行,其代码以只读方式挂载,期间记录活动日志,并须在固定截止时间内产出结果
- 每代结束后Grader依据冻结的证据打分,排名前30%原样保留,中间群体自行决定是否变异,末位群体被淘汰并由新智能体替补
- Tweaker分析优胜个体的有效特征并给出繁殖方案,Birther据此生成新的子代智能体(genome)以补满下一代种群
- 在公开的十代实验中,前五名智能体的最高分从18升到91,中位分从8升到77,最低分从1升到71
为什么重要
它展示了一种通过反复竞争与选拔来提升AI智能体质量的具体方法,而不是把所有筹码押在单一提示词或单一智能体设计上。其详尽的评分、隔离、谱系管理和恢复机制,也为需要可复现实验框架的研究者和工程实践者提供了参考。
本仓库术语
- genome · 智能体的系统提示词、代码、工具和依赖构成的完整可进化整体
- epoch · 一代智能体种群执行目标并被评分的一个完整周期
- Architect/Grader/Tweaker/Birther · 分别负责设计评分标准、打分、分析优胜个体、生成新智能体的专职模型角色
- fitness · 依据固定评分标准得出的智能体表现分数
仓库简介(英文)
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库