K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

i3T4AN/KADATH

52PythonApache-2.0

一个让AI智能体像生物一样竞争进化、逐代逼近目标的开源运行时

KADATH接收用户设定的目标后,会生成一批AI智能体,在每一轮用同一套固定评分标准打分,保留表现好的、淘汰表现差的,从而逐代培育出更擅长完成目标的智能体。被进化的不只是提示词,而是智能体的完整框架,包括Python代码、工具和依赖声明,而负责执行、评分和选拔的内核本身并不参与进化。在其公开的十代实验中,前五名的中位分从8分升到77分,最高分从18分升到91分。

它做什么

  1. 用户输入目标、每代运行时长、种群规模和代数后,专门的Architect模型会设计评分基准,需经用户确认批准才会开始运行
  2. 每个智能体在独立的Docker容器中运行,其代码以只读方式挂载,期间记录活动日志,并须在固定截止时间内产出结果
  3. 每代结束后Grader依据冻结的证据打分,排名前30%原样保留,中间群体自行决定是否变异,末位群体被淘汰并由新智能体替补
  4. Tweaker分析优胜个体的有效特征并给出繁殖方案,Birther据此生成新的子代智能体(genome)以补满下一代种群
  5. 在公开的十代实验中,前五名智能体的最高分从18升到91,中位分从8升到77,最低分从1升到71

为什么重要

它展示了一种通过反复竞争与选拔来提升AI智能体质量的具体方法,而不是把所有筹码押在单一提示词或单一智能体设计上。其详尽的评分、隔离、谱系管理和恢复机制,也为需要可复现实验框架的研究者和工程实践者提供了参考。

本仓库术语

  • genome · 智能体的系统提示词、代码、工具和依赖构成的完整可进化整体
  • epoch · 一代智能体种群执行目标并被评分的一个完整周期
  • Architect/Grader/Tweaker/Birther · 分别负责设计评分标准、打分、分析优胜个体、生成新智能体的专职模型角色
  • fitness · 依据固定评分标准得出的智能体表现分数

仓库简介(英文)

Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道