nvidia/skillevaluator
给AI智能体装的'技能文件夹'做三级安检,看它安全不安全、有没有帮助
SkillEvaluator是一个开源工具,用来检查给AI智能体扩展能力的技能包,也就是包含说明和文件的文件夹。它分三个层级:先做安全和格式校验,再检测和已有技能是否重复,最后在真实智能体上运行看这个技能是否真的有用。该项目由NVIDIA开发,采用Apache 2.0许可证发布,目前处于实验性、社区支持阶段。
- agent-evaluation
- agent-security
- agent-skills
- agentic-ai
- benchmark
- claude-code
- codex
- evaluate
- evaluation
- security-scanner
- skill-eval
- skill-evals
它做什么
- 技能是遵循Agent Skills规范的文件夹,里面包含一个SKILL.md说明文件和配套资料,用来给AI智能体扩展新能力
- 第一层校验检查文件格式、个人隐私信息(PII)、许可证、质量和安全漏洞,其中多项检查不需要API密钥就能跑
- 第二层去重利用嵌入技术(把文字含义转换成数字向量)来衡量新技能和已有技能之间的重叠程度
- 第三层实时评测会在Docker、本地或云端沙箱里让真实智能体运行这个技能,观察它对智能体行为的实际影响,还能自动生成测试数据集
- 三个层级可以独立运行,并且集成了NVIDIA的安全扫描工具SkillSpector和智能体评测框架Harbor等其他开源项目
为什么重要
随意给AI智能体挂载技能文件夹可能带来隐藏的安全漏洞、个人信息泄露或重复指令拖累表现,因此在上线前需要一套标准化的检查流程。这为编写和分发技能的开发者、运营智能体流水线的团队提供了一个切实可行的质量和安全把关手段。
本仓库术语
- 技能(Agent Skill) · 遵循规范、包含SKILL.md和配套文件的文件夹,用来给AI智能体扩展新能力
- 质量关卡(Quality Gate) · 必须通过特定标准才能进入下一步的检查环节
- 嵌入(Embedding) · 把文字含义转换成数字向量,以便计算相似度的技术
- 沙箱(Sandbox) · 一个隔离的运行环境,用来安全地执行代码而不影响真实系统
- PII扫描 · 检查文档中是否包含姓名、地址等可识别个人身份的信息
仓库简介(英文)
Multi-tier framework for evaluating AI agent skills with quality gates, semantic overlap detection, synthetic evaluation dataset generation, and live agent evaluation that measures how skills affect agent behavior.
在 GitHub 打开项目主页相关报道
热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库