google-ai-edge/eval
谷歌发布了一款能用同一套标准评测端侧AI模型的命令行工具
ai-edge-eval是谷歌推出的命令行评测工具,可以用同一套流程测试LiteRT LM模型(谷歌为端侧设备设计的轻量模型格式)和HuggingFace等常规模型。它借助lm-eval、lighteval这两个现成的评测框架,运行ifeval、mmlu、piqa、mmmu等纯文本及图文结合的基准测试。用户还可以注册自己的数据集和评分函数来创建自定义评测任务。
它做什么
- 提供一个统一的命令行工具,同时评测LiteRT LM模型和HuggingFace等原生模型
- 支持lm-eval和lighteval两种评测框架后端,涵盖纯文本和多模态(图像+文本)任务
- 提供--limit和--sample-range参数,可以只跑一小部分样本做快速调试
- 只需提供JSON Lines格式的数据集和一个Python评分函数,就能注册自定义评测任务
- 支持Linux、macOS和WSL2环境,以Apache 2.0许可证开源发布
为什么重要
这为开发端侧小型语言模型的团队提供了一个统一衡量模型性能的标准工具。同时也提醒用户,各个基准数据集有各自独立的许可条款,使用前需要自行确认。
本仓库术语
- LiteRT LM · 谷歌为端侧设备运行设计的轻量语言模型格式
- lm-eval · EleutherAI开发的语言模型基准评测工具
- lighteval · HuggingFace生态下的另一款评测框架
- 多模态(multimodal) · 同时接收图像和文本作为输入的处理方式
- JSON Lines(.jsonl) · 每行存放一个JSON对象的数据文件格式
仓库简介(英文)
google-ai-edge/eval
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库