K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

google-ai-edge/eval

9PythonApache-2.0

谷歌发布了一款能用同一套标准评测端侧AI模型的命令行工具

ai-edge-eval是谷歌推出的命令行评测工具,可以用同一套流程测试LiteRT LM模型(谷歌为端侧设备设计的轻量模型格式)和HuggingFace等常规模型。它借助lm-eval、lighteval这两个现成的评测框架,运行ifeval、mmlu、piqa、mmmu等纯文本及图文结合的基准测试。用户还可以注册自己的数据集和评分函数来创建自定义评测任务。

它做什么

  1. 提供一个统一的命令行工具,同时评测LiteRT LM模型和HuggingFace等原生模型
  2. 支持lm-eval和lighteval两种评测框架后端,涵盖纯文本和多模态(图像+文本)任务
  3. 提供--limit和--sample-range参数,可以只跑一小部分样本做快速调试
  4. 只需提供JSON Lines格式的数据集和一个Python评分函数,就能注册自定义评测任务
  5. 支持Linux、macOS和WSL2环境,以Apache 2.0许可证开源发布

为什么重要

这为开发端侧小型语言模型的团队提供了一个统一衡量模型性能的标准工具。同时也提醒用户,各个基准数据集有各自独立的许可条款,使用前需要自行确认。

本仓库术语

  • LiteRT LM · 谷歌为端侧设备运行设计的轻量语言模型格式
  • lm-eval · EleutherAI开发的语言模型基准评测工具
  • lighteval · HuggingFace生态下的另一款评测框架
  • 多模态(multimodal) · 同时接收图像和文本作为输入的处理方式
  • JSON Lines(.jsonl) · 每行存放一个JSON对象的数据文件格式

仓库简介(英文)

google-ai-edge/eval

所属 · google-deepmind

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道