K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

google-ai-edge/ai-edge-quantizer

188PythonApache-2.0

谷歌发布工具,无需重新训练就能把训练好的AI模型压缩进手机和边缘芯片

AI Edge Quantizer(AEQ)是谷歌推出的训练后压缩工具,用于把已经训练好的LiteRT(原TensorFlow Lite)模型变得更小更快,方便部署到手机CPU、GPU和NPU上。开发者可以对不同层混用不同精度,也可以只选择特定层进行压缩,还能直接测量压缩后的精度损失。该工具同时提供命令行和Python接口。

它做什么

  1. 把视觉模型、大语言模型和生成式AI流水线压缩成INT8、INT4等低比特整数格式,部署到手机CPU、GPU、NPU上
  2. 支持用正则表达式只对特定层做选择性量化,也支持混合精度,比如部分层用INT4、部分层用INT8
  3. 内置分块量化、通过Hadamard变换抑制异常值以在INT4/INT2等超低比特下保持精度,以及GPTQ、OCTAV等优化算法
  4. 提供三种量化方式:无需校准数据的动态量化、质量最好但没有速度提升的仅权重量化,以及需要校准数据、把权重和激活值都变成整数的静态量化
  5. 提供命令行工具aeq和Python API,内置MSE、SNR、余弦相似度、KL散度等误差校验,并能与Model Explorer配合可视化量化效果

为什么重要

训练后量化是让大模型在手机等资源受限设备上落地的关键方法之一,且不需要承担重新训练的成本。分层选择压缩和内置精度校验功能,让开发者在实际部署包括最新大语言模型时更容易权衡速度与精度。

本仓库术语

  • 训练后量化(PTQ) · 模型训练完成后,不重新训练,直接把数值转成低比特格式来压缩模型
  • LiteRT · 谷歌面向移动和边缘设备的AI运行时,前身叫TensorFlow Lite
  • NPU · 专门用于加速AI运算的芯片
  • 静态量化与校准 · 用样本数据先跑一遍模型收集统计信息,再把权重和激活值都转成整数的量化方式
  • GPTQ、OCTAV · 用于减少量化带来精度损失的优化算法

仓库简介(英文)

AI Edge Quantizer: flexible post training quantization for LiteRT models.

所属 · google-deepmind

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道